Relari (YC W24) logo

Relari (YC W24)Plateforme de test, de notation et de génération de données synthétiques pour les agents IA.

4.3 (6)
Daniel NikulshynÉvalué par Daniel Nikulshyn·Mis à jour juillet 2026

Aperçu

Relari est une plate-forme de développement axée sur l'amélioration de la fiabilité des agents d'intelligence artificielle grâce à des tests et des évaluations systématiques. Elle aide les équipes à générer des jeux de données synthétiques, à exécuter des évaluations automatisées et à évaluer les performances des agents dans des scénarios réalistes avant leur mise en production. Soutenu par Y Combinator (W24), Relari cible les équipes d'ingénieurs qui développent des applications LLM complexes et des agents multi-étapes où les tests QA traditionnels sont insuffisants. Ses outils visent à apporter une rigueur d'ingénierie logiciel — tests unitaires, contrôles de régression et métriques mesurables — aux systèmes d'IA non déterministes. La plateforme prend en charge des évaluateurs personnalisés, la simulation de scénarios et la surveillance continue, ce qui la rend utile à la fois pour la validation avant lancement et pour l'assurance qualité continue des agents de production.

Fonctionnalités clés

  • Génération de données de séries synthétiques
  • Agrégation de pipelines d'évaluation automatique
  • Simulation de scénarios et de conversations
  • Métriques d'évaluation personnalisables
  • Contrôle de regression pour les applications LLM
  • Évaluation et rapportage de performances
  • Évaluation de performances et de reporting

Tarifs

Modèle
Free
Catégorie
Observabilité
Note
4.3 / 5 (6)

Cas d’usage

Test des agents IA

Évaluation fiable et vérifiable des agents IA.

Pour & contre

Pour

  • Conçus à des fins spécifiques pour évaluer les agents IA multi-étapes
  • Génere des données de test synthétiques à grande échelle
  • Soutient des métriques et des évaluateurs personnalisés
  • Appuyé par Y Combinator avec développement actif
  • Evolue constamment avec Y Combinator

Contre

  • Principalement conçu pour les équipes techniques, et non pour les non-développeurs
  • Plateforme plus récente avec un ensemble de fonctionnalités en évolution
  • Peut nécessiter le travail d'intégration pour s'intégrer aux stocks existants

Palmarès des batailles

Sur 3 batailles dans le Panthéon.

0
1ᵉʳ
0
2ᵉ
0
3ᵉ

Last 3 battles

Avis

4.3

Moyenne sur 6 avis.

5
2
4
4
3
0
2
0
1
0

Connecte-toi pour laisser un avis.

Fatima Zahra

Fatima Zahra

Apr 4, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on customizable evaluation metrics, and purpose-built for evaluating multi-step AI agents caught me off guard. still, I'd recommend giving it a real trial.

Robert Ainsworth

Robert Ainsworth

Mar 17, 2026

Solid for our team

We rolled this out across the team last quarter and supports custom metrics and evaluators. Customizable evaluation metrics fits neatly into how we already work, and customizable evaluation metrics removed a step we used to do by hand. Primarily aimed at technical teams, not non-developers, which is the main caveat, but it has held up under daily use.

DW

Devin Walker

Feb 6, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on performance benchmarking and reporting, and supports custom metrics and evaluators caught me off guard. Primarily aimed at technical teams, not non-developers is why this isn't a perfect score, still, I'd recommend giving it a real trial.

Carlos Mendoza

Carlos Mendoza

Jul 20, 2025

Compared a few options

Evaluated this against two competitors. Where it wins: scenario and conversation simulation and purpose-built for evaluating multi-step AI agents. Where it lags: may require integration work to fit existing stacks. On balance the feature set — especially scenario and conversation simulation — justifies the 5 stars for our use case.

Yuki Mori

Yuki Mori

Jul 19, 2025

Use it every day

Honestly didn't expect to like it this much. Performance benchmarking and reporting is exactly what I needed, and purpose-built for evaluating multi-step AI agents. I do wish may require integration work to fit existing stacks, but I reach for it almost every day now and it just clicks.

Leila Hassan

Leila Hassan

Jul 14, 2025

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on regression testing for LLM apps, and supports custom metrics and evaluators caught me off guard. May require integration work to fit existing stacks is why this isn't a perfect score, still, I'd recommend giving it a real trial.

Questions & réponses

Quels sont les avantages de l'utilisation de Relari?

Relari est conçu pour évaluer des agents AI multi-étapes, génère des données de test synthétiques à grande échelle, et prend en charge des métriques et évaluateurs personnalisés, ce service est activement développé par Y Combinator.

Asked by Anya Sokolova · Jun 27, 2026

Est-ce que Relari convient aux équipes non techniques?

Relari vise principalement les équipes techniques et non les non-développeurs, peut nécessiter un travail d'intégration pour s'adapter à des stack existants.

Asked by Hasan Demir · May 27, 2026

Quelles fonctionnalités supporte Relari?

Relari supporte des fonctionnalités comme la génération de jeux de données synthétiques, des pipelines d'évaluation automatisés et des scénarios de simulation, ainsi que des métriques d'évaluation personnalisables.

Asked by Marisol Pena · Apr 17, 2026

Pour quel usage utilise-t-on Relari?

Relari est une plateforme de test, d'évaluation et de génération de données synthétiques pour les agents AI, aidant les équipes à améliorer leur fiabilité grâce à des essais et des évaluations systématiques.

Asked by Hana Kobayashi · Mar 25, 2026

Poser une question

Alternatives à Observabilité