Relari (YC W24)Platformă de testare, evaluare și generare de date sintetice pentru agenți AI
Prezentare
Funcții cheie
- Generarea de seturi de date sintetice
- Pipelines de evaluare automate pentru agenți
- Simularea de scenarii și conversații
- Metrici de evaluare personalizabile
- Testare de regresie pentru aplicații LLM
- Evaluarea performanței și raportare
Prețuri
- Model
- Free
- Categorie
- Observabilitate
- Evaluare
- 4.3 / 5 (6)
Cazuri de utilizare
Testarea agenților AI
Evaluarea agenților fiabili și testabili pentru agenți AI.
Pro și contra
Pro
- Conceput special pentru evaluarea agenților AI multi-pași
- Generează date de testare sintetice la scară
- Suportă metrici și evaluatori personalizați
- Sprijinit de Y Combinator cu dezvoltare activă
Contra
- Orientat în principal către echipele tehnice, nu către non-dezvoltatori
- Platformă mai nouă cu un set de caracteristici în evoluție
- Poate necesita lucrări de integrare pentru a se potrivi cu stivele existente
Record de bătălii
În 3 bătălii din Panteon.
Last 3 battles
Recenzii
Medie din 6 evaluări.
Conectează-te pentru a lăsa o recenzie.
Skeptical, then convinced
I went in skeptical — most tools in this space overpromise. It actually delivers on customizable evaluation metrics, and purpose-built for evaluating multi-step AI agents caught me off guard. still, I'd recommend giving it a real trial.
Solid for our team
We rolled this out across the team last quarter and supports custom metrics and evaluators. Customizable evaluation metrics fits neatly into how we already work, and customizable evaluation metrics removed a step we used to do by hand. Primarily aimed at technical teams, not non-developers, which is the main caveat, but it has held up under daily use.
Skeptical, then convinced
I went in skeptical — most tools in this space overpromise. It actually delivers on performance benchmarking and reporting, and supports custom metrics and evaluators caught me off guard. Primarily aimed at technical teams, not non-developers is why this isn't a perfect score, still, I'd recommend giving it a real trial.
Compared a few options
Evaluated this against two competitors. Where it wins: scenario and conversation simulation and purpose-built for evaluating multi-step AI agents. Where it lags: may require integration work to fit existing stacks. On balance the feature set — especially scenario and conversation simulation — justifies the 5 stars for our use case.
Use it every day
Honestly didn't expect to like it this much. Performance benchmarking and reporting is exactly what I needed, and purpose-built for evaluating multi-step AI agents. I do wish may require integration work to fit existing stacks, but I reach for it almost every day now and it just clicks.
Skeptical, then convinced
I went in skeptical — most tools in this space overpromise. It actually delivers on regression testing for LLM apps, and supports custom metrics and evaluators caught me off guard. May require integration work to fit existing stacks is why this isn't a perfect score, still, I'd recommend giving it a real trial.
Întrebări
Care sunt avantajele utilizării Relari?
Relari este conceput special pentru evaluarea agenților AI multi-etape, generează date de testare sintetice la scară largă și suportă metrici și evaluatoare personalizate, cu dezvoltare activă susținută de Y Combinator.
Asked by Anya Sokolova · Jun 27, 2026
Este Relari potrivit pentru echipe ne-tehnice?
Relari este în principal destinat echipelor tehnice, nu dezvoltatorilor ne-experți, și poate necesita muncă de integrare pentru a se potrivi cu stivele existente.
Asked by Hasan Demir · May 27, 2026
Ce funcționalități suportă Relari?
Relari suportă funcționalități precum generarea de seturi de date sintetice, pipeline-uri automate de evaluare a agenților, simulare de scenarii și metrici de evaluare personalizabile.
Asked by Marisol Pena · Apr 17, 2026
Pentru ce se folosește Relari?
Relari este o platformă pentru testare, evaluare și generare de date sintetice pentru agenți AI, ajutând echipele să-și îmbunătățească fiabilitatea prin testare și evaluare sistematică.
Asked by Hana Kobayashi · Mar 25, 2026
Pune o întrebare
Alternative la Observabilitate

Platformă unificată pentru dezvoltatori pentru construirea, monitorizarea și scalarea aplicațiilor LLM.

Platformă de securitate și guvernanță pentru agenți AI autonomi și sisteme inteligente.

Plataformă de evaluare, monitorizare și îmbunătățirea agentilor AI

Monitorizați cum marca dvs. apare pe ChatGPT, Claude, Perplexity și Google AI Overviews.

Un constructor de fluxuri de lucru AI fără cod care permite afacerilor să automatizeze operațiuni prin integrarea mai multor modele de limbaj mari (LLM) și conectarea prompt-urilor

Creează, evalua și îmbunătățesc agentele AI pentru automizare a activităților de afaceri
Platformă de observabilitate all-in-one pentru monitorizarea, depanarea și îmbunătățirea aplicațiilor LLM de producție.

Agent AI pentru operațiuni IT care accelerează detectarea, trierea și rezolvarea incidentelor.
Trending now

API de inteligență documentară care parsează, despartă, aplică OCR și extrage date structurate din PDF-uri complexe, diapozitive și foi de calcul.

Răspunsuri sponsorizate, plătite per click.

Astfel, îi ajutăm pe acțiuni de ultima minute. Salvează locul tuturor, ajutor pentru studii și examene.

Model multimodal deschis de 12B care gestionează imagini și text întrețesute cu o fereastră de context de 128K.
