Relari (YC W24) logo

Relari (YC W24)Plattform för testning, utvärdering och generering av simulat data för AI-kontroller

4.3 (6)
Daniel NikulshynGranskat av Daniel Nikulshyn·Uppdaterad juli 2026

Översikt

Relari är en utvecklarplattform som fokuserar på att förbättra tillförlitligheten hos AI-agenter genom systematisk testning och utvärdering. Plattformen hjälper team att generera syntetiska datasätt, köra automatiserade utvärderingar och mäta agentprestanda över realistiska scenarier innan det skickas till produktion. Backad av Y Combinator (W24), tar Relari sikte på datateam som bygger komplexa LLM-applikationer och flerstegsagenter där traditionell QA inte räcker till. Verktygen syftar till att föra in programvaruutvecklingsrigor – enhets tester, regresjonstest och mätbara mått – i icke-deterministiska system för AI. Plattformen stödjer anpassade utvärderare, scenario-simulering och kontinuerligt övervakning, vilket gör det användbart för både validering före lansering och pågående kvalitetsassuran av produktionsagenter.

Nyckelfunktioner

  • Generering av simulat dataposter
  • Automatiserade pipelines för att utvärdera agenter
  • Scenario- och konversationsSimulering
  • Anpassbara utvärderingsmetrikanalyser
  • Regresstestning för LLM-program
  • Prestandajämförelse och rapportering

Priser

Modell
Free
Betyg
4.3 / 5 (6)

Användningsfall

Testning av AI-kontroller

Reliabla och testbara utvärdering av AI-kontroller.

Fördelar och nackdelar

Fördelar

  • Avsett för att utvärdera flerstegs AI-kontroller
  • Genererar simulat testdata på stor skala
  • Stödjer anpassbara metrikanalyser och utvärderare
  • Har stöd av Y Combinator med aktiv utveckling

Nackdelar

  • Är främst inriktat på tekniska team, inte icke-utvecklare
  • Ny plattform med ett utvecklande funktionssätt
  • Kan kräva integrationsarbete för att passa befintliga stak

Stridsrekord

I 3 strider i Pantheon.

0
1:a
0
2:a
0
3:e

Last 3 battles

Recensioner

4.3

Genomsnitt från 6 betyg.

5
2
4
4
3
0
2
0
1
0

Logga in för att lämna en recension.

Fatima Zahra

Fatima Zahra

Apr 4, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on customizable evaluation metrics, and purpose-built for evaluating multi-step AI agents caught me off guard. still, I'd recommend giving it a real trial.

Robert Ainsworth

Robert Ainsworth

Mar 17, 2026

Solid for our team

We rolled this out across the team last quarter and supports custom metrics and evaluators. Customizable evaluation metrics fits neatly into how we already work, and customizable evaluation metrics removed a step we used to do by hand. Primarily aimed at technical teams, not non-developers, which is the main caveat, but it has held up under daily use.

DW

Devin Walker

Feb 6, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on performance benchmarking and reporting, and supports custom metrics and evaluators caught me off guard. Primarily aimed at technical teams, not non-developers is why this isn't a perfect score, still, I'd recommend giving it a real trial.

Carlos Mendoza

Carlos Mendoza

Jul 20, 2025

Compared a few options

Evaluated this against two competitors. Where it wins: scenario and conversation simulation and purpose-built for evaluating multi-step AI agents. Where it lags: may require integration work to fit existing stacks. On balance the feature set — especially scenario and conversation simulation — justifies the 5 stars for our use case.

Yuki Mori

Yuki Mori

Jul 19, 2025

Use it every day

Honestly didn't expect to like it this much. Performance benchmarking and reporting is exactly what I needed, and purpose-built for evaluating multi-step AI agents. I do wish may require integration work to fit existing stacks, but I reach for it almost every day now and it just clicks.

Leila Hassan

Leila Hassan

Jul 14, 2025

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on regression testing for LLM apps, and supports custom metrics and evaluators caught me off guard. May require integration work to fit existing stacks is why this isn't a perfect score, still, I'd recommend giving it a real trial.

Frågor

Vilka är fördelarna med att använda Relari?

Relari är byggd specifikt för att utvärdera flerstegiga AI‑agenter, genererar syntetisk testdata i skala och stödjer anpassade metrik och evaluators, med aktiv utveckling stödd av Y Combinator.

Asked by Anya Sokolova · Jun 27, 2026

Är Relari lämplig för icke‑tekniska team?

Relari är främst inriktad på tekniska team, inte på icke‑utvecklare, och kan kräva integrationsarbete för att passa in i befintliga stackar.

Asked by Hasan Demir · May 27, 2026

Vilka funktioner stödjer Relari?

Relari stödjer funktioner som syntetisk dataset‑generering, automatiserade utvärderings‑pipelines för agenter, scenariouppbyggnad och anpassningsbara utvärderings‑metrik.

Asked by Marisol Pena · Apr 17, 2026

Vad används Relari till?

Relari är en plattform för testning, utvärdering och syntetisk data‑generering för AI‑agenter, som hjälper team att förbättra deras tillförlitlighet genom systematisk testning och utvärdering.

Asked by Hana Kobayashi · Mar 25, 2026

Ställ en fråga

Alternativ till Observabilitet