Relari (YC W24) logo

Relari (YC W24)Πλατφόρμα δοκιμών, αξιολόγησης και δημιουργίας συνθετικών δεδομένων για AI agents.

4.3 (6)
Daniel NikulshynΑξιολογήθηκε από Daniel Nikulshyn·Ενημερώθηκε Ιούλιος 2026

Επισκόπηση

Η Relari είναι μια πλατφόρμα για προγραμματιστές που εστιάζει στη βελτίωση της αξιοπιστίας των AI agents μέσω συστηματικού testing και αξιολόγησης. Βοηθά τις ομάδες να δημιουργούν συνθετικά σύνολα δεδομένων, να εκτελούν αυτοματοποιημένες αξιολογήσεις και να benchmark την απόδοση των agents σε ρεαλιστικά σενάρια πριν τα μεταφέρουν στην παραγωγή. Υποστηριζόμενο από το Y Combinator (W24), το Relari στοχεύει σε ομάδες μηχανικών που δημιουργούν σύνθετες εφαρμογές LLM και πολυβηματικούς πράκτορες, όπου η παραδοσιακή QA αποτυγχάνει. Το εργαλείο του αποσκοπεί να φέρει την αυστηρότητα της μηχανικής λογισμικού — unit tests, regression checks και μετρήσιμα metrics — στα μη‑ντετερμινιστικά συστήματα AI. Η πλατφόρμα υποστηρίζει προσαρμοσμένους αξιολογητές, προσομοίωση σεναρίων και συνεχή παρακολούθηση, καθιστώντας την χρήσιμη τόσο για την επαλήθευση πριν την κυκλοφορία όσο και για τη συνεχή διασφάλιση ποιότητας των παραγωγικών πρακτόρων.

Βασικές λειτουργίες

  • Δημιουργία συνθετικών συνόλων δεδομένων
  • Αυτοματοποιημένες ροές αξιολόγησης πρακτόρων
  • Προσομοίωση σεναρίων και συζητήσεων
  • Προσαρμόσιμες μετρικές αξιολόγησης
  • Δοκιμές παλινδρόμησης για εφαρμογές LLM
  • Βαθμονόμηση απόδοσης και αναφορά

Τιμές

Μοντέλο
Free
Βαθμολογία
4.3 / 5 (6)

Περιπτώσεις χρήσης

Δοκιμή AI agents

Αξιόπιστη και δοκιμαστέα αξιολόγηση πρακτόρων για AI agents.

Υπέρ και κατά

Υπέρ

  • Σχεδιασμένο ειδικά για αξιολόγηση πολυ-βηματικών AI agents
  • Δημιουργεί συνθετικά δεδομένα δοκιμών σε κλίμακα
  • Υποστηρίζει προσαρμοσμένες μετρικές και αξιολογητές
  • Υποστηρίζεται από το Y Combinator με ενεργή ανάπτυξη

Κατά

  • Κυρίως στοχεύει σε τεχνικές ομάδες, όχι σε μη προγραμματιστές
  • Νέα πλατφόρμα με εξελισσόμενο σύνολο λειτουργιών
  • Μπορεί να απαιτήσει εργασίες ενσωμάτωσης για προσαρμογή σε υπάρχουσες υποδομές

Ρεκόρ μαχών

Σε 3 μάχες στο Πάνθεον.

0
1ος
0
2ος
0
3ος

Last 3 battles

Κριτικές

4.3

Μέσος όρος από 6 βαθμολογίες.

5
2
4
4
3
0
2
0
1
0

Σύνδεση για κριτική.

Fatima Zahra

Fatima Zahra

Apr 4, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on customizable evaluation metrics, and purpose-built for evaluating multi-step AI agents caught me off guard. still, I'd recommend giving it a real trial.

Robert Ainsworth

Robert Ainsworth

Mar 17, 2026

Solid for our team

We rolled this out across the team last quarter and supports custom metrics and evaluators. Customizable evaluation metrics fits neatly into how we already work, and customizable evaluation metrics removed a step we used to do by hand. Primarily aimed at technical teams, not non-developers, which is the main caveat, but it has held up under daily use.

DW

Devin Walker

Feb 6, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on performance benchmarking and reporting, and supports custom metrics and evaluators caught me off guard. Primarily aimed at technical teams, not non-developers is why this isn't a perfect score, still, I'd recommend giving it a real trial.

Carlos Mendoza

Carlos Mendoza

Jul 20, 2025

Compared a few options

Evaluated this against two competitors. Where it wins: scenario and conversation simulation and purpose-built for evaluating multi-step AI agents. Where it lags: may require integration work to fit existing stacks. On balance the feature set — especially scenario and conversation simulation — justifies the 5 stars for our use case.

Yuki Mori

Yuki Mori

Jul 19, 2025

Use it every day

Honestly didn't expect to like it this much. Performance benchmarking and reporting is exactly what I needed, and purpose-built for evaluating multi-step AI agents. I do wish may require integration work to fit existing stacks, but I reach for it almost every day now and it just clicks.

Leila Hassan

Leila Hassan

Jul 14, 2025

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on regression testing for LLM apps, and supports custom metrics and evaluators caught me off guard. May require integration work to fit existing stacks is why this isn't a perfect score, still, I'd recommend giving it a real trial.

Ερωτήσεις

Ποια είναι τα πλεονεκτήματα της χρήσης του Relari;

Το Relari έχει σχεδιαστεί ειδικά για την αξιολόγηση πολυβήματων AI πρακτόρων, δημιουργεί συνθετικά δεδομένα δοκιμών σε μεγάλη κλίμακα, και υποστηρίζει προσαρμοσμένες μετρικές και αξιολογητές, με ενεργή ανάπτυξη που υποστηρίζεται από το Y Combinator.

Asked by Anya Sokolova · Jun 27, 2026

Είναι το Relari κατάλληλο για μη‑τεχνικές ομάδες;

Το Relari είναι κυρίως σχεδιασμένο για τεχνικές ομάδες, όχι για μη‑προγραμματιστές, και μπορεί να απαιτεί ενσωμάτωση για να ταιριάξει με υπάρχουσες υποδομές.

Asked by Hasan Demir · May 27, 2026

Ποιες λειτουργίες υποστηρίζει το Relari;

Το Relari υποστηρίζει λειτουργίες όπως δημιουργία συνθετικών συνόλων δεδομένων, αυτοματοποιημένα pipelines αξιολόγησης πρακτόρων, προσομοίωση σεναρίων και προσαρμόσιμες μετρικές αξιολόγησης.

Asked by Marisol Pena · Apr 17, 2026

Για τι χρησιμοποιείται το Relari;

Το Relari είναι μια πλατφόρμα για δοκιμή, αξιολόγηση και δημιουργία συνθετικών δεδομένων για AI πράκτορες, βοηθώντας τις ομάδες να βελτιώσουν την αξιοπιστία τους μέσω συστηματικής δοκιμής και αξιολόγησης.

Asked by Hana Kobayashi · Mar 25, 2026

Κάνε μια ερώτηση

Εναλλακτικές για Διατηρησιμότητα

KeywordsAI interface preview
KeywordsAIΔιατηρησιμότητα

Πολιπλατφόρμα προγραμματιστών για την κατασκευή, παρακολούθηση και κλιμάκωση εφαρμογών LLM.

5.0 (6)
Free
Guardian interface preview
GuardianΔιατηρησιμότητα

Πλατφόρμα ασφάλειας και διακυβέρνησης για αυτόνομους AI πράκτορες και έξυπνα συστήματα.

5.0 (5)
Free
Maxim AI interface preview
Maxim AIΔιατηρησιμότητα

Πλατφόρμα end-to-end για την αξιολόγηση, παρακολούθηση και βελτίωση AI agents

4.8 (6)
Free
llm scout interface preview
llm scoutΔιατηρησιμότητα

Παρακολουθήστε πώς η μάρκα σας εμφανίζεται σε ChatGPT, Claude, Perplexity και τις Επισκοπήσεις Google AI.

4.8 (5)
5Free
Weave interface preview
WeaveΔιατηρησιμότητα

Ένας δημιουργός ροών εργασίας AI χωρίς κώδικα που επιτρέπει στις επιχειρήσεις να αυτοματοποιούν τις λειτουργίες τους ενσωματώνοντας πολλαπλά μεγάλα μοντέλα γλώσσας (LLMs) και συνδέοντας προτροπές...

4.8 (5)
2Free
FoundryAI interface preview
FoundryAIΔιατηρησιμότητα

Δημιουργήστε, αξιολογήστε και βελτιώστε AI πράκτορες για επιχειρησιακό αυτοματισμό

4.8 (4)
4Free
Helicone AI interface preview
Helicone AIΔιατηρησιμότητα

Πλατφόρμα παρατηρησιμότητας όλα-ενός για την παρακολούθηση, αποσφαλμάτωση και βελτίωση παραγωγικών εφαρμογών LLM.

4.7 (6)
5Free
Edwin AI interface preview
Edwin AIΔιατηρησιμότητα

Μηχανιακή συνήγορος για τις Λειτουργίες Τεχνολογικών Συστημάτων που γρήγορα ανακαλύπτει, τυποποιητικά και συνδέει επεισόδια και λήξη.

4.7 (6)
4Free