Relari (YC W24)Plataforma de teste, avaliação e geração de dados sintéticos para agentes de IA.
Visão geral
Funcionalidades principais
- Geração de conjunto de dados sintéticos
- Pipelines de avaliação de agente automatizados
- Simulação de cenários e conversas
- Métricas de avaliação personalizáveis
- Testes de regressão para aplicativos LLM
- Benchmarking e relatórios de desempenho
Preços
- Modelo
- Free
- Categoria
- Observabilidade
- Avaliação
- 4.3 / 5 (6)
Casos de uso
Testando agentes de IA
Avaliação de agentes confiáveis e testáveis para agentes de IA.
Prós e contras
Prós
- Desenvolvido especificamente para avaliar agentes de IA multi-etapa
- Gera dados de teste sintéticos em escala
- Suporta métricas e avaliadores personalizados
- Apoiado pelo Y Combinator com desenvolvimento ativo
Contras
- Principalmente direcionado a equipes técnicas, não desenvolvedores
- Plataforma mais recente com um conjunto de recursos em evolução
- Pode exigir trabalho de integração para se adequar a pilhas existentes
Histórico de batalhas
Em 3 batalhas no Panteão.
Last 3 battles
Avaliações
Média de 6 avaliações.
Entra para deixar uma avaliação.
Skeptical, then convinced
I went in skeptical — most tools in this space overpromise. It actually delivers on customizable evaluation metrics, and purpose-built for evaluating multi-step AI agents caught me off guard. still, I'd recommend giving it a real trial.
Solid for our team
We rolled this out across the team last quarter and supports custom metrics and evaluators. Customizable evaluation metrics fits neatly into how we already work, and customizable evaluation metrics removed a step we used to do by hand. Primarily aimed at technical teams, not non-developers, which is the main caveat, but it has held up under daily use.
Skeptical, then convinced
I went in skeptical — most tools in this space overpromise. It actually delivers on performance benchmarking and reporting, and supports custom metrics and evaluators caught me off guard. Primarily aimed at technical teams, not non-developers is why this isn't a perfect score, still, I'd recommend giving it a real trial.
Compared a few options
Evaluated this against two competitors. Where it wins: scenario and conversation simulation and purpose-built for evaluating multi-step AI agents. Where it lags: may require integration work to fit existing stacks. On balance the feature set — especially scenario and conversation simulation — justifies the 5 stars for our use case.
Use it every day
Honestly didn't expect to like it this much. Performance benchmarking and reporting is exactly what I needed, and purpose-built for evaluating multi-step AI agents. I do wish may require integration work to fit existing stacks, but I reach for it almost every day now and it just clicks.
Skeptical, then convinced
I went in skeptical — most tools in this space overpromise. It actually delivers on regression testing for LLM apps, and supports custom metrics and evaluators caught me off guard. May require integration work to fit existing stacks is why this isn't a perfect score, still, I'd recommend giving it a real trial.
Perguntas e respostas
What are the pros of using Relari?
Relari is purpose-built for evaluating multi-step AI agents, generates synthetic test data at scale, and supports custom metrics and evaluators, with active development backed by Y Combinator.
Asked by Anya Sokolova · Jun 27, 2026
Is Relari suitable for non-technical teams?
Relari is primarily aimed at technical teams, not non-developers, and may require integration work to fit existing stacks.
Asked by Hasan Demir · May 27, 2026
What features does Relari support?
Relari supports features like synthetic dataset generation, automated agent evaluation pipelines, scenario simulation, and customizable evaluation metrics.
Asked by Marisol Pena · Apr 17, 2026
What is Relari used for?
Relari is a platform for testing, evaluation, and synthetic data generation for AI agents, helping teams improve their reliability through systematic testing and evaluation.
Asked by Hana Kobayashi · Mar 25, 2026
Faz uma pergunta
Alternativas a Observabilidade

Plataforma unificada de desenvolvedor para construir, monitorar e escalar aplicações LLM.

Plataforma de segurança e governança para agentes de IA autônomos e sistemas inteligentes.

Plataforma end-to-end para avaliar, monitorar e aprimorar agentes de IA

Monitore como sua marca aparece no ChatGPT, Claude, Perplexity e Google AI Overviews.

Um construtor de fluxo de trabalho de IA sem código que permite às empresas automatizar operações integrando múltiplos grandes modelos de linguagem (LLMs) e conectando prompts de forma contínua

Crie, avalie e melhore agentes de IA para automação de negócios
Plataforma de observabilidade tudo-em-um para monitorar, depurar e melhorar aplicativos LLM de produção.

Agente de IA para operações de TI que acelera a detecção, triagem e resolução de incidentes.
Trending now

API de inteligência de documentos que parseia, divide, reconhece texto e extrai dados estruturados de PDFs complexos, slides e planilhas.

Respostas patrocinadas, pagamento por clique.

Ajuda Precisa nos Deveres de Casa com Explicações Completas

Modelo multimodal de 12B aberto que lida com imagens e texto intercalados com uma janela de contexto de 128K.
