Bătălie trecută · 2026-07-24 UTC
Observability Confruntare — 24 iulie 2026
Din categoria Observability. 21 puncte plasate pe 9 luptători. Coval (YC S24) a luat coroana.
Clasament final
Lotul
Luptătorii
Profilurile fiecărui instrument care a concurat în această bătălie, clasate după scorul lor final.

Coval (YC S24)
Platformă de simulare și evaluare pentru testarea agenților vocali și de chat AI la scară.

Coval este o platformă pentru dezvoltatori construită pentru a simula, testa și evalua agenții AI înainte de a ajunge în producție. Ea permite echipelor să execute mii de conversații sintetice împotriva agentilor lor de sunet sau chat, măsurând modul în care ei se comportă în fața cazurilor marginală, a întreruperilor, a apelurilor la instrumente și a dialogului în mai multe tururi. Sprijinit de Y Combinator (S24), Coval se poziționează ca o abordare ''auto de conducere de mașini'' pentru fiabilitatea agenților, aplicând un testarea riguroasă bazată pe simulare conversațională AI. Inginerii pot defini scenarii, să répliște traficul de producție, puncte rezultatele împotriva metricilor personalizate și urmări regresii pe versiuni ale agenților. Platforma se îndreaptă spre echipe care dezvoltă agenți cu față de clienți în suport, vinării și operațiuni, unde fiabilitatea și constanța sunt elemente critice pentru implementarea în producție.
Diviziunea criteriilor
- Simulare de conversații la scară largă
- Testarea agenților vocali cu dialog realist
- Metrici de evaluare personalizate și notare
- Urmărirea regresiilor între versiunile de agenți
- Generarea de scenarii și cazuri extreme
- Reproducerea traficului de producție

Fiddler AI
Platformă de observabilitate și securitate AI pentru monitorizarea, explicarea și guvernarea aplicațiilor ML și LLM.

Fiddler AI este o platformă de enterprise care ajută echipourile să monitorizeze, analizeze și să securizeze modelurile de învățare automată și aplicațiile de AI generative în producție. Ofere o vedere în modelul de performanță, devariația de date, discriminarea și problemele de calitate, în timp ce oferă și măsuri de siguranță împotriva riscurilor specifice LLM-uri, cum ar fi halucinațiile, injectia de prompt, și ieșirile nesigure. Proiectat pentru inginerii de ML, științii de date și echipa de risc și conformitate, Fiddler combină explicabilitatea, monitorizarea în timp real și controalele în fluxul de lucru unic. Integratează cu pipeline-urile ML și medii online în comun, ajudând organizațiile să operationalizeze practicile de AI responsabile la scară.
Diviziunea criteriilor
- Monitorizarea performanței și drift-ului modelului
- Detectarea halucinațiilor și a siguranței LLM
- Protecția împotriva injecției de prompt și jailbreak
- AI explicabil și analiza cauzei rădăcină
- Evaluări ale prejudecăților și echității
- Tablouri de bord și alerte pentru AI în producție

Future AGI
Personalize AI accesibil și adaptabil pentru a-l purta la nivelul exiginților industriei

Future AGI este o platformă ce îmbunătățește precizia AI prin instrumente complete de evaluare și optimizare. Permite utilizatorilor să creeze agenți auto-îmbunătățitori, să scape de erori și să știe de ce. Platforma oferă o varietate de caracteristici, inclusiv evaluarea agentului, optimizarea și conversații simulate. Utilizatorii pot crea și gestiona scenarii, iar platforma oferă instrumente de analiză și optimizare pentru a îmbunătăți performanța agentului. Aplicatia Future AGI pare să se adreseze mai ales dezvoltorilor și afacerilor care doresc să implementeze bătale de conversație puternic motorizate de inteligență artificială și agenți. Ea permite utilizatorilor să simuleze conversațiile, să evalueze și să optimizeze performanța agentului și să integreze baze de cunoștințe. Platforma pare a fi o tool pentru dezvoltatori pentru a crea și a rafina agenți de inteligență artificială, mai degrabă decât o interfață atractivă pentru clienți. Platforma oferă caractereşti distinctive precum evaluarea agenţilor, conversaţii simulate, şi gestionarea scenariilor. Permite utilizatorilor să editeze şi să gestioneze introducerile, să adauge paşi de recuperare pentru articolele din bază de cunoştinţe, şi să integreze cu introducerile globale pentru a gestiona situaţii complexe. În timp ce Future AGI oferă caracteristici valoroase pentru dezvoltarea și optimizarea inteligenței artificiale, ea prezintă și limite. De exemplu, depinde de cunoștințe generale și poate necesita pași suplimentari pentru scenarii mai complexe. În plus, depinderea platformei de conversații simulate poate limita capacitatea sa de a gestiona incertitudinile din lumea reală. Viitorul AGI pare să ofere un set unic de caracteristici pentru dezvoltarea și optimizarea inteligentiei artificiale. Instrumentele sale de evaluare și optimizare comprehensive o fac o resursă valoroasă pentru dezvoltatori care căută să-și refineze agenții AI. Cu toate acestea, poate că este necesară o dezvoltare suplimentară sau o integrare suplimentară pentru a gestiona scenarii mai complexe și incertitudini real-world.
Diviziunea criteriilor
- Valoare și evaluare de evaluare
- Știrea obiectivelor aiplicațiilor și realizarea de optimizare.
- Creștinerea algoritmurilor inteligente
- optimizarea evaluărilor și practica
- Optimizate evaluare a perfoamănterelor AI de conținuterii
- Aplicațiile de detectarea iațarelor și de integrare în proiectelor


Pe site-ul proiectului AI2AI, utilizatorii pot observa conversații în timp real între doi agenți AI. Pentru a iniția o interacțiune, utilizatorii trebuie să creeze două entități, atribuindu-le un prompt, context, voce și gen, și să selecteze un model lingvistic. Interacțiunea poate fi pornită, salvată și distribuită altor utilizatori de pe site. Sunt oferite exemple de interacțiuni care pun în evidență diverse scenarii, precum seducția, furia, curiozitatea și discursurile de vânzări. Utilizatorii noi trebuie să se înregistreze și primesc 1 USD credit pentru a explora platforma. Prețurile se bazează pe o rată pe minut, începând de la 1 cent pe minut.
Diviziunea criteriilor
- Vizualizarea dialogurilor live între sisteme AI
- Două entități AI distincte în conversație
- Experiență de utilizare observațională, fără implicare activă
- Prezentare a comportamentului emergent al inteligenței artificiale
- Interfață accesibilă direct din browser

Arize AI
O platformă de observabilitate AI și evaluare LLM care asistă dezvoltatorii de AI și oamenii de știință de date în monitorizare, depanare și îmbunătățirea performanței...

Arize AI este o platformă de observabilitate AI și de evaluare a modelului LLM. Asistă dezvoltatorii de AI și specialiștii în date în monitorizarea, depistarea și îmbunătățirea performanței modelului lor AI. Platforma oferă instrumente pentru identificarea problemelor și propunerea de soluții, ajutând utilizatorii să îmbunătățească precizia și fiabilitatea modulului lor. Arize AI este proiectat pentru dezvoltatorii AI și specialiștii în date care au nevoie să optimizeze performanța modelului lor. Capacitățile platformei includ monitorizarea și depistarea, îngăduind utilizatorilor să identifice și să rezolve rapid orice problemă. Arize AI oferă, de asemenea, funcționalități de evaluare și îmbunătățire a performanței modelului, îngăduind utilizatorilor să își refineze modelul la cursul timpului. În utilizarea Arize AI, utilizatorii pot să se asigure că modelul lor AI este în funcțiune la performanța maximă, conducând la luarea deciziilor mai bune și rezultate mai bune. Focusul platformei pe observabilitate și evaluare îi deosebește de alte instrumente de dezvoltare AI, făcând-o un resursă valoroasă pentru cei care lucrează cu modele de limbă mare și alți sisteme complexe de inteligență artificială.
Diviziunea criteriilor
- Supravegherea modelului AI
- Detectare și rezolvare a problemelor
- Generare de soluții propuse
- Evaluarea performelor modelelor
- Evaluarea și optimizarea LLM

Edwin AI
Agent AI pentru operațiuni IT care accelerează detectarea, trierea și rezolvarea incidentelor.

Edwin AI este un agent AI pentru operațiuni IT conceput pentru a accelera detectarea, trierea și rezolvarea incidentelor. Acesta oferă o platformă centralizată pentru echipele IT pentru a investiga incidente, a înțelege impactul lor, a găsi sau a genera soluții și a le aplica pe parcursul instrumentelor existente fără a fi nevoie să comute între sisteme. Edwin AI corelează alertele, identifică cauzele rădăcină și inițiază remedierea automat, începând de la prima alertă până la rezolvarea verificată. Utilizează modele istorice și date de observabilitate pentru a prezice și a preveni întreruperile. Instrumentul se integrează cu peste 3.000 de instrumente din domeniul observabilității, APM, securitate și CMDB, permițând informații în timp real și eliminând silozurile. Un studiu Forrester a arătat că Edwin AI a livrat o rentabilitate a investiției de 313% pentru o organizație compozită, cu o perioadă de recuperare de 6 luni sau mai puțin.
Diviziunea criteriilor
- Corelarea alertelor și reducerea zgomotului
- Sugestii de cauză rădăcină conduse de AI
- Rezumate de incidente în limbaj natural
- Integrații cu platformele ITSM și observabilitate
- Fluxuri de lucru de triere automatizate
- Îmbogățirea cunoștințelor din incidentele anterioare

FoundryAI
Creează, evalua și îmbunătățesc agentele AI pentru automizare a activităților de afaceri

FoundryAI este o platformă de dezvoltare axată pe crearea de agenți AI care gestionează fluxurile de lucru ale întreprinderilor reale. Ea combină instrumente de proiectare a agentului, testare și îmbunătățiri continue astfel încât echipele să poată trece fără sârguință de la prototip la producție fără a trebui să lege sisteme separate. Platforma accentuează evaluarea, oferind builderilor modalități de măsurare a performanței agentului în comparație cu task-urile definite și de adaptare a comportamentului în timp. Astfel, platforma este adecvată pentru organizațiile care automatizează suportul clienților, operațiunile interne sau munca de cunoaștere repetitivă unde se prețuiește fiabilitatea. FoundryAI se adresează echipelor tehnice care necesită mai mult control decât platformele no-code oferă, dar vor a doua iterativ mai rapid decât construirea agentilor de la zero.
Diviziunea criteriilor
- Environment de dezvoltare ale agentilor AI
- Dispozitiv de evaluare și testare ai agentilor AI
- Monitorizare și îmbunătățesc performanța echipelor de afaceri
- Suport pentru sistemele de afaceri
- Integrarea de evaluare și testare cu entități
- Iterați și îmbunătățesc performance-ul agenturilor AI
Helicone AI
Platformă de observabilitate all-in-one pentru monitorizarea, depanarea și îmbunătățirea aplicațiilor LLM de producție.
Helicone AI este o platformă de observabilitate dezvoltată special pentru aplicații alimentate de modele de limbaj mari, axată pe dezvoltatori. Aceasta capturează solicitări, răspunsuri, costuri și latență de la diferiți furnizori, oferind echipelor de inginerie o imagine unificată a modului în care funcționează caracteristicile LLM în producție. Pe lângă jurnalizare, Helicone oferă instrumente pentru depanarea prompturilor, trasarea fluxurilor de lucru ale agenților pe mai multe etape, rularea evaluărilor și urmărirea utilizării la nivel de utilizator. Echipelor le permite să identifice regresii, să controleze cheltuielile și să itereze pe prompturi cu date, nu cu presupuneri. Se integrează cu furnizorii de modele populari și cu cadrele prin intermediul unui proxy ușor sau a jurnalizării asincrone, făcând ușor de adăugat la stivele existente fără modificări majore de cod.
Diviziunea criteriilor
- Înregistrarea solicitărilor și răspunsurilor
- Urmărirea costurilor și a utilizării tokenilor
- Gestionarea și versiunea prompturilor
- Trasarea agenților și a sesiunilor
- Evaluări personalizate și tablouri de bord
- Analitica utilizatorilor și a limitelor de rată

llm scout
Monitorizați cum marca dvs. apare pe ChatGPT, Claude, Perplexity și Google AI Overviews.

LLM Scout este un instrument de monitorizare a brandului conceput pentru era de căutare generativă. Trazie cum va fi încadrată compania dumneavoastră, produsele și competitorii dumneavoastră la nivelul marilor asistenți AI și motoare de răspuns, acordând echipei de marketing și SEO o viziune într-un canal pe care instrumentele tradiționale de analiză îl omit. Platforma utilizează provocări periodice împotriva sistemelor precum ChatGPT, Claude, Perplexity și Puncte de Vizualizare AI ale Google-ului, apoi raportează despre partea de voce, sentiment, surse de citare și modificări pe parcursul timpului. Echipele pot utiliza aceste infor-mații pentru a rafina strategia de conținut, a identifica lacune unde competitorii sunt recomandați în loc, și a măsura impactul eforturilor de optimizare îndreptate spre mari modele de limbaj.
Diviziunea criteriilor
- Urmărirea mențiunilor mărcii și concurenților
- Monitorizare pe ChatGPT, Claude, Perplexity și AI Overviews
- Analiza sentimentului și a ponderii vocii
- Vizibilitate citații și surse
- Urmărirea prompturilor personalizate
- Raportare tendințe istorice







