Bătălie trecută · 2023-12-27 UTC
Observability Confruntare — 27 decembrie 2023
Din categoria Observability. 30 puncte plasate pe 8 luptători. Fiddler AI a luat coroana.
Clasament final
Lotul
Luptătorii
Profilurile fiecărui instrument care a concurat în această bătălie, clasate după scorul lor final.

Fiddler AI
Platformă de observabilitate și securitate AI pentru monitorizarea, explicarea și guvernarea aplicațiilor ML și LLM.

Fiddler AI este o platformă de enterprise care ajută echipourile să monitorizeze, analizeze și să securizeze modelurile de învățare automată și aplicațiile de AI generative în producție. Ofere o vedere în modelul de performanță, devariația de date, discriminarea și problemele de calitate, în timp ce oferă și măsuri de siguranță împotriva riscurilor specifice LLM-uri, cum ar fi halucinațiile, injectia de prompt, și ieșirile nesigure. Proiectat pentru inginerii de ML, științii de date și echipa de risc și conformitate, Fiddler combină explicabilitatea, monitorizarea în timp real și controalele în fluxul de lucru unic. Integratează cu pipeline-urile ML și medii online în comun, ajudând organizațiile să operationalizeze practicile de AI responsabile la scară.
Diviziunea criteriilor
- Monitorizarea performanței și drift-ului modelului
- Detectarea halucinațiilor și a siguranței LLM
- Protecția împotriva injecției de prompt și jailbreak
- AI explicabil și analiza cauzei rădăcină
- Evaluări ale prejudecăților și echității
- Tablouri de bord și alerte pentru AI în producție

FoundryAI
Creează, evalua și îmbunătățesc agentele AI pentru automizare a activităților de afaceri

FoundryAI este o platformă de dezvoltare axată pe crearea de agenți AI care gestionează fluxurile de lucru ale întreprinderilor reale. Ea combină instrumente de proiectare a agentului, testare și îmbunătățiri continue astfel încât echipele să poată trece fără sârguință de la prototip la producție fără a trebui să lege sisteme separate. Platforma accentuează evaluarea, oferind builderilor modalități de măsurare a performanței agentului în comparație cu task-urile definite și de adaptare a comportamentului în timp. Astfel, platforma este adecvată pentru organizațiile care automatizează suportul clienților, operațiunile interne sau munca de cunoaștere repetitivă unde se prețuiește fiabilitatea. FoundryAI se adresează echipelor tehnice care necesită mai mult control decât platformele no-code oferă, dar vor a doua iterativ mai rapid decât construirea agentilor de la zero.
Diviziunea criteriilor
- Environment de dezvoltare ale agentilor AI
- Dispozitiv de evaluare și testare ai agentilor AI
- Monitorizare și îmbunătățesc performanța echipelor de afaceri
- Suport pentru sistemele de afaceri
- Integrarea de evaluare și testare cu entități
- Iterați și îmbunătățesc performance-ul agenturilor AI

Quotient AI
Platformă de monitorizare și evaluare în timp real pentru detectarea eșecurilor AI în căutare, RAG și agenți.
Quotient AI este o platformă de observabilitate și evaluare construită pentru echipe care lansează caracteristicile puternite de AI. În mod continuu, ea monitoringează sistemele AI de producție, inclusiv căutarea, generarea reutilizată (RAG), și agenții autonome, pentru a identifica halucinațiile, erorile de recuperare și alte probleme de calitate înainte ca utilizatorii din final să le întâmpine. Plecând înainte, platforma combină evaluările automate cu alertări în timp real, ajutând echipele de inginerie și ML să diagnoze cauzele profunde, să urmărească regresii în funcție de schimbări în model sau prompt-uri, și să mențină fiabilitatea la scară. Prin intermediul instrumentării fluxurilor AI, Quotient oferă dezvoltatorilor vizibilitate în modul în care aplicatiile lor se comportă în realitate, în loc de a repoda pur și simplu pe benchmark-uri offline.
Diviziunea criteriilor
- Monitorizare și alertare AI în timp real
- Detectarea halucinațiilor și a erorilor de recuperare
- Instrumente de evaluare pentru conductele RAG
- Urmărirea și diagnosticarea comportamentului agentului
- Analiza regresiei între modificările modelului și promptului
- Observabilitate de producție pentru aplicații AI

Portkey
Plan de control unificat pentru construirea, gestionarea și monitorizarea aplicațiilor AI

Portkey este un plan de control unificat pentru construirea, gestionarea și monitorizarea aplicațiilor AI. Oferă o platformă cuprinzătoare pentru echipele AI pentru a ajunge în producție, oferind funcții precum AI Gateway, Observabilitate, Garduri de protecție, Guvernanță și Gestionarea Prompt-urilor. Platforma permite utilizatorilor să acceseze peste 1.600 de LLM-uri printr-o API unificată, eficientizând procesul de integrare a modelelor și permițând echipelor să se concentreze pe construire, mai degrabă decât pe gestionare. Portkey oferă, de asemenea, observabilitate în timp real, permițând utilizatorilor să monitorizeze comportamentul LLM, să detecteze anomalii devreme și să gestioneze utilizarea în mod proactiv. În plus, platforma oferă capacități de stocare în cache, care au demonstrat că economisesc utilizatorilor mii de dolari prin reducerea testelor redundante. Portkey este conceput pentru echipele AI și suportă o gamă largă de LLM-uri, cu peste 3.000 de echipe GenAI și un număr mare de jetoane procesate zilnic.
Diviziunea criteriilor
- Poartă AI cu rutare multi-furnizor
- Gestionarea și versionarea prompt-urilor
- Jurnal de solicitări, urme și analize
- Caching semantic și reexecuții
- Garduri de protecție pentru validarea intrărilor și ieșirilor
- Tablouri de bord pentru monitorizarea utilizării și costurilor
Helicone AI
Platformă de observabilitate all-in-one pentru monitorizarea, depanarea și îmbunătățirea aplicațiilor LLM de producție.
Helicone AI este o platformă de observabilitate dezvoltată special pentru aplicații alimentate de modele de limbaj mari, axată pe dezvoltatori. Aceasta capturează solicitări, răspunsuri, costuri și latență de la diferiți furnizori, oferind echipelor de inginerie o imagine unificată a modului în care funcționează caracteristicile LLM în producție. Pe lângă jurnalizare, Helicone oferă instrumente pentru depanarea prompturilor, trasarea fluxurilor de lucru ale agenților pe mai multe etape, rularea evaluărilor și urmărirea utilizării la nivel de utilizator. Echipelor le permite să identifice regresii, să controleze cheltuielile și să itereze pe prompturi cu date, nu cu presupuneri. Se integrează cu furnizorii de modele populari și cu cadrele prin intermediul unui proxy ușor sau a jurnalizării asincrone, făcând ușor de adăugat la stivele existente fără modificări majore de cod.
Diviziunea criteriilor
- Înregistrarea solicitărilor și răspunsurilor
- Urmărirea costurilor și a utilizării tokenilor
- Gestionarea și versiunea prompturilor
- Trasarea agenților și a sesiunilor
- Evaluări personalizate și tablouri de bord
- Analitica utilizatorilor și a limitelor de rată

KeywordsAI
Platformă unificată pentru dezvoltatori pentru construirea, monitorizarea și scalarea aplicațiilor LLM.

Platforma KeywordsAI este o platformă orientată către dezvoltatori, care combinează toate instrumentele necesare pentru a lansa aplicații LLM de gradul de producție. Fornetează un gateway API unic pentru accesarea mai multor furnizori de modele, împreună cu caracterisitici de observabilitate, înregistrare și evaluare integrate pentru a ajuta echipele să înțeleagă cum funcționează funcțiile lor AI în realitate. Platforma este proiectată pentru a reduce suprasolicitarea operațională de gestionare a produselor alimentate de LLM. Dezvoltatorii pot monitoriza latența și costurile, debungeta sugestiile de întrebare, executa evaluări și gestiona versiunile sugestiilor de întrebare fără a le asambla împreună din instrumente separate. Acest lucru face lucrurile mai ușoare pentru echipele de inginerie pentru a itera asupra caracteristicilor AI și a menține fiabilitatea când se scalăm utilizarea.
Diviziunea criteriilor
- Poartă unificată LLM între furnizori
- Înregistrarea și trasarea cererilor
- Monitorizarea costurilor și latenței
- Experimentarea și controlul versiunilor de prompt-uri
- Fluxuri de lucru de evaluare și testare
- SDK-uri și integrări API


Maxim AI este o platformă pentru dezvoltatori construită pentru a ajuta echipele să lanseze agenți AI fiabile și aplicații LLM. Ea adună ingineria prompturilor, evaluarea, observabilitatea și managementul datelor pentru a permite echipelor să iterove rapid, în timp ce se ține calitatea măsurată. Platforma susține evaluări automate și umane pentru multiple modele și provocări, îngăduind inginerilor să compare rezultatele, detecteze regrădirile și urmărească eşecurile în produsie. Este proiectată pentru colaborare interfuncțională, cu fluxurile de lucru care permit amânduror părților interesate, atât tehnice cât și ne-technice, să contribuie la testare și revizuire. Maxim este de obicei utilizat de echipe care dezvoltă chatbots, copiloti, agenți de voză și Fluxuri de lucru multiple cu mai multe pași care au nevoie de o performanță constantă în fața provocărilor în schimbare, modele și intrări utilizator.
Diviziunea criteriilor
- Plataforma de evaluare, monitorizare și îmbunătățirea obiecțiunilor echipii
- Pregătirea datai și prelucrarea datelor corelate și îmbunătățirea agentilor AI
- Sigură evaluare, monitorizare și îmbunătățirea și îmbunătățirea corelării
- Prin evaluare cu ajutorul de date și aplicarea prin experimentare și evidențiere cauzele de probleme
- Plataformă pentru evaluarea, monitorizarea și îmbunătățirea datelor pentru îmbunătățirea corelării și modulutarea și evaluarea datei
- Adaptare pentru evaluarea și monitorizarea Corelarei și experimentarea corelării.
Relari (YC W24)
Platformă de testare, evaluare și generare de date sintetice pentru agenți AI

Relari este o platformă de dezvoltare pentru dezvoltatori care se concentrează asupra îmbunătățirii fiabilității agenților AI prin testare și evaluare sistematice. Ei ajut echipa să genereze seturi de date sintetice, să desfășoare evaluări automate și să compare performanța agenților în scenarii realiste anterior de a lansa produsele în producție. Relăsat de către Y Combinator (W24), Relari este adresat echipei de ingineri care construiesc aplicații complexe cu LLM și agenți de mai multe pași, unde verificarea tradițională nu reușește. Setul de instrumente al aplicației urmărește să introducă rigorul ingineriei software—testele unitare, verificările de regres, și criteriile măsurabile—în sistemele AI ne-deterministe. Platforma oferă evaluatori personalizați, simulări de scenariu și monitorizare continuă, ceea ce o face utilă atât pentru validarea înainte de lansare, cât și pentru asigurarea calității a unor agenți de producție în timp real.
Diviziunea criteriilor
- Generarea de seturi de date sintetice
- Pipelines de evaluare automate pentru agenți
- Simularea de scenarii și conversații
- Metrici de evaluare personalizabile
- Testare de regresie pentru aplicații LLM
- Evaluarea performanței și raportare





