Praeita kova · 2026-07-25 UTC
Observability Susirėmimas — 2026 m. liepos 25 d.
Iš Observability kategorijos. 21 įvertinimai pateikti tarp 9 kovotojų. Arize AI laimėjo vainiką.
Galutiniai rezultatai
Dalyviai
Kovotojai
Kiekvieno šioje kovoje dalyvavusio įrankio profiliai, surikiuoti pagal galutinį rezultatą.

Arize AI
Platforma, kurianti žinių analizės priemonės ir modelių įvertinimą LLM, pagalbos įgyvendina programuotojų, kuriantių AI, bei duomenų mokslininkų monitorinės sistemos naudojimą, problemų tyrinėjimą ir paramą, kad LLM įdiegtų sistemų bei duomenų tyrinėjimų performansas...

Arize AI yra LLM įvertinimo ir LLM observabiliteto platforma. Ji padeda programų automatizavimo specialistams bei duomenų mokslininkams stebėti, paaiškinti, bei pagerinti savo AI modelių kokybę. Platforma pateikia priemones, kurios padeda įsitiktinį problemų identifikavimą bei rekomendacijų, kurios padeda vartotojams užimti savo modelių tikslumą ir paplitimą. Arize AI yra projektuojama programa, kuriai reikia optimizuoti savo modelių veiksimą. Platformos galimybės įskaito stebėjimą ir paaiškinimą, leidžia vartotojams greitai identifikuoti ir susipažinti su problemomis. Arize AI taip pat pateikia funkcijas, dėl kurios veiksmingos modelio kokybę įvertina ir pagerina, leidžiant vartotojams kuo pagerinti savo modelius per laiko. Naudojantis Arize AI, vartotojai gali pasiekti, kad jų AI modeliai veikia taip, kad reikėtų, leidžiant pagerinti sprendimų priėmimo ir išvados. Platformos dėmesio svarstymas ir įvertinimas padeda ją užimti savo vieta tik prie kitų programų automatizavimo priemonių tarp kitų tikraisiai AI priemonių, veikiančių su didžiais kalbos modeliais bei kitais sudėtingaisiais AI sistemomis.
Kriterijų išskirstymas
- Sąrašo regavimo sistemas
- Tremtynimo ir klausimų nustatymo problemų identifikavimas
- Sugestija priesaikos problemų paaiškinimui
- Rūšies vertinimas
- LLM vertinimas ir optimizavimas
Helicone AI
Visiškai integruotas observabilumo platforma, skirta monitoruoti, pataisyti ir pagerinti produkcinio LLM aplikacijų veikimą.
Helicone AI yra kuratorių įrengimas su observability funkcionalumo, kuris yra sukuręs specialiai aplikacijas užpildo dideliu kalbos modelių, įskaitant taikinčius, atsakymus, kainas, ir prasmeines užtrukusius laikus kroz providerių, suteikiant inžineriniams komandoms bendrą vaizdą, kaip jų LLM funkcijos elgiasi produktacijos lygį. Visa ne tik registruojant, „Helicone" siūlo priemonės užtikrinimui, tiesiogiai nukreipti prieveikius, traktuoti keliojusių agentų sąsuvio aplenkimų, einant ekoje ir registruoti naudotojų lygio naudojimą. Komandos gali nustatyti regresijas, valdyti išlaidas ir iteruoti prielaidas tiesiagos data, o ne pasimanyti. Jis integravosi su populiariausiais modelių teikiotojais ir kladžiais per lengvą vandenieją arba asinkroninę logiką, padeda tiesiogiai pridėti prie esamų staklių be reikiamų kode changes.
Kriterijų išskirstymas
- Prašytojų ir atsakymų logavimas
- Išlaidų ir tokeno naudojimo įskaitos
- Prašymų valdymas ir versijos valdymas
- Agentų ir sesijų įrašinėjimas
- Individualizuotos įvertinimai ir valdikliai
- Vartotojų ir sąnaudų apribojimų analizė

llm scout
Išvagėdami, kaip jūsų markė atsiranda tarp ChatGPT, Claude, Perplexity, ir Google AI Ataskaitų.

LLM Scout yra markės peržiūros įrankis, sukurtas generatyvinės paieškos epochai. Jis trackuoja, kaip jūsų bendrovė, produktai ir priešininkai paminėti įvairiuose AI asistentuose ir atsakymų varžybose, suteikiant marketingo ir SEO komandoms peržiūrą į kanalu, kurį tradiciniai analizės įrankiai paslenka. Platforma vykdo periodinius prašymus krovę sistemoms kaip ChatGPT, Claude, Perplexity ir Google 'AI Ataskaitų, tada ataskaito dėl balsų dalies, nuostabių nuostatų, šaltinių šaltinių ir pokyčių per laiką. Komandoms galimai užvaldę šiuos žinojimus, kad sutvarkytų turiningą strategiją, identifikuokite pradžios, kaip priešininkai rekomenduojami, ir mato optimistinėjo darbų taikų dideliems kalbos modeliams.
Kriterijų išskirstymas
- Markės bei priešininko paminėjimos trackėjimas
- Atžvilgiai ChatGPT, Claude, Perplexity ir AI Ataskaitose
- Nuostabių balsų ir dalies nuostabių analize
- Šaltinių ir šaltinių matomumas
- Nusikalstama prašymų trackėjimas
- Istorinio tendeno ataskaita
AgentOps
Reagingo ir koregavimo priemonės priemonės įrengimo reliabiliam inteligentiniams agentams

AgentOps yra programų kūrėjų platforma, kurios tikslas yra pagalba agentams suintarpomis gyvuoti programų gyvavimo ciklą, papildo kietų ir rengiamųjų programų įrankiais taip pat debagų įrankiais, kad sužiuria, ką agentai tuo tikslui atlieka. Jis įraška LLM prisijungimus, įstaigų vartojimą, išlaidas bei klaidas, kad komandos supras agento elgesį sudėtingose keliuose žingsnių procesų rėmuose. Viršijus matomumą, AgentOps siūlo sesijų atkarpas, performanso analizę bei integracijas su populiariaisiais agentų framework'ais kaip LangChain, CrewAI bei AutoGen. tai padeda inžinieriams perėiti nuo prototipo prie produkcinio režimo su matomu reliabiliu atlikimu, o ne priklausydami nuo spekuliacijų ar logų filtravimo. Tokiai programuotojams ir komandoms, kurios siunčia agento programas, būtina trakinti grįžimo galimybes, kontroliuoti išlaidas ir parinkti, ar agentai veikia teisingai prieš ir po paleidimo.
Kriterijų išskirstymas
- Agentų sesijų ir paprastymų priemonės
- LLM skelbimo ir priemonių nuolaidos sekimas
- Sąnaudų ir sąnaudių analitika
- Klaidų ir neišpildymų sekimas
- Rašybos šiuo klausimų SDKs Python ir JavaScript
- Agentų performanso kriterijų skilty klaviatūros

AI2AI project
Rodykite, kaip du AI agentai pasiklosto vienas su kitu tiesiogine laiku.

SVetaine CVI AI2AI projektas, naudotojai gali žiūrėti realaus laiko sąsająjas tarp dviejų AI agentų. Kad pradėti interakciją, naudotojai privalo sukurti du entitetas, priskiriant jiems prašymą, kontekstą, kalbos balsą ir lytį, bei pasirinkti kalbos modelį. Interakcija gali pradeti, išsaugoti bei pranešti kitam naudotojui, besivizdojančiam svetainėje. Pavyzdžiai pasirodo, parodydami skirtingas scenarijus tokias, kaip priklausomybė, liūdesys, svajonės ar prekių reklamos. Nauji naudotojai privalo prisiregistruoti ir gauti 1 JAV dolerį pinigines, kad galėtų tyrėti platformą. Kaina yra paremta per minutę taika, prasidedanti nuo 0,01 JAV dolerio per minutę.
Kriterijų išskirstymas
- Realus AI-į-AI dialogo matavimas
- Dvi skirtingos AI entitetais, susiduriančios kalba
- Naujadarbės, neatidariusi vartotojo įžanga
- Emeržentoji AI elgsena demonstracija
- Prieinama internetinis naršyklėje skirtas interfeisas
Confident AI
LLM vertinimo platforma, kuria parengta DeepEval, skirta LLM priemonių testinimui, stebėjimui ir tobulėjimui.

Confident AI yra vertinimo ir stebėjimo platforma užsiėmimams, kurie kūna sąmoningus kalbos mokymo modelius. Apgynėjantis atvirą-source DeepEval rūšiavimo, jis suteikia vieningą darbo erdvę, kuri leidžia vykdyti bendroji tikslai, regresinio testavimo bei kokybės patikrinimo priemonės prikeliamųjų, modelių bei atsargas krovinių per kryžminius. Plataforma pagalba mechanikams pažinti halucinacijas, promptų regresijas bei paviešinimų nepavyksčių kartojančius prieš pristatymą, o teikdama prodiūzų montorininkavimo galimybes, kad sekintų tikrų vartotojų interakcijas. Komandos gali centrozuoti duomenis, dalintis testo rezultatais ir iteruoti promptomis matomuosiu pagrindiniu pozuje tuo gale, nei iš bandymų, kad gali būti klaida. Šioje sistemoje siekiama pagaminti kokybiškus įrenginius LLM kvalifikacijos patikrą, nors pagrindinis mūsų veiklos taikinys yra developeriai, ML inžinieriai ir QA komandos, kurios tiekia struktūrius, metrikų pagrįstą apžvalgas, o ne neapibrėžtas žmogaus valdytas patikrinimai.
Kriterijų išskirstymas
- DeepEval vargu prieš vertinimo koeficientai
- Pramoninių testų užtikrimumas už ką ką
- Rag ir atkūrimo vertinimo koeficientas
- Žurnalų ir monitorinėmis priedais
- Duomenų ir testų tvarkykla
- Bendrasis konsultacinis vertinimo rezultatų tvarkykla

Edwin AI
IT operacijų agentas, kuris pagero incidentų detekciją, triagavimą ir išsprendimą.

Edwin AI yra naujoji IT operacijų agentas konkuriruojančių agentų, kuris pagero incidentų detekciją, triagavimą ir išsprendimą. Jis teikia centrinę platformą IT komandoms, kad tyrinėtų incidentus, suprantų jų poveikį, ieško arba generavo sąmoningus sprendimus, ir taip jais apsikeičia per esančias priemones be reikmės keisti sistemas. Edwin AI korreliuoja signalai, identifikuoja šaknines priežastingumo priežastis, ir automatizuojasi išliekimas nuo pirmo signalo iki pat įrodytasio išsprendimo. Jis naudoja istorinius modelius ir atvaizduojantiesį duomenų apžvalgą, kurį pasiekia prognostikavimą ir išvengiamą atsilpusį. Prieinama virš 3 000 priemonių, per observability, APM, saugumą ir CMDB, taip pat galiausiai galima suteikti tiesioginius, veiksmingus apžvalgų ir užkarpštuoti siluos. Forrester tyrimas išrūuoja, kad Edwin AI išvengė 313% pelno atgavimo suderinama organizacijai, su sąmoningu grąžų laiku net iki 6 mėnesių.
Kriterijų išskirstymas
- Signalų koreliacija ir šumų pramonė
- Naujų žodžių incidentų apžvalgų
- Naturaliojo kalbos incidentų sąžiningiems perdavimui
- Integravimas su ITSM ir atvaizduojančiuose platformų
- Automatinė triagavimo aplinkos darbovietė
- Priešistorinė saugoma žinios ir pramonė iš pastarųjų incidentų


FoundryAI yra kuriamųjų projektų platforma, siekiant sukurti AI agentus, kurie tvarko realiuosius verslo darbus. Ji susieja agento dizainą, bandymų, bei užtikrinamą tolesnį patobulimą, kad komandos gali persislinkti nuo prototipo iki produkcijos neišsišakos, sujungus atskirus sistemas. Platforme skirsto žiniatinklio vertinimą, leidžiant kūrėjams matuoti agento performansą, išvystytą taikant nustatytas užduotis ir pagerindamas elgseną per laiką. Tai padeda jiems tinkamai tinkamą organizacijoms, automatiškai tvarkanti klientų aptarnavimo, internų operacijų, ar vėliavos žinių darbą, kur reliabiliškumas yra svarbus. FoundryAI siektasi inžinierių komandų, kurios reikalauja daugiau valdymo nei nors kode pradininkų siūlomi pasiūlymai, tačiau norėjo greitesnis iteracija nei tiek, kur agente pilnai iš naujo pradžioje yra statomi.
Kriterijų išskirstymas
- Agentų kūrimo aplinkos
- Evaluacija ir testavimo įrankiai
- Performances monitorė
- Suvokimui automatinis darbas
- Iteracijų ciklai
- Integracija su verslo sistemomis

Weave
Įvairių pradinės kodės sąrankos konstruktorius, kuris leidžia įmonėms automatizuoti veiklą, integruodami daugius kietų kalbos modelius (LLM) ir sujungdamas signalus kaip tikrai tekstą.

W&B Weave yra Observability ir įvertinimo platforma, kurio pagalba galite sekinti ir pagerinti didelius žodžių modelio (LLM) taikalus. Weave teikia priemones, kurios leidžia nuorodų, metrikų rinkimo ir taikalo atsakų vertinimo, naudodami LLM sudėtį ir pritaikytus skaičiavimo modelius. Svarbiausios funkcijos yra nuorodų sesijų, LLM įvadeivių ir prietišų veiksmų sekimas, taip pat ir rankinių prietišų instrumentų pritaikymas naudotų agentų pritaikytiems modeliams. Platforma skubia sujungimas su populiarūsiais SDK bei harnessais, bei taip pat personalizuotais agentų matomumas. Weave teikia Python bei TypeScript bibliotekas instalacijai bei naudojimui platforma. Ji turi bazuoti Weights & Biases (W&B), reikia W&B paskyros bei API klaučio autentificacijai. Naudojotojai gali ištrinti ryšius su LLM, peržiūrėti įvesčius ir išvestis bei peržiūrėti agento metrikas Weave UI. Čia Weave paprastina automatizavimą ir LLM taikymų vertinimą, nors tai nepriimtinai nebūtinai nemokamųjų programių automatizuoto juodraščio statybos reikšme.
Kriterijų išskirstymas
- Agentų prižiūrimo ir metrikų rinkimo priemonė
- Personalizuotų agentų prižiūrėjimas
- Kietų kalbos modelių prižiūrimo ir įvertinimo priemonė
- OpenTelemetry spanų paramos
- Weaves ir W&B integracijos
- Python ir TypeScript bibliotekos





