Praeita kova · 2025-06-03 UTC
Observability Susirėmimas — 2025 m. birželio 3 d.
Iš Observability kategorijos. 20 įvertinimai pateikti tarp 7 kovotojų. Quotient AI laimėjo vainiką.
Galutiniai rezultatai
Dalyviai
Kovotojai
Kiekvieno šioje kovoje dalyvavusio įrankio profiliai, surikiuoti pagal galutinį rezultatą.

Quotient AI
Įvykių laiko monitoravimas ir vertinimų platforma, siekiant surasti klaidas AI, RAG ir agentų srityje.
Quotient AI yra observability ir įvertinimo platforma sukurta komandoms, kurios siunčia AI-pažangas priedus. Ji visais laikais monitoruoja produkcijos AI sistemus – įskaitant ištekėjimą, gaivintojo generavimą (RAG) ir savarankiškus agentus – kad priešingai pagalvinais vartotojų atvykęs pasirodymą, išsiskiria halucinacijas, pagrindinio ištekėjimo klaidas ir kitas kokybės problematiką. Platforma jungia savo narės į automatinius įvertinimus su realiu laiku signalais, padėdama inžinerijos ir ML komandoms diagnozuoti šaltinius, klausį regressijas skirtinguose modelio ar užklausos pokyčiuose, bei išlaikyti patikimumą skalyje. Instrumentuojant AI srautų, Quotient priskiria programuotojams peržiūrą, kaip išeina jų programos realiame svetme, o ne tik remiantis nenaudojamų užklausų rodikliais.
Kriterijų išskirstymas
- Įvykiai laiko AI monitoravimas ir pranešimai
- Vaikų ir prigimtinio klaidų detekcija
- RAG takelių vertinimo priemsena
- Savaraikis agentų veiklos trukdymų ir diagnostinis priemsenas
- Priešėnų modelio ir prailides analizė
- Produkcijos observableitė AI programėms

Arize AI
Platforma, kurianti žinių analizės priemonės ir modelių įvertinimą LLM, pagalbos įgyvendina programuotojų, kuriantių AI, bei duomenų mokslininkų monitorinės sistemos naudojimą, problemų tyrinėjimą ir paramą, kad LLM įdiegtų sistemų bei duomenų tyrinėjimų performansas...

Arize AI yra LLM įvertinimo ir LLM observabiliteto platforma. Ji padeda programų automatizavimo specialistams bei duomenų mokslininkams stebėti, paaiškinti, bei pagerinti savo AI modelių kokybę. Platforma pateikia priemones, kurios padeda įsitiktinį problemų identifikavimą bei rekomendacijų, kurios padeda vartotojams užimti savo modelių tikslumą ir paplitimą. Arize AI yra projektuojama programa, kuriai reikia optimizuoti savo modelių veiksimą. Platformos galimybės įskaito stebėjimą ir paaiškinimą, leidžia vartotojams greitai identifikuoti ir susipažinti su problemomis. Arize AI taip pat pateikia funkcijas, dėl kurios veiksmingos modelio kokybę įvertina ir pagerina, leidžiant vartotojams kuo pagerinti savo modelius per laiko. Naudojantis Arize AI, vartotojai gali pasiekti, kad jų AI modeliai veikia taip, kad reikėtų, leidžiant pagerinti sprendimų priėmimo ir išvados. Platformos dėmesio svarstymas ir įvertinimas padeda ją užimti savo vieta tik prie kitų programų automatizavimo priemonių tarp kitų tikraisiai AI priemonių, veikiančių su didžiais kalbos modeliais bei kitais sudėtingaisiais AI sistemomis.
Kriterijų išskirstymas
- Sąrašo regavimo sistemas
- Tremtynimo ir klausimų nustatymo problemų identifikavimas
- Sugestija priesaikos problemų paaiškinimui
- Rūšies vertinimas
- LLM vertinimas ir optimizavimas


FoundryAI yra kuriamųjų projektų platforma, siekiant sukurti AI agentus, kurie tvarko realiuosius verslo darbus. Ji susieja agento dizainą, bandymų, bei užtikrinamą tolesnį patobulimą, kad komandos gali persislinkti nuo prototipo iki produkcijos neišsišakos, sujungus atskirus sistemas. Platforme skirsto žiniatinklio vertinimą, leidžiant kūrėjams matuoti agento performansą, išvystytą taikant nustatytas užduotis ir pagerindamas elgseną per laiką. Tai padeda jiems tinkamai tinkamą organizacijoms, automatiškai tvarkanti klientų aptarnavimo, internų operacijų, ar vėliavos žinių darbą, kur reliabiliškumas yra svarbus. FoundryAI siektasi inžinierių komandų, kurios reikalauja daugiau valdymo nei nors kode pradininkų siūlomi pasiūlymai, tačiau norėjo greitesnis iteracija nei tiek, kur agente pilnai iš naujo pradžioje yra statomi.
Kriterijų išskirstymas
- Agentų kūrimo aplinkos
- Evaluacija ir testavimo įrankiai
- Performances monitorė
- Suvokimui automatinis darbas
- Iteracijų ciklai
- Integracija su verslo sistemomis
Helicone AI
Visiškai integruotas observabilumo platforma, skirta monitoruoti, pataisyti ir pagerinti produkcinio LLM aplikacijų veikimą.
Helicone AI yra kuratorių įrengimas su observability funkcionalumo, kuris yra sukuręs specialiai aplikacijas užpildo dideliu kalbos modelių, įskaitant taikinčius, atsakymus, kainas, ir prasmeines užtrukusius laikus kroz providerių, suteikiant inžineriniams komandoms bendrą vaizdą, kaip jų LLM funkcijos elgiasi produktacijos lygį. Visa ne tik registruojant, „Helicone" siūlo priemonės užtikrinimui, tiesiogiai nukreipti prieveikius, traktuoti keliojusių agentų sąsuvio aplenkimų, einant ekoje ir registruoti naudotojų lygio naudojimą. Komandos gali nustatyti regresijas, valdyti išlaidas ir iteruoti prielaidas tiesiagos data, o ne pasimanyti. Jis integravosi su populiariausiais modelių teikiotojais ir kladžiais per lengvą vandenieją arba asinkroninę logiką, padeda tiesiogiai pridėti prie esamų staklių be reikiamų kode changes.
Kriterijų išskirstymas
- Prašytojų ir atsakymų logavimas
- Išlaidų ir tokeno naudojimo įskaitos
- Prašymų valdymas ir versijos valdymas
- Agentų ir sesijų įrašinėjimas
- Individualizuotos įvertinimai ir valdikliai
- Vartotojų ir sąnaudų apribojimų analizė

KeywordsAI
Unifikuota programistų platforma, skirta LLM taiklus sukurti, monitoruoti ir skalėti.

KeywordsAI yra tai, kuriame sukurtojai pagrindiniai platforma, sujungianti reikalingus darbų įrankius, kad paslaugos laikotarpiu galėtų pradėti pramoninį LLM programų versijas. Įrangą skirtą prieigos gateway, kad lengvai prieinami į kelias modelio tiekėjų šaltinis, kartu su integruotais atvaizdavimo, registravimo ir vertinimo funkcijomis, kad pagalbos komandoms prieiti, kaip tai jų programos veikia realiame pasaulyje. Šis platforma sukurti, kad sumažintų produktus, kurie naudoja LLM galimybes, operacinę apkrova. Programuotojai gali stebėti atsako trukmę ir išlaidas, įsirengti prielaidą, atlikti įvertinimus, valdyti prielaidų versijas be reikiamų atskirų įrankių. Tai padeda inžineriniams komandoms lengviau iteruoti AI funkcijas ir laikytis reliabiliškumo, kai naudojimo skalė didėja.
Kriterijų išskirstymas
- Vieninta LLM siena visų tiekėjų
- Išsekimo ir trunkamojo logavimo funkcijos
- Skaitymo ir laiko režimo monitoringas
- Įvairių prielaidų eksperimentavimas ir versionavimas
- Pasikėlimo ir išbandymo srautai
- SDK ir API integravimas
Relari (YC W24)
Testavimas, įvertinimas ir sintetinio duomenų generavimas platforma už AI agentus.

Relari yra toliau tyrimų ir įvertinimų pagrindinės funkcijos turinčios developerio platforma, skirta pagerinti AI agentų ištikimumą. Komanda pagalbos gali sukurti sintetinius duomenis, automatizuotus įvertinimus ir tikrinti agentų atlikimą iš tikrųjų scenarijų bei priklausančius rezultatus prieš siūlymą į gamybą. Pagaminta Y Combinator (W24) parama, Relari siekia technologų mėgėjus, kurie įrengia kompleksius LLM taikiklius ir įvairaus lygio agentus kurie tradicinėje QA metuose yra nepakankamai patikrinti. Šio įrankio tikslas yra įtraukti į software-engineering rigorą - vienetinius testus, regresinius kontrolierius ir matomus matavimo rodiklius netiesioginiam AI sistemoms. Plataforma priimsi specializuoti evaluatoriai, scenarijų simuliacija ir tęstinė monitorė, kad ji būtu naudinga ne tik atitikimo priimimu, bet ir nuolatiniam pagaminių agentų kokybės tikrinimui.
Kriterijų išskirstymas
- Sintetiniai duomenų sąrašai generavimas
- Automatizuoti agentų įvertinimo srautai
- Skriptos ir pokalbių simuliacija
- Šildimų įvertinimo metrikai sąranka
- Reagraviniai testsai už LLM programėlių
- Atlikimų ir ataskaitų našumą matavimas

llm scout
Išvagėdami, kaip jūsų markė atsiranda tarp ChatGPT, Claude, Perplexity, ir Google AI Ataskaitų.

LLM Scout yra markės peržiūros įrankis, sukurtas generatyvinės paieškos epochai. Jis trackuoja, kaip jūsų bendrovė, produktai ir priešininkai paminėti įvairiuose AI asistentuose ir atsakymų varžybose, suteikiant marketingo ir SEO komandoms peržiūrą į kanalu, kurį tradiciniai analizės įrankiai paslenka. Platforma vykdo periodinius prašymus krovę sistemoms kaip ChatGPT, Claude, Perplexity ir Google 'AI Ataskaitų, tada ataskaito dėl balsų dalies, nuostabių nuostatų, šaltinių šaltinių ir pokyčių per laiką. Komandoms galimai užvaldę šiuos žinojimus, kad sutvarkytų turiningą strategiją, identifikuokite pradžios, kaip priešininkai rekomenduojami, ir mato optimistinėjo darbų taikų dideliems kalbos modeliams.
Kriterijų išskirstymas
- Markės bei priešininko paminėjimos trackėjimas
- Atžvilgiai ChatGPT, Claude, Perplexity ir AI Ataskaitose
- Nuostabių balsų ir dalies nuostabių analize
- Šaltinių ir šaltinių matomumas
- Nusikalstama prašymų trackėjimas
- Istorinio tendeno ataskaita




