Iepriekšējā cīņa · 2025-12-21 UTC
Observability Sadursme — 2025. gada 21. decembris
No Observability kategorijas. 39 atzīmes izvietotas starp 10 cīnītājiem. AI2AI project izcīnīja kroni.
Gala rezultāti
Sastāvs
Cīnītāji
Katra rīka profili, kas piedalījās šajā cīņā, sarindoti pēc to gala rezultāta.


AI2AI projekta mājaslapā lietotāji var novērot reāllaika sarunas starp diviem AI ziedniekiem. Lai uzsāktu mijiedarbību, lietotājiem ir jāizveido divi entītijumi, piešķirot tiem promptu, kontekstu, balss un dzimumu, un jāizvēlas valodas modelis. Mijiedarbība var tikt uzsākta, saglabāta un kopīgota ar citiem lietotājiem vietnē. Piemēri ir pieejami, demonstrējot dažādus scenārijus, piemēram, iecīcību, dusmas, iztēli un pārdošanas piedāvājumus. Jauni lietotājiem jāreģistrējas un jāsaņem $1 kredīts platformas izpētei. Cenas balstās uz minūtes cenu, sākot no 1 cēntu minūtei.
Kritēriju sadalījums
- Reāllaika AI uz AI dialoga skatīšana
- Divas atšķirīgas AI entītijas sarunā
- Novērojošs, beziesi lietotāja pieredze
- Parādīt emergējošu AI uzvedību
- Pieejama pārlūkā balstīta interfeisa
Confident AI
LLM novērtēšanas platforma, kas balstīta uz DeepEval, lai testētu, uzraudzītu un uzlabotu mākslīgā intelekta lietojumprogrammas.

Confident AI ir novērtēšanas un novērošanas platforma komandām, kas izstrādā lielu valodu modeļu lietojumprogrammas. Balstoties uz atvērtā koda DeepEval rāmijumu, tā nodrošina vienotu darba telpu, lai palaistu atzīmi, regresijas testus un kvalitātes pārbaudes pār promptiem, modeļiem un atpazīšanas ķēdēm. Platforma palīdz inženieriem apturēt halucinācijas, promptu regresijas un atpazīšanas kļūdas pirms piegādes, vienlaikus piedāvājot ražošanas uzraudzību, lai sekotu reālajiem lietotāju mijiedarbības datiem. Komandas var centralizēt datu kopas, koplietot testēšanas rezultātus un iterēt uzpromptus ar mērogojamu atgriezenisko saiti, nevis uz spekulācijām. Tā ir paredzēta izstrādātājiem, ML inženieriem un QA komandām, kas vēlas strukturētu, metrika balstītu pieeju LLM kvalitātes nodrošināšanai, nevis ad-hoc manuālo pārskatīšanu.
Kritēriju sadalījums
- DeepEval balstītas novērtēšanas metrikas
- Regresijas testēšana uz promptiem un modeļiem
- RAG un retrieval novērtēšana
- Ražošanas izsekošana un uzraudzība
- Datu kopu un testēšanas gadījumu pārvaldība
- Komandas sadarbība uz novērtējuma rezultātiem

KeywordsAI
Vienots izstrādātāju platforma LLM lietojumprogrammu izveidei, uzraudzībai un mērogošanai.

KeywordsAI ir attīstītāju uzmanībai veltīta platforma, kas koncentrē to, kādēļ notiek, lai izplatītu kvalitātes līmeņa tekstdarbības modeli, kas attīstītas ar lieliem lingvistiskajiem modeleļiem. Tā sniedz vienu API ieeju, lai piekāpties dažādiem modeļu sniedzējiem, atkal pievienojot integritātes, ziņošanas un novērtējuma rīkus, lai palīdzībai komandas saprastu, kā tos darbojas realitātē raidītie informācijas sistēmas. Platforma ir dizaina, lai samazinātu darba krājumus, kuru ir nepieciešams, lai nodrošinātu darbakumu ar produktiem, kas tiek darināti ar atmiņas aģentu palīdzību. Deviņi var piegādāt datu plūsmu un izdevumu monitoringu, pārbauzties priekšvēlēšanos, veikt novērtējumus un pārvaldīt priekšvēlēšanas variantus bez izsekošanas nelielu dažādas darbinieces. Šāds pieeja tie kļūst ētras darbinieki, lai iterētu ātaka pielāgātu un izvietotu to pieejamību, kad lietošana pieaug.
Kritēriju sadalījums
- Vienots LLM vārteja starp piegādātājiem
- Pieprasījumu žurnāls un izsekne
- Izmaksu un iztecības uzraudzība
- Ievada frāžu eksperimentēšana un versiju kontrole
- Vērtēšanas un testēšanas darba plūsmas
- SDK un API integrācijas

Edwin AI
AI asistents IT operācijām, kas paātrina incidentu atklāšanu, triage un atrisināšanu.

Edwin AI ir AI asistents IT operācijām, kas paredzēts, lai paātrinātu incidentu atklāšanu, triage un atrisināšanu. Tas nodrošina centralizētu platformu IT komandām incidentu izmeklēšanai, to ietekmes saprašāšanai, labošanas meklēšanai vai ģenerēšanai, un to piemērošanai visās esošajās rīkos, bez vajadzības pārslēgties starp sistēmām. Edwin AI korelas alertus, identificē pamata iemeslus un automātiski sāk atlīdzināšanu, sākot no pirmā brīdinājuma līdz pārbaudītam izdevam. Tas izmanto vēsturiskos modeļus un novērošanas datus, lai prognozētu un novērstu izslēgšanas. Šis rīks integrējas ar vairāk kā 3 000 rīkiem, tostarp novērošanas, APM, drošības un CMDB jomās, nodrošinot reāllaika, darbības informāciju un novēršot silo struktūru. Forrester pētījums atklāja, ka Edwin AI sniedza 313% atdevi (ROI) kompozītai organizācijai, ar atdeves periodu 6 mēneši vai mazāk.
Kritēriju sadalījums
- Alertu korelācija un trokšņa samazināšana
- AI vadītās pamata iemeslu ieteikumi
- Dabas valodas incidentu kopsavilkumi
- Integrācijas ar ITSM un novērošanas platformām
- Automatizēti triage darba plūsmas
- Zināšanu bagātināšana no iepriekšējiem incidentiem

Future AGI
Platforma, kas uzlabo mākslīgā intelekta precizitāti, izmantojot pilnvērtīgas novērtēšanas un optimizācijas rīkus.

Future AGI ir platforms, kas pali atbilstības precizitāti ar pilnīgu novērtējumu un optimizācijas instrumentiem. Tā nodrošina lietotājiem būtību, kur izveidot pašlabiekājīgas agentes, noteikt, ko tie ierauga kā problēmu, un zināt pārīžu. Platforms piedāvā dažādu atslēgu: agentu novērtēšanu, optimizāciju un virtuālās diskusijas simulēšanu. Lietotāji var izveidot un pārvaldīt scenārijus, un platforms piedāvā analītiku un optimizācijas iekārtas, lai uzlabotu agentu lietderību. Future AGI tiek rakstīts kā kļūdinoi, kas paredzēts daudzpusējiem lietotājiem, kuri vēlas izmantot cilnis apriņķa spēja bīdās vai cilnis apriņķa palīgiem. Tas ļauj lietotājiem simulēt konversācijas, vērtēt un optmēt cilnis apriņķa izpratni, kā arī integrēt zināšanu bāzes. Apkārtnei kā redzams, ir tools developers kļūdtam sāt un precizēt cilnis apriņķa palīgus, nevis parējo interfaces. platforms iepriekš lietošanas rezultātiem piedāvā iespējas agenta novērtēšanai, simulētam konversācijām un scenāriju pārvaldei. Tas ļauj lietotājiem rediģēt un pārvaldīt atsauksmes, pievienot izgūšanas stāstus par zināšanu bāziem, un integrēt ar pasaulē esošajām atsauksmēm, lai apstrādātu sarežģītus situācijas. Tomēr Future AGI piešķir vērtīgas funkcijas AI attīstībai un optimizācijai, arī tas paredz to lielākai robeža. Piemēram, tas ir stiprināts uz vispārīgu zināšanu, un iespējams, ka ir nepieciešamas papildu darbības komplēksākajiem scenārijiem. Papildus, platformas atkarība no simulētajiem konversācijām var ierobežot to iespēju apgūt reālo pasauli neskaidras faktoru. Future AGI skaidri sniedz tikai vienādus iespējas attīstībai un optimizācijai, izstrādājot ASV sistēmas. Tā pilna vērtēšanas un optimizācijas līdzekļi nodrošina tajā redzamu resursu izstrādātājiem, kas vēlas paplašīt saviem ASV agentei. Tomēr varētu būt nepieciešama papildu izstrāde vai integrācija, lai šajā gadījumā apspriežīgi izvairītos no daudzkompleksas skatu apstākļu un realitātes neskaidrībās situācijām.
Kritēriju sadalījums
- Agentu novērtēšana un reitēšana
- Simulētas sarunas un scenāriju pārvaldība
- Zināšanu bāzes integrācija un atgūšana
- Globālo piezīmju apstrāde sarežģītām situācijām
- Analītikas un optimizācijas rīki

Inspeq AI
Uzņēmumu platforma atbildīgas AI ieviešanai ģeneratīvās AI lietojumprogrammās.
Inspeq AI palīdz organizācijām pārcelt atbildīgu AI no regulativo dokumentu praktiski darbības līmenī. Platforma sniedz iekārtas, lai izvērtētu, monitorētu un valdētu generatīvo AI lietojumprogrammu visu dzīves ciklu laikā, uzsvērotās kvalitātes, drošības un konformitātes rādītāji ar mēroga metāmi. Tīmehm nācis iespēja uzraudzīt automātiskas izvērtēšanas rezultātus, ko izveido lūdzamie jeb LLM iespējas, sekot problēmām, kā arī uzraudzīt viltus satura, diskriminācijas un nezināmajai riska ieguldījumiem, kas iekļauti prompā. Darbvietu un atsauksmju funkcijas ir izveidotas, ņemot vērā to, ka to var izmantot tehnoloģu komandas, riska izvērtētājiem un biznesa līdzekļu īpašniekiem, lai vienas redzētu modela pārvaldību. Tāds ir pielāgots galvenokārt lielām uzņēmējām, kurām ir jābūt izstrādājotem klientu koncentrētu vai regulējamajiem GenAI produktiem, kuriem ir nepieciešama pastāvīga pārbaudītspēja un auditēšanas iespēja.
Kritēriju sadalījums
- Automatizēta LLM izvades novērtēšana
- Metricas par aizspriedumiem, toksiskumu un hallucināciju
- Ierosījumu un atbilžu uzraudzība
- Pārvaldības un atbilstības ziņošana
- Pipeline un API integrācijas
- Dashboards tehniskajām un risku komandām


Maxim AI ir programmu izstrādes platforma, kurā ir izveidoti resursi, lai komandas var izlādēt izturīgas AI agentes un LLM aplikācijas. Platformā tiek apvienota uzdevumu izstrāde, novērtēšana, monitorēšana un datu sadalījums, lai komandas var iterēt ātri, savukārt kvalitāte varētu būt noteikta. Platforma atbalsta automātiskus un cilvēka vērtējumus dažādos modeļos un izvēles punktos, ļaujot inženieri salīdzināt izvades, detektēt atkārtoto attīrstojošo izmaiņu, un secināt neveiksmes produkcijā. Tā ir projekta cilvēkiem izstrādāta, ar darbflēbām, kas ļaujas tikai tehisku un ne-tehisku interesēto puožu dalīties testēšanā un pārbaudē. Maxim parasti tiek izmantots komandām, kas būvē chatbotus, coplejotājus, vokālās agentes un daudzu-pazīšanas darbībju secību, kurām nepiechoty vienmērīga izvērsuma kvalitāte izmaiņu iemeslu, modelu un lietotāju ievades laikā.
Kritēriju sadalījums
- Promptu spēlētne un versiju kontrole
- Automatizēta agenta un LLM novērtēšana
- Ražošanas novērojamība un izsekošana
- Datu kopumu kurēšana un pārvaldība
- Cilvēka pārskatīšana un anotācijas darba plūsmas
- Daudzmodeļu un daudzpakalpojumu atbalsts

Temperstack
AI vadīta uzticamības platforma, kas automatizē uzraudzību, brīdinājumus un incidentu pārvaldību caur novērošanas komplektiem.

Temperstack ir uzticamības inženierijas platforma, kas izmanto AI, lai vienotu uzraudzību, brīdinājumus un incidentu atbildēšanu caur rīkiem, ko komandas jau izmanto. Tā vietā, lai aizvietotu esošos novērošanas komplektus, tā pārklāj tos, lai atklātu pārklājuma trūkumus, radītu nozīmīgus brīdinājumus un vienkāršotu, kā uzraudzības komandām reaģē uz problēmām. Platforma palīdz SRE un DevOps komandām samazināt brīdinājumu nogurumu, īsināt vidējo laiku līdz izšķirtam, un uzturēt konsekventas uzticamības standarts visos pakalpojumos. Automatizējot rutīnas uzdevumus, piemēram, brīdinājumu konfigurēšanu, runbook izpildi un incidentu pēcnāksmi, Temperstack atbrīvo inženierus, lai koncentrētos uz augstvērtīgu uzticamības darbu.
Kritēriju sadalījums
- AI atbalstīta brīdinājumu konfigurēšana
- Pārplūdes rīku incidentu pārvaldība
- Automatizēti uzraudzības auditi
- Runbook automatizācija
- Pēcnākšanas pārskats un analīze
- Integrācijas ar galvenajiem novērošanas platformām

Arize AI
Platforma ar vienības redzamību un LLM vērtēšanas funkcionalitāti, kas palīdz AI attīstītājiem un dati zinātājiem monitorēt, uzlabot un uzlabot LLM pakalpojumu izdevumus dažādās sastādīšanas stadijās.

Arize AI ir kompleksas observability un LLM (viegliema valodu modelu) vērtēšanas platforma. Tas palīdz kiberinteligencijas attīstītājiem un datu zinātniekiem monitorēt, novērst problēmas un palielināt to kiberinteligencijas modelu darbības efektīvumu. Platformas funkcionalitāte ir pierāda problēms un piedāvā risinājumus, palīdzot lietotājiem labot savu modelu precizitāti un reliabilitāti. Arize AI ir projektu kiberinteligencijas attīstītājiem un datu zinātniekiem, kuri vēlas palielināt savu modelu darbības efektīvumu. Platfromas spējas ietver monitorēšanu un problēmu novēršanu, atļaujot lietotājiem tikai brīžīgi identificēt un risināt problēmas. Arize AI arī piedāvā iespējas vērtēt un palielināt modela darbības efektīvumu, atļaujot lietotājiem attīstīt savus modelus laika gaitā. Izmantojot Arize AI, lietotāji var nodrošināt, ka tās kiberinteligencijas modeli darbojas optimētu veidu, kas ir nepieciešams labākiem norādiem un rezultātiem. Platforms koncentrācijā uz observability un vērtēšanu to atdala no citiem kiberinteligencijas attīstības instrumentiem, padarot to par vērtīgu resursu personām, kas strādā ar lielo valodu modeliem un citām kompleksajām AI sistēmām.
Kritēriju sadalījums
- Virtuālās risības uzvedības monitorings
- Noteikto problēmu novērošana un izšķirošana
- Paskaidrotais risību sagatavošana
- Modela izpratnes novērošana
- LMM risību novērošana un optimizācija

Weave
Nav koda AI darbplūsmas veidotājs, kas ļauj uzņēmumiem automatizēt operācijas, integrējot vairākus lielos valodas modeļus (LLM) un savienojot uzvednes…

W&B Weave ir novērošanas un novērtējuma platforma, kas palīdz izsekot un uzlabot lielo valodas modeļu (LLM) lietojumprogrammas. Weave nodrošina rīkus sesiju, LLM izsaukumu un rīku izsaukumu izsekošanai, datu metrikas vākšanai un lietojumprogrammas atbildes novērtēšanai, izmantojot LLM tiesnešus un pielāgotus vērtētājus. Galvenās funkcijas ietver sesiju, LLM izsaukumu un rīku izsaukumu izsekošanu, kā arī manuālu pielāgotu aģentu instrumentēšanu. Platforma atbalsta integrācijas ar populāriem SDK un harness, kā arī pielāgotas aģentu novērošanas iespējas. Weave piedāvā Python un TypeScript bibliotēkas platformas instalēšanai un lietošanai. Tā tiek mitināta uz Weights & Biases (W&B) platformas, un piekļuvei nepieciešams W&B konts un API atslēga. Lietotāji var izsekot izsaukumus uz LLM, pārskatīt ievades un izejas, kā arī skatīt aģentu metrikas Weave UI. Lai gan Weave ļauj automatizēt un novērtēt LLM lietojumprogrammas, tas nav nav koda AI darbplūsmas veidotājs, kā norāda nosaukums.
Kritēriju sadalījums
- Aģentu izsekošana un metrikas vākšana
- Pielāgota aģentu novērošana
- LLM izsekošana un novērtēšana
- OpenTelemetry posmu atbalsts
- Weights & Biases (W&B) integrācijas
- Python un TypeScript bibliotēkas








