Iepriekšējā cīņa · 2024-01-11 UTC
Observability Sadursme — 2024. gada 11. janvāris
No Observability kategorijas. 40 atzīmes izvietotas starp 10 cīnītājiem. Quotient AI izcīnīja kroni.
Gala rezultāti
Sastāvs
Cīnītāji
Katra rīka profili, kas piedalījās šajā cīņā, sarindoti pēc to gala rezultāta.

Quotient AI
Reālā laika monitoringa un novērtēšanas platforma, lai noķertu AI kļūdas meklēšanā, RAG un aģentos.
Quotient AI ir observēšanas un novērtēšanas platforms, ko ir veidota pieaugušām komandām, kas ir nodarbinātas ar AI ietvarus izveidošanu. Tā noritīgi monitorē AI sestību produktīvās darbības, tostarp meklēšanas, atkārtu iegūšanas un palielināšanas (RAG), un autonomo agentus, lai uzreiz izslaucītu iluzijas, atkārtu iegūšanas kļūdas un citus kvalitātes problēmus, pirms tiek saskartas tikai izmantošanas brīdī, kad lietotāji tie tiem nokļūst,. Platforma sadala automātiskas vērtējumus ar real-time ziņojumiem, palīdzot inženieru un ML komandām diagnose root kārtas, pavadīt regresijas, izmaiņu modelim vai iepriekš liku lielāka pieejamība. Instrumentējot AI dzelzceļu, Quotient doto radītājiem redzamību tikai to, kādā to izmantošanas rezultāciām faktiski notiek, ne tikai atkarībā no offline rīkstājiem.
Kritēriju sadalījums
- Reālā laika AI monitoring un alertēšana
- Halucināciju un aizgūšanas kļūdu noteikšana
- Novērtēšanas rīki RAG konveijeriem
- Aģentu uzvedības izsekošana un diagnosticēšana
- Regresijas analīze starp modeļa un solījuma izmaiņām
- Ražošanas observability AI lietotnēm

Weave
Nav koda AI darbplūsmas veidotājs, kas ļauj uzņēmumiem automatizēt operācijas, integrējot vairākus lielos valodas modeļus (LLM) un savienojot uzvednes…

W&B Weave ir novērošanas un novērtējuma platforma, kas palīdz izsekot un uzlabot lielo valodas modeļu (LLM) lietojumprogrammas. Weave nodrošina rīkus sesiju, LLM izsaukumu un rīku izsaukumu izsekošanai, datu metrikas vākšanai un lietojumprogrammas atbildes novērtēšanai, izmantojot LLM tiesnešus un pielāgotus vērtētājus. Galvenās funkcijas ietver sesiju, LLM izsaukumu un rīku izsaukumu izsekošanu, kā arī manuālu pielāgotu aģentu instrumentēšanu. Platforma atbalsta integrācijas ar populāriem SDK un harness, kā arī pielāgotas aģentu novērošanas iespējas. Weave piedāvā Python un TypeScript bibliotēkas platformas instalēšanai un lietošanai. Tā tiek mitināta uz Weights & Biases (W&B) platformas, un piekļuvei nepieciešams W&B konts un API atslēga. Lietotāji var izsekot izsaukumus uz LLM, pārskatīt ievades un izejas, kā arī skatīt aģentu metrikas Weave UI. Lai gan Weave ļauj automatizēt un novērtēt LLM lietojumprogrammas, tas nav nav koda AI darbplūsmas veidotājs, kā norāda nosaukums.
Kritēriju sadalījums
- Aģentu izsekošana un metrikas vākšana
- Pielāgota aģentu novērošana
- LLM izsekošana un novērtēšana
- OpenTelemetry posmu atbalsts
- Weights & Biases (W&B) integrācijas
- Python un TypeScript bibliotēkas
AgentOps
Pārbaudītspēja un izklausīšanās platforma AI zinotņekļu veidošanai ar reliabilaiem līdzekļiem

AgentOps ir izstrādātāju platforma, kas koncentrējas uz AI aģentu mūža ciklu, sniedzot pēdējošanas, monitorēšanas un atkļūdošanas rīkus, kas atklāj, ko aģenti faktiski dara izpildes laikā. Tā ieraksta LLM izsaukumus, rīku izmantošanu, izmaksas un kļūdas, lai komandas varētu izprast aģentu uzvedību kompleksos daudzcīņu darbplūsmās. Papildus redzamībai, AgentOps piedāvā sesiju atkārtojumu, veiktspējas analītiku un integrāciju ar populāriem aģentu struktūrām, piemēram, LangChain, CrewAI un AutoGen. Tas palīdz inženieri pāriet no parauga modeļa uz ražošanu ar mērāmu uzticamību, nevis atkarīgi no nejaušības uzskatiem vai loga izskalošanas. Tas ir domāts izstrādātājiem un komandām, kuras izstrādā aģentu lietotnes, kuriem ir nepieciešams sekot līdzi atkāpēm, kontrolēt izdevumus un pierādīt, ka viņu aģenti uzvedas pareizi pirms un pēc izvietošanas.
Kritēriju sadalījums
- Zinotņekļa sesijas ierakstāšana un atdzīviskā skatīšana
- LLM saiti un rīku izmantības trāces
- Izdevumu un tokenu analītika
- Kļūdu un sūtības detektēšana
- Rīku SDKs programmēšanai Python un JavaScript
- Kartēm par zinotņekļa izmēģinājumu metriki
Confident AI
LLM novērtēšanas platforma, kas balstīta uz DeepEval, lai testētu, uzraudzītu un uzlabotu mākslīgā intelekta lietojumprogrammas.

Confident AI ir novērtēšanas un novērošanas platforma komandām, kas izstrādā lielu valodu modeļu lietojumprogrammas. Balstoties uz atvērtā koda DeepEval rāmijumu, tā nodrošina vienotu darba telpu, lai palaistu atzīmi, regresijas testus un kvalitātes pārbaudes pār promptiem, modeļiem un atpazīšanas ķēdēm. Platforma palīdz inženieriem apturēt halucinācijas, promptu regresijas un atpazīšanas kļūdas pirms piegādes, vienlaikus piedāvājot ražošanas uzraudzību, lai sekotu reālajiem lietotāju mijiedarbības datiem. Komandas var centralizēt datu kopas, koplietot testēšanas rezultātus un iterēt uzpromptus ar mērogojamu atgriezenisko saiti, nevis uz spekulācijām. Tā ir paredzēta izstrādātājiem, ML inženieriem un QA komandām, kas vēlas strukturētu, metrika balstītu pieeju LLM kvalitātes nodrošināšanai, nevis ad-hoc manuālo pārskatīšanu.
Kritēriju sadalījums
- DeepEval balstītas novērtēšanas metrikas
- Regresijas testēšana uz promptiem un modeļiem
- RAG un retrieval novērtēšana
- Ražošanas izsekošana un uzraudzība
- Datu kopu un testēšanas gadījumu pārvaldība
- Komandas sadarbība uz novērtējuma rezultātiem

Fiddler AI
AI observabilitātes un drošības platforma ML un LLM lietojumprogrammu uzraudzībai, skaidrošanai un pārvaldībai

Fiddler AI ir pakalpojums, kas palīdz organizācijām monitorēt, analizēt un aizsargāt neuronu mašīnu modeļus un generatīvo AI lietojumus izvietotā vietā. Tas nodod ieskatu modeļa darbības sīkumu, datiem pārnesumu, diskriminācijas un kvalitātes sāpes, kā arī piedāvā aizsardzību pretrunām, kas ir sūtītas tieši LLMs, tādu kā vajāšana, aicinājumu ievade, un nepilnīgas datu izdevuma. Sagatavots ML inženieriem, dati zinātniekam un riska un kontrolu komandām, Fiddler kombinē patiesību, reālo monitoringu, un barjeras vienlaicīgā darbības procesā. Tā integrējas ar parasta ML saskaņotu ietilpību un nolūkļaudējos vidi, palīdzot organizācijām iedarbosies atbildīgas AI praksē skalu.
Kritēriju sadalījums
- Modeļu veiktspējas un kustības uzraudzība
- LLM hallucināciju un drošības noteikšana
- Prompt injekcijas un jailbreak aizsardzība
- Skaitāma AI un sakņu cēlu analīze
- Neobjektivitātes un taisnīguma izvērtēšana
- Instrumentu paneli un brīdinājumi ražošanas AI


Portkey ir vienots kontrolplāns AI lietotņu izstrādei, pārvaldībai un monitorēšanai. Tas nodrošina visaptverošu platformu AI komandām, lai nokļūtu līdz ražošanai, piedāvājot tādas funkcijas kā AI vārti, novērojamība, drošības līnijas, pārvaldība un soliņu pārvaldība. Šī platforma ļauj lietotājiem piekļūt vairāk nekā 1600 LLM modeļiem caur vienuoturu API, vienkāršojot modeļu integrācijas procesu un ļaujot komandām koncentrēties uz izstrādi, nevis pārvaldību. Portkey arī piedāvā reālā laika novērojamību, ļaujot lietotājiem monitorēt LLM uzvedību, nozīmīgi agru noskaidrot anomālijas un pārvaldīt lietošanu preventīvi. Papildus tam platforma nodrošina kešatmiņas iespējas, kas ir demonstrējušas lietotājiem tūkstošu dolāru taupījumu, samazinot dublējošos testus. Portkey ir izstrādāts AI komandām un atbalsta plašu LLM modeļu klāstu, ar vairāk nekā 3000 GenAI komandām un lielu tokena apjoma apstrādi diennakts laikā.
Kritēriju sadalījums
- AI vārti ar daudzpakāpenisku maršrutēšanu
- Solīņu pārvaldība un versiju pārvaldība
- Pieprasījumu žurnāli, izsekošana un analītika
- Semantiskā kešatmiņa un atkārtojumi
- Drošības līnijas ievades un izvades validācijai
- Lietošanas un izmaksu monitorēšanas paneļi
Relari (YC W24)
Testēšanas, novērtēšanas un sintētisko datu ģenerācijas platforma AI aģentiem.

Relari ir tiešsaistes platforma, kuras pamatā ir uzlabot AI aģentu patstāvīguma kvalitāti, izmantodams sistematisku testēšanu un novērtēšanu metodes. Tās palīdz komandām sagatavot sintetiskos datu sēklienus, izpildīt automatizētu novērtējumu un novērtēt aģentu darbu kvalitāti uzskatāmu scenāriju daudzumā pirms produkta izplatīšanas. Tuvēji sadarbojoties ar Y Combinator (W24), Relari mērķis ir inženieru komandas, kas veido komplexās LLM (nozīmē to, ka tie ir liela mēroga teicēji) lietišķo aplikāciju un daudzu līmeņu agentu, kurām tradicionālā kvalitātes pārbaude neizdevas pilnīgi. Relari tehnoloģija gaida, lai ieviestu programmētāju metodikas ieguvumi - vienītes testus, reģresiju kontroles un noteiktas mērījamas rādītāju, - neizdevīgās, dažādās atbildes garantijām tiešojāmu izmantošanu AI sistēmās. Platforma atbalsta pielietotu vērtētājus, scenāru simuli, un noteiktas monitorēšanas, tad tai ir liela vērtība, kad tiek izmantoti gan pre-lauza validācija, gan reāla laika kvalitātes nodrošināšana ražošanas agentiem.
Kritēriju sadalījums
- Sintētisku datu kopumu ģenerācija
- Automātiskā aģentu novērtēšanas konveijeri
- Scenārija un konversāciju simulācija
- Personalizējamās novērtēšanas metrikas
- Regressijas testēšana LLM lietotnēs
- Efektivitātes benchmarkingu un atskaitēšana

Arize AI
Platforma ar vienības redzamību un LLM vērtēšanas funkcionalitāti, kas palīdz AI attīstītājiem un dati zinātājiem monitorēt, uzlabot un uzlabot LLM pakalpojumu izdevumus dažādās sastādīšanas stadijās.

Arize AI ir kompleksas observability un LLM (viegliema valodu modelu) vērtēšanas platforma. Tas palīdz kiberinteligencijas attīstītājiem un datu zinātniekiem monitorēt, novērst problēmas un palielināt to kiberinteligencijas modelu darbības efektīvumu. Platformas funkcionalitāte ir pierāda problēms un piedāvā risinājumus, palīdzot lietotājiem labot savu modelu precizitāti un reliabilitāti. Arize AI ir projektu kiberinteligencijas attīstītājiem un datu zinātniekiem, kuri vēlas palielināt savu modelu darbības efektīvumu. Platfromas spējas ietver monitorēšanu un problēmu novēršanu, atļaujot lietotājiem tikai brīžīgi identificēt un risināt problēmas. Arize AI arī piedāvā iespējas vērtēt un palielināt modela darbības efektīvumu, atļaujot lietotājiem attīstīt savus modelus laika gaitā. Izmantojot Arize AI, lietotāji var nodrošināt, ka tās kiberinteligencijas modeli darbojas optimētu veidu, kas ir nepieciešams labākiem norādiem un rezultātiem. Platforms koncentrācijā uz observability un vērtēšanu to atdala no citiem kiberinteligencijas attīstības instrumentiem, padarot to par vērtīgu resursu personām, kas strādā ar lielo valodu modeliem un citām kompleksajām AI sistēmām.
Kritēriju sadalījums
- Virtuālās risības uzvedības monitorings
- Noteikto problēmu novērošana un izšķirošana
- Paskaidrotais risību sagatavošana
- Modela izpratnes novērošana
- LMM risību novērošana un optimizācija

Edwin AI
AI asistents IT operācijām, kas paātrina incidentu atklāšanu, triage un atrisināšanu.

Edwin AI ir AI asistents IT operācijām, kas paredzēts, lai paātrinātu incidentu atklāšanu, triage un atrisināšanu. Tas nodrošina centralizētu platformu IT komandām incidentu izmeklēšanai, to ietekmes saprašāšanai, labošanas meklēšanai vai ģenerēšanai, un to piemērošanai visās esošajās rīkos, bez vajadzības pārslēgties starp sistēmām. Edwin AI korelas alertus, identificē pamata iemeslus un automātiski sāk atlīdzināšanu, sākot no pirmā brīdinājuma līdz pārbaudītam izdevam. Tas izmanto vēsturiskos modeļus un novērošanas datus, lai prognozētu un novērstu izslēgšanas. Šis rīks integrējas ar vairāk kā 3 000 rīkiem, tostarp novērošanas, APM, drošības un CMDB jomās, nodrošinot reāllaika, darbības informāciju un novēršot silo struktūru. Forrester pētījums atklāja, ka Edwin AI sniedza 313% atdevi (ROI) kompozītai organizācijai, ar atdeves periodu 6 mēneši vai mazāk.
Kritēriju sadalījums
- Alertu korelācija un trokšņa samazināšana
- AI vadītās pamata iemeslu ieteikumi
- Dabas valodas incidentu kopsavilkumi
- Integrācijas ar ITSM un novērošanas platformām
- Automatizēti triage darba plūsmas
- Zināšanu bagātināšana no iepriekšējiem incidentiem

FoundryAI
Izveidojiet, novērtējiet un uzlabojiet AI agentus uzņēmējdarbības automatizācijai

FoundryAI ir attīstības platforma, kas paredzēta tiešu biznesa procesu vadībai, izmantojot AI agentus. Tajā kombinēti līdzekļi agenta dizainam, testēšanai un nepārtrauktu uzlabojumu mehānismu, lai komandas varu pārcelties no prototipa līdz produkcijai bez sadalīšanas kārtas dažādām sistēmām. Platforma piešķirība ir priekšroka, nododot būvējiem iespējas pārbaudīt agentu risinājumu darbību atbilstoši definētiem uzdevumiem un sagatavot tos laika gaitā. Tas padara platformu piemērotu organizācijām, kas automātizē klientu atbalstu, interņu darbību vai atkārtotu zinību darbu, kurā noturība ir nozīmīga. FoundryAI paredž no profesionāliem komandām, kurām ir nepieciešama iepirkšanās kontroles funkcionalitāte, kas ir pieejama no koda, bet vēlama tiktu ātrāka iterācijas periods, izpētesa, nekā tas sākotnēji ir pielāgotam no paša pacīnām.
Kritēriju sadalījums
- Agentu izveides vide
- Novērtēšanas un testēšanas rīki
- Veiktspējas uzraudzība
- Darba plūsmu automatizācijas atbalsts
- Iteratīvās uzlabošanas cikli
- Integrācija ar uzņēmējdarbības sistēmām






