Iepriekšējā cīņa · 2024-01-11 UTC

Observability Sadursme — 2024. gada 11. janvāris

No Observability kategorijas. 40 atzīmes izvietotas starp 10 cīnītājiem. Quotient AI izcīnīja kroni.

Gala rezultāti

Sastāvs

Cīnītāji

Katra rīka profili, kas piedalījās šajā cīņā, sarindoti pēc to gala rezultāta.

1Quotient AI logo

Quotient AI

Reālā laika monitoringa un novērtēšanas platforma, lai noķertu AI kļūdas meklēšanā, RAG un aģentos.

4.4 (5)
Bezmaksas

Quotient AI ir observēšanas un novērtēšanas platforms, ko ir veidota pieaugušām komandām, kas ir nodarbinātas ar AI ietvarus izveidošanu. Tā noritīgi monitorē AI sestību produktīvās darbības, tostarp meklēšanas, atkārtu iegūšanas un palielināšanas (RAG), un autonomo agentus, lai uzreiz izslaucītu iluzijas, atkārtu iegūšanas kļūdas un citus kvalitātes problēmus, pirms tiek saskartas tikai izmantošanas brīdī, kad lietotāji tie tiem nokļūst,. Platforma sadala automātiskas vērtējumus ar real-time ziņojumiem, palīdzot inženieru un ML komandām diagnose root kārtas, pavadīt regresijas, izmaiņu modelim vai iepriekš liku lielāka pieejamība. Instrumentējot AI dzelzceļu, Quotient doto radītājiem redzamību tikai to, kādā to izmantošanas rezultāciām faktiski notiek, ne tikai atkarībā no offline rīkstājiem.

Kritēriju sadalījums

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Reālā laika AI monitoring un alertēšana
  • Halucināciju un aizgūšanas kļūdu noteikšana
  • Novērtēšanas rīki RAG konveijeriem
  • Aģentu uzvedības izsekošana un diagnosticēšana
  • Regresijas analīze starp modeļa un solījuma izmaiņām
  • Ražošanas observability AI lietotnēm
2Weave logo

Weave

Nav koda AI darbplūsmas veidotājs, kas ļauj uzņēmumiem automatizēt operācijas, integrējot vairākus lielos valodas modeļus (LLM) un savienojot uzvednes…

4.8 (5)
Bezmaksas
Weave ekrāna attēls

W&B Weave ir novērošanas un novērtējuma platforma, kas palīdz izsekot un uzlabot lielo valodas modeļu (LLM) lietojumprogrammas. Weave nodrošina rīkus sesiju, LLM izsaukumu un rīku izsaukumu izsekošanai, datu metrikas vākšanai un lietojumprogrammas atbildes novērtēšanai, izmantojot LLM tiesnešus un pielāgotus vērtētājus. Galvenās funkcijas ietver sesiju, LLM izsaukumu un rīku izsaukumu izsekošanu, kā arī manuālu pielāgotu aģentu instrumentēšanu. Platforma atbalsta integrācijas ar populāriem SDK un harness, kā arī pielāgotas aģentu novērošanas iespējas. Weave piedāvā Python un TypeScript bibliotēkas platformas instalēšanai un lietošanai. Tā tiek mitināta uz Weights & Biases (W&B) platformas, un piekļuvei nepieciešams W&B konts un API atslēga. Lietotāji var izsekot izsaukumus uz LLM, pārskatīt ievades un izejas, kā arī skatīt aģentu metrikas Weave UI. Lai gan Weave ļauj automatizēt un novērtēt LLM lietojumprogrammas, tas nav nav koda AI darbplūsmas veidotājs, kā norāda nosaukums.

Kritēriju sadalījums

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Aģentu izsekošana un metrikas vākšana
  • Pielāgota aģentu novērošana
  • LLM izsekošana un novērtēšana
  • OpenTelemetry posmu atbalsts
  • Weights & Biases (W&B) integrācijas
  • Python un TypeScript bibliotēkas
3A

AgentOps

Pārbaudītspēja un izklausīšanās platforma AI zinotņekļu veidošanai ar reliabilaiem līdzekļiem

4.5 (4)
Bezmaksas
AgentOps ekrāna attēls

AgentOps ir izstrādātāju platforma, kas koncentrējas uz AI aģentu mūža ciklu, sniedzot pēdējošanas, monitorēšanas un atkļūdošanas rīkus, kas atklāj, ko aģenti faktiski dara izpildes laikā. Tā ieraksta LLM izsaukumus, rīku izmantošanu, izmaksas un kļūdas, lai komandas varētu izprast aģentu uzvedību kompleksos daudzcīņu darbplūsmās. Papildus redzamībai, AgentOps piedāvā sesiju atkārtojumu, veiktspējas analītiku un integrāciju ar populāriem aģentu struktūrām, piemēram, LangChain, CrewAI un AutoGen. Tas palīdz inženieri pāriet no parauga modeļa uz ražošanu ar mērāmu uzticamību, nevis atkarīgi no nejaušības uzskatiem vai loga izskalošanas. Tas ir domāts izstrādātājiem un komandām, kuras izstrādā aģentu lietotnes, kuriem ir nepieciešams sekot līdzi atkāpēm, kontrolēt izdevumus un pierādīt, ka viņu aģenti uzvedas pareizi pirms un pēc izvietošanas.

Kritēriju sadalījums

Ease of use0
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Zinotņekļa sesijas ierakstāšana un atdzīviskā skatīšana
  • LLM saiti un rīku izmantības trāces
  • Izdevumu un tokenu analītika
  • Kļūdu un sūtības detektēšana
  • Rīku SDKs programmēšanai Python un JavaScript
  • Kartēm par zinotņekļa izmēģinājumu metriki
4Confident AI logo

Confident AI

LLM novērtēšanas platforma, kas balstīta uz DeepEval, lai testētu, uzraudzītu un uzlabotu mākslīgā intelekta lietojumprogrammas.

4.6 (5)
Bezmaksas
Confident AI ekrāna attēls

Confident AI ir novērtēšanas un novērošanas platforma komandām, kas izstrādā lielu valodu modeļu lietojumprogrammas. Balstoties uz atvērtā koda DeepEval rāmijumu, tā nodrošina vienotu darba telpu, lai palaistu atzīmi, regresijas testus un kvalitātes pārbaudes pār promptiem, modeļiem un atpazīšanas ķēdēm. Platforma palīdz inženieriem apturēt halucinācijas, promptu regresijas un atpazīšanas kļūdas pirms piegādes, vienlaikus piedāvājot ražošanas uzraudzību, lai sekotu reālajiem lietotāju mijiedarbības datiem. Komandas var centralizēt datu kopas, koplietot testēšanas rezultātus un iterēt uzpromptus ar mērogojamu atgriezenisko saiti, nevis uz spekulācijām. Tā ir paredzēta izstrādātājiem, ML inženieriem un QA komandām, kas vēlas strukturētu, metrika balstītu pieeju LLM kvalitātes nodrošināšanai, nevis ad-hoc manuālo pārskatīšanu.

Kritēriju sadalījums

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs0
Reliability1
  • DeepEval balstītas novērtēšanas metrikas
  • Regresijas testēšana uz promptiem un modeļiem
  • RAG un retrieval novērtēšana
  • Ražošanas izsekošana un uzraudzība
  • Datu kopu un testēšanas gadījumu pārvaldība
  • Komandas sadarbība uz novērtējuma rezultātiem
5Fiddler AI logo

Fiddler AI

AI observabilitātes un drošības platforma ML un LLM lietojumprogrammu uzraudzībai, skaidrošanai un pārvaldībai

4.7 (6)
Bezmaksas
Fiddler AI ekrāna attēls

Fiddler AI ir pakalpojums, kas palīdz organizācijām monitorēt, analizēt un aizsargāt neuronu mašīnu modeļus un generatīvo AI lietojumus izvietotā vietā. Tas nodod ieskatu modeļa darbības sīkumu, datiem pārnesumu, diskriminācijas un kvalitātes sāpes, kā arī piedāvā aizsardzību pretrunām, kas ir sūtītas tieši LLMs, tādu kā vajāšana, aicinājumu ievade, un nepilnīgas datu izdevuma. Sagatavots ML inženieriem, dati zinātniekam un riska un kontrolu komandām, Fiddler kombinē patiesību, reālo monitoringu, un barjeras vienlaicīgā darbības procesā. Tā integrējas ar parasta ML saskaņotu ietilpību un nolūkļaudējos vidi, palīdzot organizācijām iedarbosies atbildīgas AI praksē skalu.

Kritēriju sadalījums

Ease of use1
Value for money1
Features & power0
Integrations1
Support & docs1
Reliability1
  • Modeļu veiktspējas un kustības uzraudzība
  • LLM hallucināciju un drošības noteikšana
  • Prompt injekcijas un jailbreak aizsardzība
  • Skaitāma AI un sakņu cēlu analīze
  • Neobjektivitātes un taisnīguma izvērtēšana
  • Instrumentu paneli un brīdinājumi ražošanas AI
6Portkey logo

Portkey

Vienots kontrolplāns AI lietotņu izstrādei, pārvaldībai un monitorēšanai

4.4 (5)
Bezmaksas
Portkey ekrāna attēls

Portkey ir vienots kontrolplāns AI lietotņu izstrādei, pārvaldībai un monitorēšanai. Tas nodrošina visaptverošu platformu AI komandām, lai nokļūtu līdz ražošanai, piedāvājot tādas funkcijas kā AI vārti, novērojamība, drošības līnijas, pārvaldība un soliņu pārvaldība. Šī platforma ļauj lietotājiem piekļūt vairāk nekā 1600 LLM modeļiem caur vienuoturu API, vienkāršojot modeļu integrācijas procesu un ļaujot komandām koncentrēties uz izstrādi, nevis pārvaldību. Portkey arī piedāvā reālā laika novērojamību, ļaujot lietotājiem monitorēt LLM uzvedību, nozīmīgi agru noskaidrot anomālijas un pārvaldīt lietošanu preventīvi. Papildus tam platforma nodrošina kešatmiņas iespējas, kas ir demonstrējušas lietotājiem tūkstošu dolāru taupījumu, samazinot dublējošos testus. Portkey ir izstrādāts AI komandām un atbalsta plašu LLM modeļu klāstu, ar vairāk nekā 3000 GenAI komandām un lielu tokena apjoma apstrādi diennakts laikā.

Kritēriju sadalījums

Ease of use1
Value for money0
Features & power1
Integrations0
Support & docs1
Reliability1
  • AI vārti ar daudzpakāpenisku maršrutēšanu
  • Solīņu pārvaldība un versiju pārvaldība
  • Pieprasījumu žurnāli, izsekošana un analītika
  • Semantiskā kešatmiņa un atkārtojumi
  • Drošības līnijas ievades un izvades validācijai
  • Lietošanas un izmaksu monitorēšanas paneļi
7Relari (YC W24) logo

Relari (YC W24)

Testēšanas, novērtēšanas un sintētisko datu ģenerācijas platforma AI aģentiem.

4.3 (6)
Bezmaksas
Relari (YC W24) ekrāna attēls

Relari ir tiešsaistes platforma, kuras pamatā ir uzlabot AI aģentu patstāvīguma kvalitāti, izmantodams sistematisku testēšanu un novērtēšanu metodes. Tās palīdz komandām sagatavot sintetiskos datu sēklienus, izpildīt automatizētu novērtējumu un novērtēt aģentu darbu kvalitāti uzskatāmu scenāriju daudzumā pirms produkta izplatīšanas. Tuvēji sadarbojoties ar Y Combinator (W24), Relari mērķis ir inženieru komandas, kas veido komplexās LLM (nozīmē to, ka tie ir liela mēroga teicēji) lietišķo aplikāciju un daudzu līmeņu agentu, kurām tradicionālā kvalitātes pārbaude neizdevas pilnīgi. Relari tehnoloģija gaida, lai ieviestu programmētāju metodikas ieguvumi - vienītes testus, reģresiju kontroles un noteiktas mērījamas rādītāju, - neizdevīgās, dažādās atbildes garantijām tiešojāmu izmantošanu AI sistēmās. Platforma atbalsta pielietotu vērtētājus, scenāru simuli, un noteiktas monitorēšanas, tad tai ir liela vērtība, kad tiek izmantoti gan pre-lauza validācija, gan reāla laika kvalitātes nodrošināšana ražošanas agentiem.

Kritēriju sadalījums

Ease of use1
Value for money1
Features & power0
Integrations1
Support & docs1
Reliability0
  • Sintētisku datu kopumu ģenerācija
  • Automātiskā aģentu novērtēšanas konveijeri
  • Scenārija un konversāciju simulācija
  • Personalizējamās novērtēšanas metrikas
  • Regressijas testēšana LLM lietotnēs
  • Efektivitātes benchmarkingu un atskaitēšana
8Arize AI logo

Arize AI

Platforma ar vienības redzamību un LLM vērtēšanas funkcionalitāti, kas palīdz AI attīstītājiem un dati zinātājiem monitorēt, uzlabot un uzlabot LLM pakalpojumu izdevumus dažādās sastādīšanas stadijās.

4.3 (6)
Freemium
Arize AI ekrāna attēls

Arize AI ir kompleksas observability un LLM (viegliema valodu modelu) vērtēšanas platforma. Tas palīdz kiberinteligencijas attīstītājiem un datu zinātniekiem monitorēt, novērst problēmas un palielināt to kiberinteligencijas modelu darbības efektīvumu. Platformas funkcionalitāte ir pierāda problēms un piedāvā risinājumus, palīdzot lietotājiem labot savu modelu precizitāti un reliabilitāti. Arize AI ir projektu kiberinteligencijas attīstītājiem un datu zinātniekiem, kuri vēlas palielināt savu modelu darbības efektīvumu. Platfromas spējas ietver monitorēšanu un problēmu novēršanu, atļaujot lietotājiem tikai brīžīgi identificēt un risināt problēmas. Arize AI arī piedāvā iespējas vērtēt un palielināt modela darbības efektīvumu, atļaujot lietotājiem attīstīt savus modelus laika gaitā. Izmantojot Arize AI, lietotāji var nodrošināt, ka tās kiberinteligencijas modeli darbojas optimētu veidu, kas ir nepieciešams labākiem norādiem un rezultātiem. Platforms koncentrācijā uz observability un vērtēšanu to atdala no citiem kiberinteligencijas attīstības instrumentiem, padarot to par vērtīgu resursu personām, kas strādā ar lielo valodu modeliem un citām kompleksajām AI sistēmām.

Kritēriju sadalījums

Ease of use1
Value for money1
Features & power0
Integrations0
Support & docs0
Reliability0
  • Virtuālās risības uzvedības monitorings
  • Noteikto problēmu novērošana un izšķirošana
  • Paskaidrotais risību sagatavošana
  • Modela izpratnes novērošana
  • LMM risību novērošana un optimizācija
9Edwin AI logo

Edwin AI

AI asistents IT operācijām, kas paātrina incidentu atklāšanu, triage un atrisināšanu.

4.7 (6)
Bezmaksas
Edwin AI ekrāna attēls

Edwin AI ir AI asistents IT operācijām, kas paredzēts, lai paātrinātu incidentu atklāšanu, triage un atrisināšanu. Tas nodrošina centralizētu platformu IT komandām incidentu izmeklēšanai, to ietekmes saprašāšanai, labošanas meklēšanai vai ģenerēšanai, un to piemērošanai visās esošajās rīkos, bez vajadzības pārslēgties starp sistēmām. Edwin AI korelas alertus, identificē pamata iemeslus un automātiski sāk atlīdzināšanu, sākot no pirmā brīdinājuma līdz pārbaudītam izdevam. Tas izmanto vēsturiskos modeļus un novērošanas datus, lai prognozētu un novērstu izslēgšanas. Šis rīks integrējas ar vairāk kā 3 000 rīkiem, tostarp novērošanas, APM, drošības un CMDB jomās, nodrošinot reāllaika, darbības informāciju un novēršot silo struktūru. Forrester pētījums atklāja, ka Edwin AI sniedza 313% atdevi (ROI) kompozītai organizācijai, ar atdeves periodu 6 mēneši vai mazāk.

Kritēriju sadalījums

Ease of use0
Value for money0
Features & power1
Integrations1
Support & docs0
Reliability0
  • Alertu korelācija un trokšņa samazināšana
  • AI vadītās pamata iemeslu ieteikumi
  • Dabas valodas incidentu kopsavilkumi
  • Integrācijas ar ITSM un novērošanas platformām
  • Automatizēti triage darba plūsmas
  • Zināšanu bagātināšana no iepriekšējiem incidentiem
10FoundryAI logo

FoundryAI

Izveidojiet, novērtējiet un uzlabojiet AI agentus uzņēmējdarbības automatizācijai

4.8 (4)
Bezmaksas
FoundryAI ekrāna attēls

FoundryAI ir attīstības platforma, kas paredzēta tiešu biznesa procesu vadībai, izmantojot AI agentus. Tajā kombinēti līdzekļi agenta dizainam, testēšanai un nepārtrauktu uzlabojumu mehānismu, lai komandas varu pārcelties no prototipa līdz produkcijai bez sadalīšanas kārtas dažādām sistēmām. Platforma piešķirība ir priekšroka, nododot būvējiem iespējas pārbaudīt agentu risinājumu darbību atbilstoši definētiem uzdevumiem un sagatavot tos laika gaitā. Tas padara platformu piemērotu organizācijām, kas automātizē klientu atbalstu, interņu darbību vai atkārtotu zinību darbu, kurā noturība ir nozīmīga. FoundryAI paredž no profesionāliem komandām, kurām ir nepieciešama iepirkšanās kontroles funkcionalitāte, kas ir pieejama no koda, bet vēlama tiktu ātrāka iterācijas periods, izpētesa, nekā tas sākotnēji ir pielāgotam no paša pacīnām.

Kritēriju sadalījums

Ease of use0
Value for money0
Features & power0
Integrations0
Support & docs1
Reliability0
  • Agentu izveides vide
  • Novērtēšanas un testēšanas rīki
  • Veiktspējas uzraudzība
  • Darba plūsmu automatizācijas atbalsts
  • Iteratīvās uzlabošanas cikli
  • Integrācija ar uzņēmējdarbības sistēmām