Praeita kova · 2024-01-11 UTC

Observability Susirėmimas — 2024 m. sausio 11 d.

Observability kategorijos. 40 įvertinimai pateikti tarp 10 kovotojų. Quotient AI laimėjo vainiką.

Galutiniai rezultatai

Dalyviai

Kovotojai

Kiekvieno šioje kovoje dalyvavusio įrankio profiliai, surikiuoti pagal galutinį rezultatą.

1Quotient AI logo

Quotient AI

Įvykių laiko monitoravimas ir vertinimų platforma, siekiant surasti klaidas AI, RAG ir agentų srityje.

4.4 (5)
Nemokama

Quotient AI yra observability ir įvertinimo platforma sukurta komandoms, kurios siunčia AI-pažangas priedus. Ji visais laikais monitoruoja produkcijos AI sistemus – įskaitant ištekėjimą, gaivintojo generavimą (RAG) ir savarankiškus agentus – kad priešingai pagalvinais vartotojų atvykęs pasirodymą, išsiskiria halucinacijas, pagrindinio ištekėjimo klaidas ir kitas kokybės problematiką. Platforma jungia savo narės į automatinius įvertinimus su realiu laiku signalais, padėdama inžinerijos ir ML komandoms diagnozuoti šaltinius, klausį regressijas skirtinguose modelio ar užklausos pokyčiuose, bei išlaikyti patikimumą skalyje. Instrumentuojant AI srautų, Quotient priskiria programuotojams peržiūrą, kaip išeina jų programos realiame svetme, o ne tik remiantis nenaudojamų užklausų rodikliais.

Kriterijų išskirstymas

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Įvykiai laiko AI monitoravimas ir pranešimai
  • Vaikų ir prigimtinio klaidų detekcija
  • RAG takelių vertinimo priemsena
  • Savaraikis agentų veiklos trukdymų ir diagnostinis priemsenas
  • Priešėnų modelio ir prailides analizė
  • Produkcijos observableitė AI programėms
2Weave logo

Weave

Įvairių pradinės kodės sąrankos konstruktorius, kuris leidžia įmonėms automatizuoti veiklą, integruodami daugius kietų kalbos modelius (LLM) ir sujungdamas signalus kaip tikrai tekstą.

4.8 (5)
Nemokama
Weave ekrano nuotrauka

W&B Weave yra Observability ir įvertinimo platforma, kurio pagalba galite sekinti ir pagerinti didelius žodžių modelio (LLM) taikalus. Weave teikia priemones, kurios leidžia nuorodų, metrikų rinkimo ir taikalo atsakų vertinimo, naudodami LLM sudėtį ir pritaikytus skaičiavimo modelius. Svarbiausios funkcijos yra nuorodų sesijų, LLM įvadeivių ir prietišų veiksmų sekimas, taip pat ir rankinių prietišų instrumentų pritaikymas naudotų agentų pritaikytiems modeliams. Platforma skubia sujungimas su populiarūsiais SDK bei harnessais, bei taip pat personalizuotais agentų matomumas. Weave teikia Python bei TypeScript bibliotekas instalacijai bei naudojimui platforma. Ji turi bazuoti Weights & Biases (W&B), reikia W&B paskyros bei API klaučio autentificacijai. Naudojotojai gali ištrinti ryšius su LLM, peržiūrėti įvesčius ir išvestis bei peržiūrėti agento metrikas Weave UI. Čia Weave paprastina automatizavimą ir LLM taikymų vertinimą, nors tai nepriimtinai nebūtinai nemokamųjų programių automatizuoto juodraščio statybos reikšme.

Kriterijų išskirstymas

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Agentų prižiūrimo ir metrikų rinkimo priemonė
  • Personalizuotų agentų prižiūrėjimas
  • Kietų kalbos modelių prižiūrimo ir įvertinimo priemonė
  • OpenTelemetry spanų paramos
  • Weaves ir W&B integracijos
  • Python ir TypeScript bibliotekos
3A

AgentOps

Reagingo ir koregavimo priemonės priemonės įrengimo reliabiliam inteligentiniams agentams

4.5 (4)
Nemokama
AgentOps ekrano nuotrauka

AgentOps yra programų kūrėjų platforma, kurios tikslas yra pagalba agentams suintarpomis gyvuoti programų gyvavimo ciklą, papildo kietų ir rengiamųjų programų įrankiais taip pat debagų įrankiais, kad sužiuria, ką agentai tuo tikslui atlieka. Jis įraška LLM prisijungimus, įstaigų vartojimą, išlaidas bei klaidas, kad komandos supras agento elgesį sudėtingose keliuose žingsnių procesų rėmuose. Viršijus matomumą, AgentOps siūlo sesijų atkarpas, performanso analizę bei integracijas su populiariaisiais agentų framework'ais kaip LangChain, CrewAI bei AutoGen. tai padeda inžinieriams perėiti nuo prototipo prie produkcinio režimo su matomu reliabiliu atlikimu, o ne priklausydami nuo spekuliacijų ar logų filtravimo. Tokiai programuotojams ir komandoms, kurios siunčia agento programas, būtina trakinti grįžimo galimybes, kontroliuoti išlaidas ir parinkti, ar agentai veikia teisingai prieš ir po paleidimo.

Kriterijų išskirstymas

Ease of use0
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Agentų sesijų ir paprastymų priemonės
  • LLM skelbimo ir priemonių nuolaidos sekimas
  • Sąnaudų ir sąnaudių analitika
  • Klaidų ir neišpildymų sekimas
  • Rašybos šiuo klausimų SDKs Python ir JavaScript
  • Agentų performanso kriterijų skilty klaviatūros
4Confident AI logo

Confident AI

LLM vertinimo platforma, kuria parengta DeepEval, skirta LLM priemonių testinimui, stebėjimui ir tobulėjimui.

4.6 (5)
Nemokama
Confident AI ekrano nuotrauka

Confident AI yra vertinimo ir stebėjimo platforma užsiėmimams, kurie kūna sąmoningus kalbos mokymo modelius. Apgynėjantis atvirą-source DeepEval rūšiavimo, jis suteikia vieningą darbo erdvę, kuri leidžia vykdyti bendroji tikslai, regresinio testavimo bei kokybės patikrinimo priemonės prikeliamųjų, modelių bei atsargas krovinių per kryžminius. Plataforma pagalba mechanikams pažinti halucinacijas, promptų regresijas bei paviešinimų nepavyksčių kartojančius prieš pristatymą, o teikdama prodiūzų montorininkavimo galimybes, kad sekintų tikrų vartotojų interakcijas. Komandos gali centrozuoti duomenis, dalintis testo rezultatais ir iteruoti promptomis matomuosiu pagrindiniu pozuje tuo gale, nei iš bandymų, kad gali būti klaida. Šioje sistemoje siekiama pagaminti kokybiškus įrenginius LLM kvalifikacijos patikrą, nors pagrindinis mūsų veiklos taikinys yra developeriai, ML inžinieriai ir QA komandos, kurios tiekia struktūrius, metrikų pagrįstą apžvalgas, o ne neapibrėžtas žmogaus valdytas patikrinimai.

Kriterijų išskirstymas

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs0
Reliability1
  • DeepEval vargu prieš vertinimo koeficientai
  • Pramoninių testų užtikrimumas už ką ką
  • Rag ir atkūrimo vertinimo koeficientas
  • Žurnalų ir monitorinėmis priedais
  • Duomenų ir testų tvarkykla
  • Bendrasis konsultacinis vertinimo rezultatų tvarkykla
5Fiddler AI logo

Fiddler AI

Inteligentos sistemos stebėjimo bei saugumo platforma, skirta monitoringui, aiškinimui ir valdymui ML ir LLM taiklių gamyboje.

4.7 (6)
Nemokama
Fiddler AI ekrano nuotrauka

Fiddler AI yra verslo platforma, kuri padeda komandoms monitoruoti, analizuojuoti ir saugoti mašinų mokymos modelius bei generatyvųjį AI programavimą pramonėje. Jame gausi perspėjimas į modelio veiksmingumą, duodamosi svyravimą, diskriminaciją bei kokybės problemų, o taip pat ir priemonės apsaugoti prieš rizikas specifines LLMs, kaip vaizdavimas, priedmenų įjungimas bei pavojingas išvedimus. Šiam technologijų inžinerijos mokslininkui, data mokslininkai bei rizikų ir kontrolės komandomiems Fiddler jungia aiškinimą, realaus laiko monitorinį ir keliuos valdymą į vieną protokolą. Jis integracija su bendrųjų ML srautų ir cloudy aplinkų pagalba padeda organizacijoms užbaigti atsakingos AI praktikas skalyje.

Kriterijų išskirstymas

Ease of use1
Value for money1
Features & power0
Integrations1
Support & docs1
Reliability1
  • Modelio performansių ir smuginimo stebėjimas
  • LLM hallucinacijų ir saaugumu detekcija
  • Prompt injection ir lankstybine apsauga
  • Aiškinamasis AI ir pagrindinių priežasčių analitika
  • Nuoširdumo ir sąžingumo vertinimai
  • Dalyvavimo lentelių ir prispausdintų priekšaiškių sistemas gamybinėms AI sistemas
6Portkey logo

Portkey

Vienybės įrenginys, sudarytantis kontroliuojantį AI taikymo planą, kuriantys, valdami ir monitoruojantys AI taikymus

4.4 (5)
Nemokama
Portkey ekrano nuotrauka

Portkey yra vienybės įrenginys kontroliuojantis AI taikymų kūrimą, valdymą ir monitoringą. Jis teikia sausaini platformą AI komandom, kuri padeda joms eineti į produkciją. Portkey suteikia tokias galimybes kaip AI Gateway, Observability, Guardrails, Governance ir Prompt Management. Pirmame sluoksne yra galimybė užkirsti kelio 1600 LLM galimybę vienoje API sluoksnį, kurianti automatizuoti integravimo proceso, kad komandos galėtų užsiimti tik kūryba, ir ne valdymas. Portkey taip pat leidžia tiesioginę observabilitę, leidžianti vartotojams stebėti LLM elgseną, rasti anomaliąsias padėles ankstesniu laiku ir tvarkyti naudojimą protyvu. Priešinguoja, platforma suteikia galimybių atsarginiems duomenims, kuriuose jau paruoštai naudotojai taip ir turi tūkstančius kartų išsavigi. Portkey kūrimas skirtas AI komandomis ir apima plačią sąnašą LLM modelių, tuo metu jau kuriama kiekviena diena didesni 3000 GenAI komandomis bei milijardai tokenų.

Kriterijų išskirstymas

Ease of use1
Value for money0
Features & power1
Integrations0
Support & docs1
Reliability1
  • AI Gateway su daugiafirmine roitingu
  • Pramidavimo ir versijų tvarka
  • Priežastingų protokolo, įrašų, tracių ir analitikos
  • Semantiškas caching ir atkurimas
  • Žiedų valdymas įvesties ir išvesties tikslumui
  • Naudojimo bei žmogo panaudotos monetų valdomojo panelo
7Relari (YC W24) logo

Relari (YC W24)

Testavimas, įvertinimas ir sintetinio duomenų generavimas platforma už AI agentus.

4.3 (6)
Nemokama
Relari (YC W24) ekrano nuotrauka

Relari yra toliau tyrimų ir įvertinimų pagrindinės funkcijos turinčios developerio platforma, skirta pagerinti AI agentų ištikimumą. Komanda pagalbos gali sukurti sintetinius duomenis, automatizuotus įvertinimus ir tikrinti agentų atlikimą iš tikrųjų scenarijų bei priklausančius rezultatus prieš siūlymą į gamybą. Pagaminta Y Combinator (W24) parama, Relari siekia technologų mėgėjus, kurie įrengia kompleksius LLM taikiklius ir įvairaus lygio agentus kurie tradicinėje QA metuose yra nepakankamai patikrinti. Šio įrankio tikslas yra įtraukti į software-engineering rigorą - vienetinius testus, regresinius kontrolierius ir matomus matavimo rodiklius netiesioginiam AI sistemoms. Plataforma priimsi specializuoti evaluatoriai, scenarijų simuliacija ir tęstinė monitorė, kad ji būtu naudinga ne tik atitikimo priimimu, bet ir nuolatiniam pagaminių agentų kokybės tikrinimui.

Kriterijų išskirstymas

Ease of use1
Value for money1
Features & power0
Integrations1
Support & docs1
Reliability0
  • Sintetiniai duomenų sąrašai generavimas
  • Automatizuoti agentų įvertinimo srautai
  • Skriptos ir pokalbių simuliacija
  • Šildimų įvertinimo metrikai sąranka
  • Reagraviniai testsai už LLM programėlių
  • Atlikimų ir ataskaitų našumą matavimas
8Arize AI logo

Arize AI

Platforma, kurianti žinių analizės priemonės ir modelių įvertinimą LLM, pagalbos įgyvendina programuotojų, kuriantių AI, bei duomenų mokslininkų monitorinės sistemos naudojimą, problemų tyrinėjimą ir paramą, kad LLM įdiegtų sistemų bei duomenų tyrinėjimų performansas...

4.3 (6)
Nemokama su priemokomis
Arize AI ekrano nuotrauka

Arize AI yra LLM įvertinimo ir LLM observabiliteto platforma. Ji padeda programų automatizavimo specialistams bei duomenų mokslininkams stebėti, paaiškinti, bei pagerinti savo AI modelių kokybę. Platforma pateikia priemones, kurios padeda įsitiktinį problemų identifikavimą bei rekomendacijų, kurios padeda vartotojams užimti savo modelių tikslumą ir paplitimą. Arize AI yra projektuojama programa, kuriai reikia optimizuoti savo modelių veiksimą. Platformos galimybės įskaito stebėjimą ir paaiškinimą, leidžia vartotojams greitai identifikuoti ir susipažinti su problemomis. Arize AI taip pat pateikia funkcijas, dėl kurios veiksmingos modelio kokybę įvertina ir pagerina, leidžiant vartotojams kuo pagerinti savo modelius per laiko. Naudojantis Arize AI, vartotojai gali pasiekti, kad jų AI modeliai veikia taip, kad reikėtų, leidžiant pagerinti sprendimų priėmimo ir išvados. Platformos dėmesio svarstymas ir įvertinimas padeda ją užimti savo vieta tik prie kitų programų automatizavimo priemonių tarp kitų tikraisiai AI priemonių, veikiančių su didžiais kalbos modeliais bei kitais sudėtingaisiais AI sistemomis.

Kriterijų išskirstymas

Ease of use1
Value for money1
Features & power0
Integrations0
Support & docs0
Reliability0
  • Sąrašo regavimo sistemas
  • Tremtynimo ir klausimų nustatymo problemų identifikavimas
  • Sugestija priesaikos problemų paaiškinimui
  • Rūšies vertinimas
  • LLM vertinimas ir optimizavimas
9Edwin AI logo

Edwin AI

IT operacijų agentas, kuris pagero incidentų detekciją, triagavimą ir išsprendimą.

4.7 (6)
Nemokama
Edwin AI ekrano nuotrauka

Edwin AI yra naujoji IT operacijų agentas konkuriruojančių agentų, kuris pagero incidentų detekciją, triagavimą ir išsprendimą. Jis teikia centrinę platformą IT komandoms, kad tyrinėtų incidentus, suprantų jų poveikį, ieško arba generavo sąmoningus sprendimus, ir taip jais apsikeičia per esančias priemones be reikmės keisti sistemas. Edwin AI korreliuoja signalai, identifikuoja šaknines priežastingumo priežastis, ir automatizuojasi išliekimas nuo pirmo signalo iki pat įrodytasio išsprendimo. Jis naudoja istorinius modelius ir atvaizduojantiesį duomenų apžvalgą, kurį pasiekia prognostikavimą ir išvengiamą atsilpusį. Prieinama virš 3 000 priemonių, per observability, APM, saugumą ir CMDB, taip pat galiausiai galima suteikti tiesioginius, veiksmingus apžvalgų ir užkarpštuoti siluos. Forrester tyrimas išrūuoja, kad Edwin AI išvengė 313% pelno atgavimo suderinama organizacijai, su sąmoningu grąžų laiku net iki 6 mėnesių.

Kriterijų išskirstymas

Ease of use0
Value for money0
Features & power1
Integrations1
Support & docs0
Reliability0
  • Signalų koreliacija ir šumų pramonė
  • Naujų žodžių incidentų apžvalgų
  • Naturaliojo kalbos incidentų sąžiningiems perdavimui
  • Integravimas su ITSM ir atvaizduojančiuose platformų
  • Automatinė triagavimo aplinkos darbovietė
  • Priešistorinė saugoma žinios ir pramonė iš pastarųjų incidentų
10FoundryAI logo

FoundryAI

Sukurkite ir gerbiai, kad ai agentai automatizuotų verslo darbus

4.8 (4)
Nemokama
FoundryAI ekrano nuotrauka

FoundryAI yra kuriamųjų projektų platforma, siekiant sukurti AI agentus, kurie tvarko realiuosius verslo darbus. Ji susieja agento dizainą, bandymų, bei užtikrinamą tolesnį patobulimą, kad komandos gali persislinkti nuo prototipo iki produkcijos neišsišakos, sujungus atskirus sistemas. Platforme skirsto žiniatinklio vertinimą, leidžiant kūrėjams matuoti agento performansą, išvystytą taikant nustatytas užduotis ir pagerindamas elgseną per laiką. Tai padeda jiems tinkamai tinkamą organizacijoms, automatiškai tvarkanti klientų aptarnavimo, internų operacijų, ar vėliavos žinių darbą, kur reliabiliškumas yra svarbus. FoundryAI siektasi inžinierių komandų, kurios reikalauja daugiau valdymo nei nors kode pradininkų siūlomi pasiūlymai, tačiau norėjo greitesnis iteracija nei tiek, kur agente pilnai iš naujo pradžioje yra statomi.

Kriterijų išskirstymas

Ease of use0
Value for money0
Features & power0
Integrations0
Support & docs1
Reliability0
  • Agentų kūrimo aplinkos
  • Evaluacija ir testavimo įrankiai
  • Performances monitorė
  • Suvokimui automatinis darbas
  • Iteracijų ciklai
  • Integracija su verslo sistemomis