Möödunud lahing · 2024-01-11 UTC
Observability Vastasseis — 11. jaanuar 2024
Kategooriast Observability. 40 märget pandud 10 võitleja kohta. Quotient AI võttis krooni.
Lõppseis
Koosseis
Võitlejad
Iga selles lahingus võistelnud tööriista profiilid, järjestatud nende lõppskoori järgi.

Quotient AI on vaatlus- ja hindamisplatvorm meeskondadele, kes kasutavad tehisintellektil põhinevaid funktsioone. See jälgib pidevalt tootmiseks kasutatavaid tehisintellektisüsteeme, sealhulgas otsingut, retrieval-augmented generation (RAG) ja autonoomseid agente, et tuvastada hallutsinatsioone, tõrkeid retrievalis ja muid kvaliteediprobleeme enne, kui lõppkasutajad nendega kokku puutuvad. Plaform ühendab automaatsed hindamised reaalajas hoiatustega, aidates inseneri- ja masinõppe meeskondadel diagnoosida algpõhjuseid, jälgida regressioone mudeli või viipade muutuste korral ning säilitada usaldusväärsust suurtes mahudes. AI torujuhtmeid instrumenteerides annab Quotient arendajatele nähtavuse sellesse, kuidas nende rakendused tegelikult käituvad looduses, selle asemel, et tugineda ainult võrguühenduseta etalonidele.
Разбивка критериев
- Reaalajas AI jälgimine ja hoiatused
- Hallutsinatsiooni ja andmete hankimise vea tuvastamine
- RAG-torustike hindamise tööriistad
- Agendi käitumise jälgimine ja diagnostika
- Regressioonanalüüs mudeli ja viipade muutuste lõikes
- Tootmisobservability AI-rakenduste jaoks


W&B Weave on jälgitavuse ja hindamise platvorm, mis aitab jälgida ja parandada suurte keelemudelite (LLM) rakendusi. Weave pakub tööriistu jälgimiseks, mõõdikute kogumiseks ja rakenduste vastuste hindamiseks LLM kohtunike ja kohandatud skoorerite abil. Põhijooned hõlmavad seansside jälgimist, LLM kõnesid ja tööriistakõnesid, samuti kohandatud agentide käsitsi instrumentatsiooni. Platvorm toetab integreerimist populaarsete SDK-de ja riistvaradega, samuti kohandatud agendi jälgitavust. Weave pakub Pythoni ja TypeScripti teeke platvormi installimiseks ja kasutamiseks. See on hostitud Weights & Biases'il (W&B), mis nõuab W&B konto ja API võtme olemasolu autentimiseks. Kasutajad saavad jälgida LLM-ide kõnesid, üle vaadata sisendeid ja väljundeid ning vaadata agendi mõõdikuid Weave kasutajaliideses. Kui Weave hõlbustab LLM-rakenduste automatiseerimist ja hindamist, siis see ei ole siiski nn nullkoodiga AI töövoo koostaja, nagu võib arvata selle nimest.
Разбивка критериев
- Agendi jälgimine ja mõõdikute kogumine
- Kohandatud agendi jälgitavus
- LLM jälgimine ja hindamine
- OpenTelemetry span tugi
- Weights & Biases (W&B) integreerimised
- Pythoni ja TypeScripti raamatukogud

AgentOps on arendaja platvorm, mis keskendub AI agentide elutsüklile, pakkudes jälgimis-, seire- ja silumistööriistu, mis paljastavad, mida agendid tegelikult käitusajal teevad. See jäädvustab LLM-kõnesid, tööriistade kasutamist, kulusid ja vigu, et meeskonnad saaksid aru agentide käitumisest keerulistes mitmeastmelistes töövoogudes. Lisaks nähtavusele pakub AgentOps sessiooni ülevaadet, jõudluse analüüsi ja integreerumist populaarsete agentraamistikega nagu LangChain, CrewAI ja AutoGen. See aitab inseneridel liikuda prototüübist tootmisse mõõdetava usaldusväärsusega, selle asemel, et tugineda oletustele või logide kraapimisele. See on suunatud arendajatele ja meeskondadele, kes toimetavad agentlike rakendusi, kes peavad jälgima regressioone, kontrollima kulusid ja tõestama, et nende agendid käituvad õigesti enne ja pärast juurutamist.
Разбивка критериев
- Agenti seansside salvestamine ja taasesitus
- LLM-kõnede ja tööriistade kasutamise jälgimine
- Kulude ja tokenite analüütika
- Vigade ja tõrgete tuvastamine
- Raamistiku SDK-d Pythonile ja JavaScriptile
- Agenti jõudluse mõõdikute armatuurlaud
Confident AI
LLM-i hindamise platvorm, mis põhineb DeepEvalil, et testida, jälgida ja täiustada AI rakendusi.

Confident AI on hindamise ja jälgitavuse platvorm suurte keelemudelite rakendusi ehitavate meeskondade jaoks. Open-source DeepEval raamistikuga varustatud, pakub see ühtset töökeskkonda piiri, regressioonitestide ja kvaliteedi kontrollide läbiviimiseks käsitluste, mallide ja andmehaakimise torustike üle. Platvorm aitab inseneridel enne tarneaegse haldamist pilvede, käsitluste regressioone ja andmehaakimise tõrkeid tuvastada, pakkudes samas tootmise jälgimist reaalsete kasutajate interaktsioonide jälgimiseks. Meeskonnad saavad andmekogumid keskendatud, jagada testidulemusi ning teha käsitluste iteratsioonitest mõõdetavat tagasisidet, mitte hüpoteesipõhist. See on mõeldud arendajatele, ML- inseneridele ja QA meeskondadele, kes soovivad struktureeritud, mõõdikupõhist lähenemist LLM-i kvaliteedi tagamisele, mitte kohandatud käsitsi ülevaatusele.
Разбивка критериев
- DeepEvali poolt toetatud hindamismõõdikud
- Regressioonitestid käsitluste ja mallide jaoks
- RAGi ja andmehaakimise hindamine
- Tootmise jälgimine ja jälgimine
- Andmekogumite ja testjuhtumite haldamine
- Meeskonna koostöö hindamiste tulemuste üle

Fiddler AI
AI jälgitavuse ja turvalisuse platvorm ML- ja LLM-rakenduste jälgimiseks, selgitamiseks ja haldamiseks.

Fiddler AI on ettevõttekeskne platvorm, mis aitab meeskondadel jälgida, analüüsida ja kaitsta tootmiskeskkonnas masinaõppe mudeleid ning generatiivseid AI rakendusi. See pakub nähtavust mudeli jõudluse, andmete drift'i, kallutatuse ja kvaliteediprobleemide osas ning pakub kaitsemeetmeid LLM-idele spetsiifiliste riskide, nagu hallutsinatsioonid, prompti süstimine ja ebasobivad väljundid, vastu. Mõeldud ML-inseneridele, andmeteadlastele ning riskide ja vastavuse meeskondadele, ühendab Fiddler selgitatavuse, reaalajas jälgimise ja turvasõlmede üheks töövooguks. See integreerub tavapäraste ML torujuhtmetega ja pilvekeskkondadega, aidates organisatsioonidel skaleeritult rakendada vastutustundlikke AI tavasid.
Разбивка критериев
- Mudeli jõudluse ja drift'i jälgimine
- LLM-i hallutsinatsioonide ja turvalisuse tuvastamine
- Prompti süstimise ja jailbreaki kaitse
- Selgitatav AI ja põhjusanalüüs
- Kallutatuse ja õigluse hindamised
- Armatuurlaud ja hoiatused tootmise AI jaoks

Portkey
Edukate AI kasutamist ja jõudlus tunnistada komponendide efekte ja krediidi muutmine

Portkey on üksikud lahendus, mis vastab võimalikke ning jõustab viisimeid ja jõudlusi kasutatavale vastuse koodil. Osalema Portkey vahekaardist eraldatud ja toitavate lahenduste esitamiseks. Kuidas rakenda rakenda kasutusplaneedrite ja süsteemi mallide integratsioon ja seadmed vastuse ettevõtel ja muutmine.
Разбивка критериев
- AI lüüsi mitme pakkuja marsruutimisega
- Viipade haldus ja versioonimine
- Päringute logid, jäljed ja analüütika
- Semantiline vahemälu ja korduvkatse
- Sisend- ja väljund valideerimise reeglid
- Kasutuse ja maksumuse jälgimise armatuurlaud
Relari (YC W24)
Relari on YC W24 tootega avaldatud testimine, sisaldusväljendamine ja syntheettikava AI agentide stabilne ja testimisel arendamine.

Relari on arendaja platvorm, mis keskendub tehisintellekti agentide töökindluse parandamisele süstemaatilise testimise ja hindamise kaudu. See aitab meeskondadel genereerida sünteetilisi andmekogumeid, käivitada automatiseeritud hinnanguid ja võrrelda agentide jõudlust realistlikes stsenaariumides enne tootmisse saatmist. Y Combinatori (W24) toetusel sihib Relari insenerimeeskondi, kes ehitavad keerulisi LLM-rakendusi ja mitmeastmelisi agente, kus traditsiooniline kvaliteedi tagamine (QA) ei ole piisav. Selle tööriistad eesmärk on tuua tarkvaraarenduse rangus – üksiktestid, regressioonikontroll ja mõõdetavad mõõdikud – mittedeterministlikele AI-süsteemidele. Platvorm toetab kohandatud hindajaid, stsenaariumide simulatsiooni ja pidevat jälgimist, muutes selle kasulikuks nii eelneva käivitamise valideerimise kui ka tootmisagentide pideva kvaliteedi tagamise jaoks.
Разбивка критериев
- Sisaldusväljendamine andmebaasiga
- Automated and scalable synthetic dataset generation
- User and scenario simulation
- Custom evaluators and metrics
- Continuous monitoring with real-time feedback
- Debug and troubleshoot AI agents

Arize AI
AI observability ja LLM hindamise platvorm, mis aitab AI arendajatel ja andmeteadlastel jälgida, tõrkeid lahendada ja jõudlust tõsta...

Arize AI on AI observatsiooni- ja sünteesmootorite hindamise platform. See aitab AI arendajaid ja andmeekspereid seirega, teadmatusega ning võimaluste abil täiendada oma süsteemide performantsi. Platform pakuab vahenditeks problemaadsete isikukohaste võrdlusi ja võimaldamaks paranduse propageerimiste tehtud. Klienti aidab see ka parandamise suunama vajadustel. Arize AI on disainitud seetõele, kus need arendajad vajavad süsteemide performantsi mõjutamise. Platformi võimekused hõlmavad seiret ja teadmatusi. Seetõele võimaldavad klientidele kiiresti pääseda isiku kohtadesse ja selgitada võimaldustest. Arize AI pakub veel teadmistest hinnanguid ümbritseva süsteemi parandamise võimalused ja võimaldavad klientidele süstemide performantsi kõrgeks hoidmist üle aja jooksul. Arize AI kasutamine tagab süsteemi performantsi kõrgeks ning see seostub paremaga otsuste ettevalmistamisega ning eesmärke võidavad võimalustega. Plattormi tegevus keskendub süsteemi monitorimine ja ülesehituse pinnalt võimaldustele ning see seda mõõdetab teistes süsteemides. Seetõele võimaldab Arize AI inimesele parema võimalustes võrdlema ülijuhu süsteemi süsteemide ning tegevusele tegevustega.
Разбивка критериев
- AI mudeli jälgimine
- Õnnetoolide ja probleemide identifitseerimine
- Töövõime ettepanekud
- Mudeleistungitesti
- LLM-i väärbamistöötlus ja võimsuse soovitus

Edwin AI
AI-agent IT‑operatsioonidele, mis kiirendab juhtumite avastamist, triage'i ja lahendamist.

Edwin AI on AI-agent IT‑operatsioonide jaoks, mis on loodud juhtumite avastamise, triage'i ja lahendamise kiirendamiseks. See pakub keskendatud platvormi IT‑meeskondadele juhtumite uurimiseks, nende mõju mõistmiseks, lahenduste leidmiseks või genereerimiseks ning nende rakendamiseks olemasolevate tööriistadega ilma süsteemide vahetuseta. Edwin AI korreleerib teatisi, tuvastab juurkujusi ja algatab taastamise automaatselt, alates esimese teate saamisest kuni kinnitatud lahendamiseni. See kasutab ajaloolisi mustreid ja jälgitavuse andmeid, et ennustada ja ennetada katkestusi. Tööriist integreerub üle 3 000 tööriistaga jälgitavuse, APM‑i, turvalisuse ja CMDB-süsteemides, võimaldades reaalajas, teostatavaid teadmisi ja eemaldades siloid. Forresteri uuring näitas, et Edwin AI andis 313 % ROI üksikule organisatsioonile, tasumise perioodiga 6 kuud või vähem.
Разбивка критериев
- Teavite korreleerimine ja müra vähendamine
- AI‑põhised juurkaji soovitused
- Lugemiselsed juhtumi kokkuvõtted
- Integreerimine ITSM‑ja jälgitavuse platvormidega
- Automatiseeritud triage töövood
- Teadmiste rikastamine varasemate juhtumite põhjal


FoundryAI on arendusplatvorm, mis keskendub AI agentide loomisele, mis käitavad reaalseid äriprotsesse. See ühendab agentide disaini, testimise ja pideva täiustamise tööriistad, võimaldades meeskondadel liigu prototüübist tootmisse ilma eraldiseisvaid süsteeme kokku ühendamata. Platvorm rõhutab hindamist, pakkudes loojaile võimalusi mõõta agentide tulemuslikkust määratletud ülesannete vastu ning refiineerida käitumist ajas. See muudab selle sobivaks organisatsioonidele, kes automatiseerivad klienditoe, sisemised operatsioonide või korduva teadmiste töö, kus usaldusväärsus on oluline. FoundryAI on suunatud tehnilistele meeskondadele, kes vajavad rohkem kontrolli kui no‑code lahendused pakuvad, kuid soovivad kiiremat iteratsiooni kui agentide täielik nullist ehitamine.
Разбивка критериев
- Agente loomise keskkond
- Hindamise ja testimise tööriistad
- Jõudluse jälgimine
- Töövoogude automatiseerimise tugi
- Iteratiivsed täiustamise tsüklid
- Integratsioon ärisüsteemidega






