Möödunud lahing · 2023-12-27 UTC
Observability Vastasseis — 27. detsember 2023
Kategooriast Observability. 30 märget pandud 8 võitleja kohta. Fiddler AI võttis krooni.
Lõppseis
Koosseis
Võitlejad
Iga selles lahingus võistelnud tööriista profiilid, järjestatud nende lõppskoori järgi.

Fiddler AI
AI jälgitavuse ja turvalisuse platvorm ML- ja LLM-rakenduste jälgimiseks, selgitamiseks ja haldamiseks.

Fiddler AI on ettevõttekeskne platvorm, mis aitab meeskondadel jälgida, analüüsida ja kaitsta tootmiskeskkonnas masinaõppe mudeleid ning generatiivseid AI rakendusi. See pakub nähtavust mudeli jõudluse, andmete drift'i, kallutatuse ja kvaliteediprobleemide osas ning pakub kaitsemeetmeid LLM-idele spetsiifiliste riskide, nagu hallutsinatsioonid, prompti süstimine ja ebasobivad väljundid, vastu. Mõeldud ML-inseneridele, andmeteadlastele ning riskide ja vastavuse meeskondadele, ühendab Fiddler selgitatavuse, reaalajas jälgimise ja turvasõlmede üheks töövooguks. See integreerub tavapäraste ML torujuhtmetega ja pilvekeskkondadega, aidates organisatsioonidel skaleeritult rakendada vastutustundlikke AI tavasid.
Разбивка критериев
- Mudeli jõudluse ja drift'i jälgimine
- LLM-i hallutsinatsioonide ja turvalisuse tuvastamine
- Prompti süstimise ja jailbreaki kaitse
- Selgitatav AI ja põhjusanalüüs
- Kallutatuse ja õigluse hindamised
- Armatuurlaud ja hoiatused tootmise AI jaoks


FoundryAI on arendusplatvorm, mis keskendub AI agentide loomisele, mis käitavad reaalseid äriprotsesse. See ühendab agentide disaini, testimise ja pideva täiustamise tööriistad, võimaldades meeskondadel liigu prototüübist tootmisse ilma eraldiseisvaid süsteeme kokku ühendamata. Platvorm rõhutab hindamist, pakkudes loojaile võimalusi mõõta agentide tulemuslikkust määratletud ülesannete vastu ning refiineerida käitumist ajas. See muudab selle sobivaks organisatsioonidele, kes automatiseerivad klienditoe, sisemised operatsioonide või korduva teadmiste töö, kus usaldusväärsus on oluline. FoundryAI on suunatud tehnilistele meeskondadele, kes vajavad rohkem kontrolli kui no‑code lahendused pakuvad, kuid soovivad kiiremat iteratsiooni kui agentide täielik nullist ehitamine.
Разбивка критериев
- Agente loomise keskkond
- Hindamise ja testimise tööriistad
- Jõudluse jälgimine
- Töövoogude automatiseerimise tugi
- Iteratiivsed täiustamise tsüklid
- Integratsioon ärisüsteemidega

Quotient AI on vaatlus- ja hindamisplatvorm meeskondadele, kes kasutavad tehisintellektil põhinevaid funktsioone. See jälgib pidevalt tootmiseks kasutatavaid tehisintellektisüsteeme, sealhulgas otsingut, retrieval-augmented generation (RAG) ja autonoomseid agente, et tuvastada hallutsinatsioone, tõrkeid retrievalis ja muid kvaliteediprobleeme enne, kui lõppkasutajad nendega kokku puutuvad. Plaform ühendab automaatsed hindamised reaalajas hoiatustega, aidates inseneri- ja masinõppe meeskondadel diagnoosida algpõhjuseid, jälgida regressioone mudeli või viipade muutuste korral ning säilitada usaldusväärsust suurtes mahudes. AI torujuhtmeid instrumenteerides annab Quotient arendajatele nähtavuse sellesse, kuidas nende rakendused tegelikult käituvad looduses, selle asemel, et tugineda ainult võrguühenduseta etalonidele.
Разбивка критериев
- Reaalajas AI jälgimine ja hoiatused
- Hallutsinatsiooni ja andmete hankimise vea tuvastamine
- RAG-torustike hindamise tööriistad
- Agendi käitumise jälgimine ja diagnostika
- Regressioonanalüüs mudeli ja viipade muutuste lõikes
- Tootmisobservability AI-rakenduste jaoks

Portkey
Edukate AI kasutamist ja jõudlus tunnistada komponendide efekte ja krediidi muutmine

Portkey on üksikud lahendus, mis vastab võimalikke ning jõustab viisimeid ja jõudlusi kasutatavale vastuse koodil. Osalema Portkey vahekaardist eraldatud ja toitavate lahenduste esitamiseks. Kuidas rakenda rakenda kasutusplaneedrite ja süsteemi mallide integratsioon ja seadmed vastuse ettevõtel ja muutmine.
Разбивка критериев
- AI lüüsi mitme pakkuja marsruutimisega
- Viipade haldus ja versioonimine
- Päringute logid, jäljed ja analüütika
- Semantiline vahemälu ja korduvkatse
- Sisend- ja väljund valideerimise reeglid
- Kasutuse ja maksumuse jälgimise armatuurlaud
Helicone AI
Kõik-ühes jälgitavusplatvorm, mis võimaldab jälgida, siluda ja parandada tootmis‑LLM‑rakendusi.
Helicone AI on arendajatele suunatud jälgitavusplatvorm, mis on loodud spetsiaalselt suurte keelemudelite (LLM) poolt juhitud rakenduste jaoks. See salvestab päringuid, vastuseid, kulusid ja latentsust erinevate pakkujate lõikes, andes arendusmeeskondadele ühtse ülevaate sellest, kuidas nende LLM‑funktsioonid tootmises käituvad. Lisaks logimisele pakub Helicone tööriistu promptide silumiseks, mitme‑etapiliste agendi töövoogude jälgimiseks, hindamiste läbiviimiseks ja kasutaja‑tasemel kasutuse jälgimiseks. Meeskonnad saavad tuvastada regressioone, kontrollida kulutusi ja täiustada promptide kvaliteeti andmete põhjal, mitte oletuste järgi. See integreerub populaarsete mudelite pakkujate ja raamistikuga kergekaalulise puhversilla või asünkroonse logimise kaudu, muutes selle lisamise olemasolevasse tehnoloogiavõlku lihtsaks, ilma suurte koodimuutusteta.
Разбивка критериев
- Päringute ja vastuste logimine
- Kulude ja tokenite kasutamise jälgimine
- Promptide haldamine ja versioonihaldus
- Agentide ja seansside jälgimine
- Kohandatud hindamised ja armatuurlauad
- Kasutaja- ja kiirusepiirangu analüütika

KeywordsAI
Ühtne arendaja platvorm LLM rakenduste loomise, jälgimise ja skaleerimise jaoks.

KeywordsAI on arendaja-keskne platvorm, mis koondab tööriistad tootmisvalmis LLM-rakenduste juurutamiseks. See pakub ühtset API-liidest mitme mudelipakkuja juurdepääsuks, koos sisseehitatud jälgitavuse, logimise ja hindamisfunktsioonidega, mis aitavad meeskondadel mõista, kuidas nende AI-funktsioonid reaalses maailmas toimivad. Platvorm on loodud vähendama LLM-põhiste toodete käitamise operatiivset ülekoormust. Arendajad saavad jälgida latentsust ja kulusid, tõrkeotsida viipasid, käivitada hindamisi ja hallata viipade versioone ilma eraldi tööriistu kokku õmblemata. See muudab insenerimeeskondade jaoks lihtsamaks AI-funktsioonide iteratsiooni ja usaldusväärsuse säilitamise kasutuse suurenemisel.
Разбивка критериев
- Ühtne LLM lüüsi erinevate pakkujate vahel
- Taotluste logimine ja jälgimine
- Kulu ja latentsuse jälgimine
- Viipade eksperimenteerimine ja versioonikontroll
- Hindamis- ja testimistsüklid
- SDK-d ja API integreerimised


Maxim AI on arendaja platvorm, mis on loodud selleks, et aidata meeskondadel turule viia usaldusväärseid AI-agente ja LLM-rakendusi. See ühendab endas viipade insenerimise, hindamise, jälgitavuse ja andmestiku haldamise, et meeskonnad saaksid kiiresti iteratsioone teha, hoides kvaliteeti mõõdetavana. Platvorm toetab automatiseeritud ja inimeste poolt tehtavaid hinnanguid mitme mudeli ja viipa järgi, võimaldades inseneridel võrrelda väljundeid, tuvastada regressioone ja jälgida tootmisprobleeme. See on loodud ristfunktsionaalseks koostööks, töövoogudega, mis võimaldavad nii tehnilistel kui ka mittetehnilistel huvigruppidel osaleda testimises ja ülevaatuses. Maximit kasutavad tavaliselt meeskonnad, kes ehitavad vestlusroboteid, kopiloteid, häälega agente ja mitmeastmelisi agentlikke töövooge, mis vajavad järjepidevat jõudlust muutuvate viipade, mudelite ja kasutaja sisendite korral.
Разбивка критериев
- Viipa mängumaa ja versioonimine
- Automaatne agendi ja LLM hindamine
- Tootmise jälgitavus ja jälgimine
- Andmestiku kureerimine ja haldamine
- Inimese ülevaade ja annotatsiooni töövood
- Mitme mudeli ja mitme teenusepakkuja tugi
Relari (YC W24)
Relari on YC W24 tootega avaldatud testimine, sisaldusväljendamine ja syntheettikava AI agentide stabilne ja testimisel arendamine.

Relari on arendaja platvorm, mis keskendub tehisintellekti agentide töökindluse parandamisele süstemaatilise testimise ja hindamise kaudu. See aitab meeskondadel genereerida sünteetilisi andmekogumeid, käivitada automatiseeritud hinnanguid ja võrrelda agentide jõudlust realistlikes stsenaariumides enne tootmisse saatmist. Y Combinatori (W24) toetusel sihib Relari insenerimeeskondi, kes ehitavad keerulisi LLM-rakendusi ja mitmeastmelisi agente, kus traditsiooniline kvaliteedi tagamine (QA) ei ole piisav. Selle tööriistad eesmärk on tuua tarkvaraarenduse rangus – üksiktestid, regressioonikontroll ja mõõdetavad mõõdikud – mittedeterministlikele AI-süsteemidele. Platvorm toetab kohandatud hindajaid, stsenaariumide simulatsiooni ja pidevat jälgimist, muutes selle kasulikuks nii eelneva käivitamise valideerimise kui ka tootmisagentide pideva kvaliteedi tagamise jaoks.
Разбивка критериев
- Sisaldusväljendamine andmebaasiga
- Automated and scalable synthetic dataset generation
- User and scenario simulation
- Custom evaluators and metrics
- Continuous monitoring with real-time feedback
- Debug and troubleshoot AI agents





