Iepriekšējā cīņa · 2023-12-27 UTC
Observability Sadursme — 2023. gada 27. decembris
No Observability kategorijas. 30 atzīmes izvietotas starp 8 cīnītājiem. Fiddler AI izcīnīja kroni.
Gala rezultāti
Sastāvs
Cīnītāji
Katra rīka profili, kas piedalījās šajā cīņā, sarindoti pēc to gala rezultāta.

Fiddler AI
AI observabilitātes un drošības platforma ML un LLM lietojumprogrammu uzraudzībai, skaidrošanai un pārvaldībai

Fiddler AI ir pakalpojums, kas palīdz organizācijām monitorēt, analizēt un aizsargāt neuronu mašīnu modeļus un generatīvo AI lietojumus izvietotā vietā. Tas nodod ieskatu modeļa darbības sīkumu, datiem pārnesumu, diskriminācijas un kvalitātes sāpes, kā arī piedāvā aizsardzību pretrunām, kas ir sūtītas tieši LLMs, tādu kā vajāšana, aicinājumu ievade, un nepilnīgas datu izdevuma. Sagatavots ML inženieriem, dati zinātniekam un riska un kontrolu komandām, Fiddler kombinē patiesību, reālo monitoringu, un barjeras vienlaicīgā darbības procesā. Tā integrējas ar parasta ML saskaņotu ietilpību un nolūkļaudējos vidi, palīdzot organizācijām iedarbosies atbildīgas AI praksē skalu.
Kritēriju sadalījums
- Modeļu veiktspējas un kustības uzraudzība
- LLM hallucināciju un drošības noteikšana
- Prompt injekcijas un jailbreak aizsardzība
- Skaitāma AI un sakņu cēlu analīze
- Neobjektivitātes un taisnīguma izvērtēšana
- Instrumentu paneli un brīdinājumi ražošanas AI

FoundryAI
Izveidojiet, novērtējiet un uzlabojiet AI agentus uzņēmējdarbības automatizācijai

FoundryAI ir attīstības platforma, kas paredzēta tiešu biznesa procesu vadībai, izmantojot AI agentus. Tajā kombinēti līdzekļi agenta dizainam, testēšanai un nepārtrauktu uzlabojumu mehānismu, lai komandas varu pārcelties no prototipa līdz produkcijai bez sadalīšanas kārtas dažādām sistēmām. Platforma piešķirība ir priekšroka, nododot būvējiem iespējas pārbaudīt agentu risinājumu darbību atbilstoši definētiem uzdevumiem un sagatavot tos laika gaitā. Tas padara platformu piemērotu organizācijām, kas automātizē klientu atbalstu, interņu darbību vai atkārtotu zinību darbu, kurā noturība ir nozīmīga. FoundryAI paredž no profesionāliem komandām, kurām ir nepieciešama iepirkšanās kontroles funkcionalitāte, kas ir pieejama no koda, bet vēlama tiktu ātrāka iterācijas periods, izpētesa, nekā tas sākotnēji ir pielāgotam no paša pacīnām.
Kritēriju sadalījums
- Agentu izveides vide
- Novērtēšanas un testēšanas rīki
- Veiktspējas uzraudzība
- Darba plūsmu automatizācijas atbalsts
- Iteratīvās uzlabošanas cikli
- Integrācija ar uzņēmējdarbības sistēmām

Quotient AI
Reālā laika monitoringa un novērtēšanas platforma, lai noķertu AI kļūdas meklēšanā, RAG un aģentos.
Quotient AI ir observēšanas un novērtēšanas platforms, ko ir veidota pieaugušām komandām, kas ir nodarbinātas ar AI ietvarus izveidošanu. Tā noritīgi monitorē AI sestību produktīvās darbības, tostarp meklēšanas, atkārtu iegūšanas un palielināšanas (RAG), un autonomo agentus, lai uzreiz izslaucītu iluzijas, atkārtu iegūšanas kļūdas un citus kvalitātes problēmus, pirms tiek saskartas tikai izmantošanas brīdī, kad lietotāji tie tiem nokļūst,. Platforma sadala automātiskas vērtējumus ar real-time ziņojumiem, palīdzot inženieru un ML komandām diagnose root kārtas, pavadīt regresijas, izmaiņu modelim vai iepriekš liku lielāka pieejamība. Instrumentējot AI dzelzceļu, Quotient doto radītājiem redzamību tikai to, kādā to izmantošanas rezultāciām faktiski notiek, ne tikai atkarībā no offline rīkstājiem.
Kritēriju sadalījums
- Reālā laika AI monitoring un alertēšana
- Halucināciju un aizgūšanas kļūdu noteikšana
- Novērtēšanas rīki RAG konveijeriem
- Aģentu uzvedības izsekošana un diagnosticēšana
- Regresijas analīze starp modeļa un solījuma izmaiņām
- Ražošanas observability AI lietotnēm


Portkey ir vienots kontrolplāns AI lietotņu izstrādei, pārvaldībai un monitorēšanai. Tas nodrošina visaptverošu platformu AI komandām, lai nokļūtu līdz ražošanai, piedāvājot tādas funkcijas kā AI vārti, novērojamība, drošības līnijas, pārvaldība un soliņu pārvaldība. Šī platforma ļauj lietotājiem piekļūt vairāk nekā 1600 LLM modeļiem caur vienuoturu API, vienkāršojot modeļu integrācijas procesu un ļaujot komandām koncentrēties uz izstrādi, nevis pārvaldību. Portkey arī piedāvā reālā laika novērojamību, ļaujot lietotājiem monitorēt LLM uzvedību, nozīmīgi agru noskaidrot anomālijas un pārvaldīt lietošanu preventīvi. Papildus tam platforma nodrošina kešatmiņas iespējas, kas ir demonstrējušas lietotājiem tūkstošu dolāru taupījumu, samazinot dublējošos testus. Portkey ir izstrādāts AI komandām un atbalsta plašu LLM modeļu klāstu, ar vairāk nekā 3000 GenAI komandām un lielu tokena apjoma apstrādi diennakts laikā.
Kritēriju sadalījums
- AI vārti ar daudzpakāpenisku maršrutēšanu
- Solīņu pārvaldība un versiju pārvaldība
- Pieprasījumu žurnāli, izsekošana un analītika
- Semantiskā kešatmiņa un atkārtojumi
- Drošības līnijas ievades un izvades validācijai
- Lietošanas un izmaksu monitorēšanas paneļi
Helicone AI
Visiens observācijas platforma, lai uzraudzītu, atkļūdotu un uzlabotu ražošanas LLM lietojumprogrammas.
Helicone AI ir izstrādātāju orientēta observācijas platforma, kas speciāli izveidota lietojumprogrammām, kas darbojas ar lieliem valodu modeļiem. Tā ieraksta pieprasījumus, atbildes, izmaksas un aizkavējumus visā tīklā, sniedzot inženieru komandām vienotu skatījumu par to, kā viņu LLM funkcijas darbojas ražošanā. Papildus žurnālu izveidei, Helicone piedāvā rīkus, lai atkļūdotu promptus, izsekotu vairāku soļu agenta darba plūsmu, veiktu vērtējumus un izsekotu lietotāju līmeņa lietošanas datus. Komandas var identificēt regresijas, kontrolēt izdevumus un uzlabot promptus ar datiem, nevis uzminējumiem. Platforma integrējas ar populāriem modeļa piegādātājiem un ietvariem, izmantojot vieglu proksi vai asinhronu loggingu, padarot vienkāršu pievienošanu esošajiem stackiem bez lielām koda izmaiņām.
Kritēriju sadalījums
- Pieprasījuma un atbildes žurnālu
- Izmaksu un tokenu lietošanas izsekošana
- Prompt pārvaldība un versiju kontrole
- Agenta un sesiju izsekošana
- Pielāgoti vērtējumi un informācijas paneļi
- Lietotāju un rate-limit analītika

KeywordsAI
Vienots izstrādātāju platforma LLM lietojumprogrammu izveidei, uzraudzībai un mērogošanai.

KeywordsAI ir attīstītāju uzmanībai veltīta platforma, kas koncentrē to, kādēļ notiek, lai izplatītu kvalitātes līmeņa tekstdarbības modeli, kas attīstītas ar lieliem lingvistiskajiem modeleļiem. Tā sniedz vienu API ieeju, lai piekāpties dažādiem modeļu sniedzējiem, atkal pievienojot integritātes, ziņošanas un novērtējuma rīkus, lai palīdzībai komandas saprastu, kā tos darbojas realitātē raidītie informācijas sistēmas. Platforma ir dizaina, lai samazinātu darba krājumus, kuru ir nepieciešams, lai nodrošinātu darbakumu ar produktiem, kas tiek darināti ar atmiņas aģentu palīdzību. Deviņi var piegādāt datu plūsmu un izdevumu monitoringu, pārbauzties priekšvēlēšanos, veikt novērtējumus un pārvaldīt priekšvēlēšanas variantus bez izsekošanas nelielu dažādas darbinieces. Šāds pieeja tie kļūst ētras darbinieki, lai iterētu ātaka pielāgātu un izvietotu to pieejamību, kad lietošana pieaug.
Kritēriju sadalījums
- Vienots LLM vārteja starp piegādātājiem
- Pieprasījumu žurnāls un izsekne
- Izmaksu un iztecības uzraudzība
- Ievada frāžu eksperimentēšana un versiju kontrole
- Vērtēšanas un testēšanas darba plūsmas
- SDK un API integrācijas


Maxim AI ir programmu izstrādes platforma, kurā ir izveidoti resursi, lai komandas var izlādēt izturīgas AI agentes un LLM aplikācijas. Platformā tiek apvienota uzdevumu izstrāde, novērtēšana, monitorēšana un datu sadalījums, lai komandas var iterēt ātri, savukārt kvalitāte varētu būt noteikta. Platforma atbalsta automātiskus un cilvēka vērtējumus dažādos modeļos un izvēles punktos, ļaujot inženieri salīdzināt izvades, detektēt atkārtoto attīrstojošo izmaiņu, un secināt neveiksmes produkcijā. Tā ir projekta cilvēkiem izstrādāta, ar darbflēbām, kas ļaujas tikai tehisku un ne-tehisku interesēto puožu dalīties testēšanā un pārbaudē. Maxim parasti tiek izmantots komandām, kas būvē chatbotus, coplejotājus, vokālās agentes un daudzu-pazīšanas darbībju secību, kurām nepiechoty vienmērīga izvērsuma kvalitāte izmaiņu iemeslu, modelu un lietotāju ievades laikā.
Kritēriju sadalījums
- Promptu spēlētne un versiju kontrole
- Automatizēta agenta un LLM novērtēšana
- Ražošanas novērojamība un izsekošana
- Datu kopumu kurēšana un pārvaldība
- Cilvēka pārskatīšana un anotācijas darba plūsmas
- Daudzmodeļu un daudzpakalpojumu atbalsts
Relari (YC W24)
Testēšanas, novērtēšanas un sintētisko datu ģenerācijas platforma AI aģentiem.

Relari ir tiešsaistes platforma, kuras pamatā ir uzlabot AI aģentu patstāvīguma kvalitāti, izmantodams sistematisku testēšanu un novērtēšanu metodes. Tās palīdz komandām sagatavot sintetiskos datu sēklienus, izpildīt automatizētu novērtējumu un novērtēt aģentu darbu kvalitāti uzskatāmu scenāriju daudzumā pirms produkta izplatīšanas. Tuvēji sadarbojoties ar Y Combinator (W24), Relari mērķis ir inženieru komandas, kas veido komplexās LLM (nozīmē to, ka tie ir liela mēroga teicēji) lietišķo aplikāciju un daudzu līmeņu agentu, kurām tradicionālā kvalitātes pārbaude neizdevas pilnīgi. Relari tehnoloģija gaida, lai ieviestu programmētāju metodikas ieguvumi - vienītes testus, reģresiju kontroles un noteiktas mērījamas rādītāju, - neizdevīgās, dažādās atbildes garantijām tiešojāmu izmantošanu AI sistēmās. Platforma atbalsta pielietotu vērtētājus, scenāru simuli, un noteiktas monitorēšanas, tad tai ir liela vērtība, kad tiek izmantoti gan pre-lauza validācija, gan reāla laika kvalitātes nodrošināšana ražošanas agentiem.
Kritēriju sadalījums
- Sintētisku datu kopumu ģenerācija
- Automātiskā aģentu novērtēšanas konveijeri
- Scenārija un konversāciju simulācija
- Personalizējamās novērtēšanas metrikas
- Regressijas testēšana LLM lietotnēs
- Efektivitātes benchmarkingu un atskaitēšana





