Minulý súboj · 2024-01-11 UTC
Observability Súboj — 11. januára 2024
Z kategórie Observability. 40 body udelených medzi 10 bojovníkov. Quotient AI získal korunu.
Konečné poradie
Zostava
Bojovníci
Profily každého nástroja, ktorý súťažil v tomto súboji, zoradené podľa ich konečného skóre.

Quotient AI
Platforma na monitorovanie a hodnotenie v reálnom čase pre odhaľovanie zlyhaní AI v oblasti vyhľadávania, RAG a agentov.
Quotient AI je platforma pre observabilitu a hodnotenie určená tímom, ktoré nasadzujú funkcie poháňané AI. Neustále monitoruje produkčné AI systémy – vrátane vyhľadávania, retrieval-augmented generation (RAG) a autonómnych agentov – aby odhalila halucinácie, chyby pri vyhľadávaní a ďalšie problémy s kvalitou skôr, než ich uvidia koncoví používatelia. Platforma kombinuje automatizované hodnotenia s výstrahami v reálnom čase, pomáha inžinierskym a ML tímom diagnostikovať príčiny, sledovať regresie pri zmenách modelov alebo promptov a udržiavať spoľahlivosť vo veľkom meradle. Instrumentovaním AI pipeline Quotient poskytuje vývojárom prehľad o tom, ako ich aplikácie skutočne fungujú v praxi, namiesto spoliehania sa len na offline benchmarky.
Rozdelenie kritérií
- Monitorovanie AI v reálnom čase a výstrahy
- Detekcia halucinácií a chýb pri vyhľadávaní
- Nástroje na hodnotenie pre RAG pipeline
- Sledovanie a diagnostika správania agentov
- Analýza regresie pri zmenách modelu a promptu
- Observabilita produkcie pre AI aplikácie

Weave
Bez kódovný nástroj na tvorbu pracovných postupov umelej inteligencie, ktorý umožňuje firmám automatizovať prevádzku integráciou viacerých veľkých jazykových modelov (LLM) a pripojením výziev...

W&B Weave je platforma pre pozorovanie a hodnotenie, ktorá pomáha sledovať a zlepšovať aplikácie veľkých jazykových modelov (LLM). Weave poskytuje nástroje na sledovanie, zhromažďovanie metrík a hodnotenie odpovedí aplikácií pomocou hodnotiteľov LLM a vlastných skóre. Medzi kľúčové funkcie patria sledovanie relácií, volaní LLM a nástrojov, ako aj manuálna instrumentácia vlastných agentov. Platforma podporuje integrácie s populárnymi SDK a harnesses, ako aj vlastnú pozorovateľnosť agentov. Weave poskytuje knižnice Python a TypeScript pre inštaláciu a používanie platformy. Je hostovaná na Weights & Biases (W&B) a vyžaduje účet W&B a API kľúč pre autentifikáciu. Používatelia môžu sledovať volania do LLM, kontrolovať vstupy a výstupy a zobraziť metriky agenta v používateľskom rozhraní Weave. Zatiaľ čo Weave uľahčuje automatizáciu a hodnotenie aplikácií LLM, nie je to nástroj na vytváranie pracovných postupov AI bez kódu, ako by sa dalo usúdiť z jeho názvu.
Rozdelenie kritérií
- Sledovanie agentov a zhromažďovanie metrík
- Vlastná pozorovanie agentov
- Sledovanie a hodnotenie LLM
- Podpora OpenTelemetry span
- Integácie s Weights & Biases (W&B)
- Knižnice Python a TypeScript

AgentOps je vývojárska platforma zameraná na životný cyklus AI agentov, poskytujúca nástroje na sledovanie, monitorovanie a ladenie, ktoré odhaľujú, čo agenti skutočne robia počas behu. Zachytáva volania LLM, využitie nástrojov, náklady a chyby, aby tímy mohli pochopiť správanie agentov v zložitých viacstupňových pracovných postupoch. Okrem viditeľnosti ponúka AgentOps prehrávanie relácií, analýzu výkonu a integrácie s populárnymi rámcami pre agenty ako LangChain, CrewAI a AutoGen. To pomáha inžinierom prejsť od prototypu k produkcii s merateľnou spoľahlivosťou namiesto spoliehania sa na dohady alebo zoškrabanie protokolov. Je určený pre vývojárov a tímy, ktoré dodávajú agenta aplikácie a potrebujú sledovať regresie, kontrolovať náklady a preukázať, že ich agenti sa správajú správne pred a po nasadení.
Rozdelenie kritérií
- Záznam a prehrávanie relácií agentov
- Sledovanie volaní LLM a používania nástrojov
- Analýza nákladov a tokenov
- Detekcia chýb a zlyhaní
- SDK pre framework pre Python a JavaScript
- Dashboardy pre metriky výkonu agentov
Confident AI
Platforma hodnotenia LLM postavená na DeepEval pre testovanie, monitorovanie a zlepšovanie AI aplikácií.

Confident AI je platforma na hodnotenie a sledovanie pre tímy, ktoré vyvíjajú aplikácie s veľkými jazykovými modelmi. Podpieraná open-source rámcom DeepEval, poskytuje jednotné pracovné prostredie na spúšťanie benchmarkov, regresných testov a kontrol kvality naprieč promptmi, modelmi a vyhľadávacími pipeline. Platforma pomáha inžinierom odhaliť halucinačné výstupy, regresie promptov a zlyhania vyhľadávania ešte pred nasadením, pričom ponúka monitorovanie produkcie na sledovanie reálnych interakcií používateľov. Tímy môžu centralizovať dátové súbory, zdieľať výsledky testov a iterovať na promptoch s merateľnou spätnou väzbou namiesto hádaní. Cieľom je vývojári, ML inžinieri a QA tímy, ktorí hľadajú štruktúrovaný, metricky riadený prístup k zaručeniu kvality LLM namiesto ad-hoc manuálneho prehliadania.
Rozdelenie kritérií
- Hodnotiace metriky poháňané DeepEval
- Regresné testovanie promptov a modelov
- Hodnotenie RAG a vyhľadávania
- Sledovanie a monitorovanie v produkcii
- Správa dátových súborov a testovacích prípadov
- Tímová spolupráca na výsledkoch hodnotenia

Fiddler AI
Platforma pre AI observabilitu a bezpečnosť na monitorovanie, vysvetľovanie a reguláciu aplikácií ML a LLM.

Fiddler AI je podniková platforma, ktorá pomáha tímom monitorovať, analyzovať a zabezpečovať modely strojového učenia a generatívne aplikácie umelej inteligencie vo výrobe. Poskytuje prehľad o výkone modelu, odchýlke údajov, zaujatosti a problémoch s kvalitou, pričom tiež ponúka ochrany proti rizikám špecifickým pre LLM, ako sú halucinácie, vstrekovanie výziev a nebezpečné výstupy. Navrhnuté pre strojových inžinierov, dátových vedcov a tímy pre riziká a súlad, Fiddler kombinuje vysvetľovateľnosť, monitorovanie v reálnom čase a ochranné mechanizmy v jednom pracovnom postupe. Integruje sa s bežnými potrubiami ML a cloudovými prostredíami, čím pomáha organizáciám operacionalizovať zodpovedné praktiky AI v rozsahu.
Rozdelenie kritérií
- Monitorovanie výkonnosti modelu a posunu dát
- Detekcia halucinácií LLM a bezpečnosť
- Ochrana pred injekciou promptu a jailbreakom
- Vysvetliteľná AI a analýza príčin
- Hodnotenia zaujatosti a spravodlivosti
- Dashboardy a upozornenia pre produkčné AI


Portkey je jednotná riadiaca plocha na tvorbu, správu a monitorovanie AI aplikácií. Poskytuje komplexnú platformu pre AI tímy, ktoré chcú prejsť do produkcie, a ponúka funkcie ako AI Gateway, Observability, Guardrails, Governance a Prompt Management. Platforma umožňuje používateľom pristupovať k viac ako 1 600 LLM prostredníctvom jednotného API, čím zjednodušuje proces integrácie modelov a umožňuje tímom sústrediť sa na vývoj namiesto správy. Portkey tiež ponúka observabilitu v reálnom čase, čo používateľom umožňuje sledovať správanie LLM, včas zachytávať anomálie a proaktívne riadiť využitie. Okrem toho platforma poskytuje funkciu cache, ktorá už dokázala používateľom ušetriť tisíce dolárov znížením nadbytočných testov. Portkey je určený pre AI tímy a podporuje širokú škálu LLM, s viac ako 3 000 GenAI tímami a veľkým počtom tokenov spracovávaných denne.
Rozdelenie kritérií
- AI gateway s viacposkytovateľským smerovaním
- Správa a verzovanie promptov
- Záznamy požiadaviek, trasovanie a analytika
- Sémantické cachovanie a opakovania
- Guardrails pre validáciu vstupov a výstupov
- Dashboardy pre monitorovanie využitia a nákladov
Relari (YC W24)
Platforma na testovanie, hodnotenie a generovanie syntetických dát pre AI agentov.

Relari je platforma pre vývojárov zameraná na zlepšenie spoľahlivosti AI agentov prostredníctvom systematického testovania a hodnotenia. Pomáha tímom vytvárať syntetické súbory údajov, spúšťať automatizované hodnotenia a porovnávať výkonnosť agentov v realistických scenároch pred nasadením do produkcie. Spoločnosť Relari, podporovaná spoločnosťou Y Combinator (W24), sa zameriava na tímy vývojárov, ktoré vytvárajú zložité aplikácie LLM a viacstupňové agenty, kde tradičné testovanie kvality nestačí. Ich nástroje majú za cieľ priniesť prísnosť softvérového inžinierstva - jednotkové testy, regresné kontroly a merateľné metriky - do nedeterministických systémov AI. Platforma podporuje vlastné evaluátory, simuláciu scenárov a priebežné monitorovanie, čo ju robí užitočnou pre overenie pred spustením aj pre priebežné zabezpečovanie kvality produkčných agentov.
Rozdelenie kritérií
- Generovanie syntetických dátových sád
- Automatizované hodnotiace pipeline pre agentov
- Simulácia scenárov a konverzácií
- Prispôsobiteľné hodnotiace metriky
- Regresné testovanie pre LLM aplikácie
- Benchmarkovanie výkonnosti a reportovanie

Arize AI
Platforma pre pozorovanie AI a hodnotenie LLM, ktorá pomáha vývojárom AI a dátovým vedcom monitorovať, odstraňovať problémy a zlepšovať výkon...

Arize AI je platformou pre AI observabilitu a vyhodnotenie LLM. Pomáhajú tak vývojárom AI aplikácií a datovým vedcom v monitorovaní, vyšetrovaní a zlepšovanie výkonu ich AI modelov. Platforma poskytuje nástroje pre identifikovanie problémov a navrhovanie riešení, ktorými pomáhajú používateľom zlepšiť presnosť a spoľahlivosť ich modelov. Arize AI je navrhnutá pre vývojárov AI aplikácií a datových vedcov, ktorí potrebujú optimalizovať výkon ich modelov. Kapacita platformy zahrňuje monitorovanie a vyšetrovanie, umožňujúce používateľom rýchlo identifikovať a riešiť problémy. Arize AI tiež poskytuje funkcie pre vyhodnotenie a zlepšenie výkonnosti modelov, umožňujúce používateľom počas času precísiť svoje modely. Použitím Arize AI zabezpečia, ich AI modely sú operujúce na maxime výkonu, viedlo to vedie k lepším rozhodovaním a výsledkom. Fosus platformy na observabilitu a vyhodnotenie ju odlišuje od iných nástrojov pre rozvoj AI, čo ju robí cenným zdrojom pre tých, ktorí pracujú s veľkými jazykovými modelami a inými komplexnými AI systémami.
Rozdelenie kritérií
- Monitorovanie modelov AI
- Rozšírené diagnostické a identifikácie problemaťov
- Generovanie predložených úprav
- Evalvovanie vypočítaný výkon modelu
- Hodnotenie a optimalizácia LLM

Edwin AI
Edwin AI: Artificial Intelligenca aplikovaná na IT-operácie, ktorá zamezáva uzavreté úlohy a spravuje incidente rýchlejšia.

Edwin AI je AI aplikáciou pro IT-operácie s účinnosťou v kontroláre chyb a obchodnobyznacie stránky. Zmyšlenie automaticky zoradí čoskoro 40 000 odhadť a pomôže vám pokračovať s rozbalením, aby ste mohli použiť automatický diagnózis éta, automatický ochistič systém a hlukový údaje priradené k položke funkci, aby ste dostali slabé mathy. Oslôbka funkci ".
Rozdelenie kritérií
- Korelácia upozornení a zníženie hluku
- Návrhy príčin pomocou AI
- Zhrnutia incidentov v prirodzénom jazyku
- Integácie s ITSM a platformami pozorovanosti
- Automatizované pracovné postupy triediace incidenty
- Rozšírenie znalostí z minulých incidentov


FoundryAI je vývojová platforma zameraná na vytváranie AI agentov, ktorí zvládajú reálne obchodné pracovné postupy. Kombinuje nástroje na návrh, testovanie a kontinuálne zlepšovanie agentov, aby tímy mohli prejsť od prototypu k produkcii bez toho, aby museli kombinovať samostatné systémy. Platforma sa zameriava na hodnotenie a poskytuje vývojárom spôsoby, ako merať výkonnosť agentov oproti definovaným úlohám a časom dolaďovať správanie. To ju robí vhodnou pre organizácie, ktoré automatizujú zákaznícku podporu, interné operácie alebo opakujúcu sa znalostnú prácu, kde záleží na spoľahlivosti. Spoločnosť FoundryAI sa zameriava na technické tímy, ktoré potrebujú viac kontroly, než akú poskytujú no-code buildery, ale chcú rýchlejšiu iteráciu ako pri úplne vlastnom vývoji agentov.
Rozdelenie kritérií
- Prostredie na tvorbu agentov
- Nástroje na hodnotenie a testovanie
- Monitorovanie výkonu
- Podpora automatizácie pracovných postupov
- Iteratívne cykly zlepšovania
- Integrácia s podnikateľskými systémami






