Korábbi csata · 2023-12-27 UTC
Observability Leszámolás — 2023. december 27.
A(z) Observability kategóriából. 30 jelölés elhelyezve 8 versenyző között. Fiddler AI szerezte meg a koronát.
Végeredmény
A felállás
A versenyzők
Minden eszköz profilja, amely ebben a csatában versenyzett, a végső pontszámuk szerint rangsorolva.

Fiddler AI
Mesterséges intelligencia megfigyelési és biztonsági platformja a monitoring, indokolás és kormányzás számára ML és LLM alkalmazásokhoz.

Fiddler AI egy vállalati platform, amely segíti a csapatokat a gépi tanulási modellek és a generatív AI alkalmazások termelésben történő felügyeletében, elemzésében és biztonságos működtetésében. Láthatóságot biztosít a modell teljesítményére, az adatok eltolódására, a torzításra és a minőségproblémákra, miközben védelmi mechanizmusokat kínál az LLM-ekhez kapcsolódó kockázatok, például a hallucinációk, a prompt‑injekció és a nem biztonságos kimenetek ellen. Az ML mérnökök, adatkutatók és a kockázati és megfelelőségi csapatok számára tervezve, a Fiddler egyetlen munkafolyamatban egyesíti a magyarázhatóságot, a valós idejű monitorozást és a guardrails-et. Integrálódik a gyakori ML pipeline-okkal és felhő környezetekkel, segítve a szervezeteket a felelős AI gyakorlatok méretarányos működtetésében.
Kritériumok szétosztása
- Modell teljesítmény- és eltolódásfigyelés
- LLM hallucinációs és biztonsági érzékelés
- Kérelmezési injekció- és börtön védelme
- Indokolható mesterséges intelligencia és gyökér okozó elemzés
- Mászás és törvényességi értékelések
- Táblázatok és figyelmeztetések a termelési AI-hez

FoundryAI
Felépíts, értékelj és javítson mesterséges intelligencia ügynököket üzleti automatizáláshoz

FoundryAI egy fejlesztői platform, amely az AI ügynökök létrehozására összpontosít, és valós üzleti munkafolyamatok kezelésére képes. Összevonja az ügynöktervezést, tesztelést és a folyamatos fejlesztési eszközöket, így a csapatok a prototípustól a produkcióig juthatnak anélkül, hogy különálló rendszereket kellene összefűzni. A platform hangsúlyozza az értékelést, lehetőséget biztosítva a fejlesztőknek az ügynök teljesítményének mérésére a meghatározott feladatokhoz viszonyítva, valamint a viselkedés időbeli finomhangolására. Ezáltal alkalmas olyan szervezetek számára, amelyek ügyfélszolgálatot, belső működést vagy ismétlődő tudásmunkát automatizálnak, ahol a megbízhatóság fontos. FoundryAI azoknak a technikai csapatoknak szól, akik nagyobb kontrollt igényelnek, mint a no‑code építőeszközök, de gyorsabb iterációt szeretnének, mint az ügynökök teljesen az alapoktól történő felépítése.
Kritériumok szétosztása
- Ügynök felépítő környezet
- Értékelési és tesztelési eszközök
- Teljesítmény monitoring
- Munkafolyamat automatizálási támogatás
- Iteratív fejlesztési körfolyamatok
- Integráció más üzleti rendszerekkel

Quotient AI
Valós idejű monitoring és értékelési platform a keresési, RAG és agent hibák azonosítására.
A Quotient AI egy megfigyelő- és értékelési platform, amely a csapatok számára lett kialakítva, amelyek AI-szerepességet szállítanak. Képes folyamatosan figyelni az AI-termékekkel termelt termékeket, beleértve a keresést, a visszakereső-erősítő generálást (RAG) és a független szereplőket is –, hogy kiemeljen hallucinációkat, visszakeresői hibákat és az egyéb minőségi problémákat, mielőtt az end felhasználók találkoznának velük. A platform a automatizált értékelések kombinálása valós idejű értesítésekkével, segítve az építő- és az ML-csapatokat a gyökér okok diagnosztizálásában, a modell vagy a prompt változásainak általános lefutásának nyomon követésében és a megbízhatóság fenntartásában nagy skálán. A Quotient a szoftverfejlesztők felé nyújt biztonságot azzal is, hogy a termékeik életben is működnek valójában, és ezzel nincsenek attól a korlátoktól eltiltva, hogy másféle offline mutatókra támaszkodjanak.
Kritériumok szétosztása
- Valós idejű AI-monitorozás és sürgős figyelmeztetés
- Hallucinációk és kivonatolási hiba detektálása
- Gyűjtővezeték-elektronika RAG-párhuzamokhoz
- Szállító rendszer viselkedésének nyomon követése és diagnosztizálása
- Regressziós elemzés modellek vagy utasításváltozások között
- Termelési megfigyelés AI alkalmazásokhoz

Portkey
Egyetlen ellenőrző sík, ahol kiépítheted, kezelheted és figyeledheted az AI alkalmazásokat

A Portkey egy egyetlen ellenőrző sík szolgáltatás az AI alkalmazások kiépítéséhez, kezeléséhez és figyeléséhez. Olyan összefüggő platformot kínál, amelyben az AI-csapatok gyorsan termelésbe tudnak kerülni. Többek között az AI Gatewayt, figyelemmel kísérhetőséget (Observability), védőfaluakat (Guardrails), kormányzati eszközöket (Governance) és utasításkészletek (Prompt Management) biztosít. A szolgáltatás lehetővé teszi a felhasználók számára, hogy hozzáférjenek az 1600-nál több kinyomtatási modellhez (LLMs) egyetlen, egységes API-kapun keresztül, amely azáltal hozza közelebb a modell integrációra a szükséges folyamatot és lehetővé teszi a csapatoknak, hogy az építésre fókuszálhassanak, és ne a kezelésre. A Portkey valós időben követi nyomon a készüléket, lehetővé téve a felhasználóknak, hogy nyomon kövessék a kinyomtatási modell viselkedését, gyorsan észleljék az anómáliákat, és aktívan kezeljék a felhasználást. Emellett a szolgáltatás cache-képességeket biztosít, amelyek a redundáns tesztek csökkentésével azon felhasználók számára több ezer dollárt költségek csökkentését mutatták az elmúlt években. A Portkey a korlátozások nélküli 3000 GenAI-csapat számára tervezhető a kereskedelmi forgalomba és egy nagy mennyiségű tokenek feldolgozását támogatja naponta.
Kritériumok szétosztása
- AI-gateway multi-forrással
- Utasításkészletek kezelése és verziózása
- Kérelmi naplózás, nyomon követési láncok és elemzők
- Szinonim tárolás és újrakíséretek
- Védőfaluak beállítások input- és output-kezeléshez
- Felhasználási és költségbeli nyomonkövetési felületek
Helicone AI
Összefogott megfigyelőplatform az applikációk monitorozásához, hibakereséséhez és fejlesztéséhez szolgáló LLM alkalmazásokra.
A Helicone AI egy fejlesztői felkészültségű figyelemfelkeltési platform, amelyet a nagy méretű nyelvi modellek által hajtott alkalmazásokhoz szánták. Tudja fogni a kéréseket, a válaszokat, a költségeket és a késést a szolgáltatók között, így a mérnöki csapatoknak egységes megjelenést ad az LLM-komponensek viselkedéséről a termelésben. A naplózás mellett a Helicone fejlett eszközöket kínál a kérdések hibakeresésére, a többlépcsős ügynök folyamatok nyomán való nyomon követésre, a végrehajtások futtatására és a felhasználó-szintű felhasználási nyomon követésre. A csapattagok az adatokban való feltételezés nélküli iterációk helyett regresziók azonosítására, költségszabályozásra, és kérdések iterálására károsíthatnak, hogy adatai segítségével működhessenek. A köztudott modell-kedvelőkkel, illetve keretrendszerekkel integrálva alacsony súlyú proxy vagy aszinkron naplózás segítségével könnyedén hozzáadható a meglévő stakhekhez minimális kódváltozásokkal.
Kritériumok szétosztása
- Kérések és válaszok feljegyzése
- Költség- és token használati nyomon követés
- Párhuzamos feladatkezelők és szezon nyomon követése
- Egyszerű értékelések és táblázatok futtatása
- Felhasználó- és gyorsítótár elemzés
- Cárnézetek és fogyasztási összehasonlítás

KeywordsAI
Egyetlen fejlesztői platform az LLM alkalmazások építéséhez, figyeléséhez és méretekre szabásához.

A KeywordsAI egy fejlesztőknek szakosodott platform, amely összevonja azokat az eszközöket, amelyeket szükség szerint kiadásra kész, gyakorlati LLM alkalmazásokhoz. Szolgáltatja ezt az egyszerű API-gateway-t, amely átengedi a sok modellező szolgáltatóhoz, egyben beépített megfigyelő, naplózó és értékelő funkciókat biztosít az éppen használt AI-alkalmazás teljesítményének megértéséhez a valós világban. A platform a szoftverek LLM-energia alapú irányításának működési teherének csökkentésére tervezett. Az fejlesztők a késést és a költséget figyelhetik, a bemenetiutasításokat vizsgálhatják, kiértékelhetnek, és kezelhetik a bemenetiutasítások verzióit anélkül, hogy összeráznámák a különálló eszközöket. Ez egy hozzávetőlegesleg fokozza az építőcsapatokat az AI-szellemes képességek fejlesztésében és a megbízhatóság fenntartásában, amint a használat növekszik.
Kritériumok szétosztása
- Egyetlen LLM-kapu több szolgáltatók felett
- Kérelem naplózás és nyomon követés
- Költség- és késleltetésfigyelés
- Ügyfélkénti kísérletek és verziókezelés
- Értékelési és tesztelési folyamatok
- SDK-k és API-integrációk

Maxim AI
Vég-től-végig platform a mesterséges intelligencia ügynökök értékeléséhez, figyeléséhez és fejlesztéséhez

A Maxim AI egy fejlesztői platform, amelyet kiszámítható AI ügynökök és LLM-alkalmazások megbízható kiadásának támogatására terveztek. Összegyűjti a szándékeltérések tervezését, kiértékelését, nyomon követését és adatkezelését, hogy a csapatok gyorsan dolgozhassanak, miközben a minőség megmérhető maradjon. A platform automatizált és emberi értékeléseket biztosít különböző modelljeink és prompok között, lehetővé téve a mérnöknek az output-ok összehasonlítását, a regresziók érzékelését és a hibák nyomon követését a termelési környezetben. Megfelelően tervezve a keresztfunkcionális együttműködésnek, a munkafolyamatok lehetővé teszik az beidegzett és az úgynevezett "non-tech" szereplők közösen történő hozzájárulását a tesztekhez és az értékeléshez. A Maxim általában olyan csapatokban használják, amelyek chatbotokat, szülőpilótákat, hangutasztókat, valamint többféle lépésben működő intelligens workflow-okat építenek, amelyek egy állandó teljesítményt igényelnek változó hívások, modellek és felhasználói input-ok esetén.
Kritériumok szétosztása
- Utasítás-játszó udvara és verziókezelés
- Automatikus ügynök- és LLM értékelés
- Termelési nyilvánosság és nyomon követés
- Adatfelügyelet és kezelés
- Egyénre szabott áttekintés és annotálási folyamatok
- Több modelles és több szolgáltató támogatás
Relari (YC W24)
Kivizsgálás, értékelés és szintetikus adatgenerálós platform az AI ügynökök számára.

A Relari a fejlesztők platformja arra a célra, hogy javítsa az AI ügynökök megbízhatóságát rendszeres tesztelések és értékelések segítségével. Segít a csapatoknak szintetikus adatagyűjteményeket létrehozni, automatizált értékeléseket futtatni, és az ügynök teljesítményét mérni valósághű forgatókönyvekben a termelés megkezdése előtt. A Y Combinator által támogatott Relari az olyan komplex LLM alkalmazásokat és többlépéses ügynököket fejlesztő hardveres csapatokat célozza, amelyeknél a hagyományos tesztelés megbecsülhetetlen. A eszközök célja, hogy szoftverfejlesztői szigorúságot – egységteszteket, regressziós ellenőrzéseket és mérhető metrikákat – hordozzanak az alkalmazásokhoz és a nem megfelelő AI rendszerekhez nem megbízhatóan működő rendszerekhez. A platform támogatja a sajátosságú értékelőket, forgatókönyv-szimulációt és folyamatos figyelemmel kísérést, így mindenképpen hasznosnak bizonyul mind a indítás-előtti validációhoz, mind a termelési ügynökök állandó minőségi igazgatásához.
Kritériumok szétosztása
- Szintetikus adatkészlet-generálás
- Szabályzott ügynök-értékelési folyamatok
- Tényfeltárási forgatókönyvek és beszélgetés-szimuláció
- Konzultációval megadható értékelési mutatók
- Visszafordítható ellenőrzések az LLM alkalmazások számára
- Teljesítmény-becslés és beszámolók





