Korábbi csata · 2025-12-21 UTC
Observability Leszámolás — 2025. december 21.
A(z) Observability kategóriából. 39 jelölés elhelyezve 10 versenyző között. AI2AI project szerezte meg a koronát.
Végeredmény
A felállás
A versenyzők
Minden eszköz profilja, amely ebben a csatában versenyzett, a végső pontszámuk szerint rangsorolva.

AI2AI project
Két mesterséges intelligencia egymással folytatott, valós idejű beszélgetését lehet megfigyelni

Az AI2AI projekt honlapján a felhasználók valós idejű, azaz éppen folyamatban levő beszélgetésként megtekinthetik két mesterséges intelligencia közötti kommunikációt. Az interakció megkezdéséhez a felhasználóknak két entitást kell létrehozniuk, figyelembe véve az entitásokhoz rendelt előfeltételt, kontextust, hangot és nemet, és egy nyelvi modellt kell választani. Az interakció elindítható, menthető és megosztható a többi felhasználóval az oldal rendszerében. Példák bizonyítják a különféle forgatókönyveket, mint például a szexuális ösztönzés, a harag, a kíváncsiság és a reklámcsapások. Új felhasználóknak el kell regisztrálniük és $1-ot (közönséges dollárt) kapnak hozzáférésért az oldalhoz. Az árazás percekre alapul, az első perctől 1 cent.
Kritériumok szétosztása
- Élő valós idejű mesterséges intelligencia-AI kommunikációs megfigyelés
- Két egyedi mesterséges intelligencia-entitás valós idejű beszélgetése
- Megfigyelési, nem befolyásoló felhasználói tapasztalat
- Emergiens mesterséges intelligencia viselkedés bemutatása
- Hozzáféréses böngészőalapú felület
Confident AI
LLM értékelési platform a DeepEval alapján a tesztelés, monitorozás és az AI alkalmazások javítására

A Confident AI egy értékelési és megfigyelési platform olyan csapatok számára, amelyek nagy nyelvi modell alkalmazásokat fejlesztenek. Az open-source DeepEval keretrendszerrel működve, egységes munkateret biztosít a benchmarkek, a regressziós tesztek és a minőség-ellenőrzések futtatására promptok, modellek és lekérdezési pipeline-ok felett. A platform segít a mérnököknek az álmok, a prompt visszaesések és a visszakeresési hibák elkapásában a szállítás előtt, miközben termelésifigyelést kínál a valós felhasználói interakciók nyomon követésére. A csapatok centralizálhatják az adathalmazokat, megoszthatják a tesztelési eredményeket és iterálhatnak a promptokon mérhető visszajelzések alapján, nem pedig találgatások szerint. Fejlesztőknek, ML mérnököknek és QA csapatoknak készült, akik szerkezetzetten, metrikákra épülő megközelítést szeretnének az LLM minőségügyi biztosításához, szemben az ad-hoc manuális felülvizsgálattal.
Kritériumok szétosztása
- DeepEval-alapú értékelési metrikák
- Regressziós tesztelés promptokhoz és modellekhez
- RAG és visszakeresési értékelés
- Termelési nyomkövetés és figyelés
- Adathalmaz- és teszteset-kezelés
- Csoportos együttműködés az értékelési eredményeken

KeywordsAI
Egyetlen fejlesztői platform az LLM alkalmazások építéséhez, figyeléséhez és méretekre szabásához.

A KeywordsAI egy fejlesztőknek szakosodott platform, amely összevonja azokat az eszközöket, amelyeket szükség szerint kiadásra kész, gyakorlati LLM alkalmazásokhoz. Szolgáltatja ezt az egyszerű API-gateway-t, amely átengedi a sok modellező szolgáltatóhoz, egyben beépített megfigyelő, naplózó és értékelő funkciókat biztosít az éppen használt AI-alkalmazás teljesítményének megértéséhez a valós világban. A platform a szoftverek LLM-energia alapú irányításának működési teherének csökkentésére tervezett. Az fejlesztők a késést és a költséget figyelhetik, a bemenetiutasításokat vizsgálhatják, kiértékelhetnek, és kezelhetik a bemenetiutasítások verzióit anélkül, hogy összeráznámák a különálló eszközöket. Ez egy hozzávetőlegesleg fokozza az építőcsapatokat az AI-szellemes képességek fejlesztésében és a megbízhatóság fenntartásában, amint a használat növekszik.
Kritériumok szétosztása
- Egyetlen LLM-kapu több szolgáltatók felett
- Kérelem naplózás és nyomon követés
- Költség- és késleltetésfigyelés
- Ügyfélkénti kísérletek és verziókezelés
- Értékelési és tesztelési folyamatok
- SDK-k és API-integrációk

Edwin AI
A IT műveletek számára tervezett robotos AI eszköz, amely felgyorsítja a helyzetkép észlelését, azonosítását és a rendezését.

Az Edwin AI egy AI robot, amely az IT műveletek számára tervezett ahhoz, hogy felgyorsítsa a helyzetkép észlelését, azonosítását és rendezését. Központi platformot biztosít az IT csapatok számára, hogy vizsgálja a helyzetkép, megértse hatását, keresse vagy generálja a megszüntetéshez szükséges megoldásokat és alkalmazza azokat a szokásos eszközökben anélkül, hogy át kellett volna térni más rendszerekhez. Az Edwin AI a jeleket összefüggésben állít össze, azonosítja a gyökereket és automatikusan beindítja a javítást az első figyelmeztetéstől a megerősített rendezésig. Az algoritmus a történelmi mintákat és figyelemmel kíséri az observabilitást a kimutatások és előrejelzéséhez a leállások és a kiesések kivédéséhez. A szoftver integrálódik több mint 3000 eszközzel az observabilitásban, APM-ban, biztonsági rendszerekben és CMDB-ben, lehetővé téve a valós idejű, határozott értesítéseket és a silók megszüntetését. A Forrester tanulmány kimutatta, hogy az Edwin AI 313% ROI-t nyújtott egy komponens szervezetnek, 6 hónapos vagy rövidebb megtérüléssel.
Kritériumok szétosztása
- Jeleség összefüggés és zajcsökkentés
- Azonosítási gyökerek AI-ve
- Természetes nyelvű helyzet összegzések
- Integrációk az ITSM és observabilitás platformokkal
- Automatizált vizsgálat folyamatok
- Tanulságok gazdagítása a múltbéli helyzetekből

Future AGI
Egy platform megvalósítva a szintetikus intelligencia pontosságának növekedését részletes értékeléssel és optimalizáló eszközökön keresztül.

A Future AGI egy platform, amely átfogó értékelő és optimalizáló eszközökkel növeli az AI pontosságát. Lehetővé teszi a felhasználók számára, hogy önfejlesztő ügynököket építsenek, felfedezzék, mi nem működik, és megtudják, miért. A platform számos funkciót kínál, többek között ügynök-értékelést, optimalizálást és szimulált beszélgetéseket. A felhasználók létrehozhatnak és kezelhetnek forgatókönyveket, és a platform elemzési és optimalizáló eszközöket biztosít az ügynökök teljesítményének javításához. Úgy tűnik, hogy a Future AGI a fejlesztők és vállalkozások igényeit szolgálja, akik AI-alapú chatbotok és ügynökök telepítését tervezik. Lehetővé teszi a felhasználók számára, hogy szimulálják a beszélgetéseket, értékeljék és optimalizálják az ügynökök teljesítményét, valamint integrálják a tudásbázisokkal. A platform inkább egy fejlesztőknek szóló eszköznek tűnik az AI-ügynökök létrehozására és finomhangolására, nem pedig ügyfélközpontú felületnek. A platform olyan funkciókat kínál, mint az ügynökértékelés, a szimulált beszélgetések és a szcenáriókezelés. Lehetővé teszi a felhasználók számára, hogy szerkesszék és kezeljék a promptokat, hozzáadják a tudásbázis‑cikkekhez a lekérdezési lépéseket, és integrálják a globális promptokat a komplex helyzetek kezeléséhez. Bár a Future AGI értékes funkciókat kínál az AI fejlesztéshez és optimalizáláshoz, korlátokkal is jár. Például általános tudásra támaszkodik, és összetettebb szituációk esetén további lépésekre lehet szükség. Emellett a platform szimulált beszélgetésekre való támaszkodása korlátozhatja a valós világ bizonytalanságainak kezelését. Úgy tűnik, a Future AGI egyedi funkciókészletet kínál az AI fejlesztéshez és optimalizáláshoz. Átfogó értékelési és optimalizációs eszközei értékes erőforrássá teszik a fejlesztők számára, akik AI ügynökeiket szeretnék finomhangolni. Ugyanakkor előfordulhat, hogy további fejlesztésre vagy integrációra van szükség a komplexebb helyzetek és a valós világ bizonytalanságainak kezeléséhez.
Kritériumok szétosztása
- Ügynök értékelés és rangsorolás
- Szimulált beszélgetések és forgatókönyv-kezelés
- Tudásközpont-integráció és visszakeresés
- Globális kérdéskezelés komplex helyzetek esetén
- Analitikai és optimalizálási eszközök

Inspeq AI
Az enterprise platform a felelős emberi intelligencia operacionalizálására az generatív emberi intelligencia alkalmazásokban.
A Inspeq AI segítnek azoknak az szervezeteknek, hogy a felelős AI gyakorlatot az irányelvek dokumentumai közül a napi mérnöki munkába emeljék. A platform a generatív AI alkalmazások értékelését, figyelését és kormányzásának lehetőséget nyújt a teljes életciklusuk folyamán, hangsúlyosan a lényeges minőségi, biztonsági és együttműködési mutatókkal. A csapataknak lehetőségük van egy automatizált értékelés futtatására az LLM kiadások ellen, azonosságtudatvesztési, diszkriminációs, toxikológiai és a kérdés injekciójának kockázatainak figyelésére, valamint beépítik az ellenőrzéseket a fejlesztési és termelési áramlatokba. A dashboard- és beszámolókkal a mérnöki csapatok, a kockázatkezelő tisztviselők és a üzleti érdekeltek egy közös nézetet kaphatnak a modell alapú viselkedésről. A fő célállomással vállalatokat céloz meg, amelyek GenAI termékeket fejlesztenek, amelyeket megbízható ügyfelekkel vagy szabályozott környezetben fog használnak és amelyek rendszeres felügyelettel és auditálhatósággal bírnak.
Kritériumok szétosztása
- Automatikus LLM kiállítás értékelése
- Tudással felduzzadt mérési pontok (prezsbiózis, toxicitás, hallucináció)
- Felmérési kockázatai az ösztönzésre és a válaszra
- Governing és az együttműködés jelentése
- Folyamat és API integrációs integráció
- Közeli megfigyelés a technikai és a kockázatcsapatokhoz

Maxim AI
Vég-től-végig platform a mesterséges intelligencia ügynökök értékeléséhez, figyeléséhez és fejlesztéséhez

A Maxim AI egy fejlesztői platform, amelyet kiszámítható AI ügynökök és LLM-alkalmazások megbízható kiadásának támogatására terveztek. Összegyűjti a szándékeltérések tervezését, kiértékelését, nyomon követését és adatkezelését, hogy a csapatok gyorsan dolgozhassanak, miközben a minőség megmérhető maradjon. A platform automatizált és emberi értékeléseket biztosít különböző modelljeink és prompok között, lehetővé téve a mérnöknek az output-ok összehasonlítását, a regresziók érzékelését és a hibák nyomon követését a termelési környezetben. Megfelelően tervezve a keresztfunkcionális együttműködésnek, a munkafolyamatok lehetővé teszik az beidegzett és az úgynevezett "non-tech" szereplők közösen történő hozzájárulását a tesztekhez és az értékeléshez. A Maxim általában olyan csapatokban használják, amelyek chatbotokat, szülőpilótákat, hangutasztókat, valamint többféle lépésben működő intelligens workflow-okat építenek, amelyek egy állandó teljesítményt igényelnek változó hívások, modellek és felhasználói input-ok esetén.
Kritériumok szétosztása
- Utasítás-játszó udvara és verziókezelés
- Automatikus ügynök- és LLM értékelés
- Termelési nyilvánosság és nyomon követés
- Adatfelügyelet és kezelés
- Egyénre szabott áttekintés és annotálási folyamatok
- Több modelles és több szolgáltató támogatás

Temperstack
AI-vezérelt megbízhatósági platform, amely automatizálja a monitorozást, a riasztást és az incidensek kezelését a megfigyelhetőségi veremben.

A Temperstack egy megbíthatósági mérnöki platform, amely az AI-t használja az ellenőrzés, az értesítés és a hibakezelés egyszerűsítésére azokon a eszközökön, amelyeken jelenleg a csapatok dolgoznak. Ehelyett a meglévő megfigyelési csomagokat egységesen pótolja, hanem rárétegez arra, hogy fedezetek hiányait azonosítsák, értelmes értesítéseket generáljanak és hogy az online-csapatok könnyebben reagálják a problémákra. A platform a SRE és DevOps csapatok segítségére lép a csúcssúlyú forgalom és a csúcsos hibakeresés problémájának elkerülésében, azaz csökkenti a figyelmeztetési szedéssel töltött időt, lerövidíti a megoldásigénylési időt, és biztosítja a szolgáltatásokon keresztüli megbízhatósági szabványok folyamatos fenntartását. A figyelmeztetési beállítások automatizálásával, a futási könyv végrehajtásával és a katasztrófavédelmi elemzéssel kapcsolatos rutinvagyások automatizálásával a Temperstack szabadít fel a mérnökeket, hogy fókuszában legyenek az értékes, megbízhatósági munka.
Kritériumok szétosztása
- AI-segített riasztáskonfiguráció
- Incidenskezelés több eszközön keresztül
- Automatizált monitorozási audit
- Runbook automatizálás
- Incidens utáni jelentés és elemzés
- Integráció a fő megfigyelhetőségi platformokkal

Arize AI
Egy AI megfigyelés és LLM értékelési platform, amely segíti az AI fejlesztőket és adatkutatókat a monitorozásban, hibaelhárításban, és a teljesítmény fokozásában.

Az Arize AI a vizsgálhatósági és nagy moduláris nyelvi értékelési platform. Tudományos mérnököket és adatelemzőket segíti abban, hogy figyelemmel kísérjék, hibakeresik és javítsák a teljesítményüket a természetgyilkos modelleiknél. A platform hibakereső eszközökkel rendelkezik az issueazonosság és javítási javaslatokat biztosító eszközökért. Az Arize AI olyan tervezésre szánt természetgyilkos fejlesztőknek és adatelemzőknek van, akik a modelljük optimális teljesítményét szeretnék elérni. A platform képességei magukban foglalják a figyelemmel kísérést és a hibakeresést, lehetővé téve az üzemeltetők számára, hogy gyorsan azonosítsák és kezeljék a problémákat. Az Arize AI rendelkezik továbbá funkciókkal értékeléshez és javításához modellperformanciája segít a felhasználóknak, hogy finomítsák a modelljeiket időről időre. Amikor használják az Arize AI rendszerét, a felhasználók biztosíthatják, hogy a természetgyilkos modelleik a legmagasabb teljesítményen működjenek, és jobb döntéshozással és eredményekkel jár.
Kritériumok szétosztása
- Ai modelmonitorozás
- A hibakezelés és problémakeresés segítése
- A javítás javasolt generálása
- A model teljesítmény-értékelés
- A LLM értékelés és optimalizálás

Weave
Egy no-code AI munkafolyamat-építő, amely lehetővé teszi a vállalkozások számára a műveletek automatizálását több nagy nyelvi modell (LLM) integrálásával és a promptok varrásával...

A Weave egy nyomon követő és értékelő platform, amely segít a nagy mennyiségű nyelvi modell (LLM) alkalmazások nyomon követésében és fejlesztésében. A Weave eszközökkel rendelkezik a tranzakciók nyomon követésére, a metrikus adattömeg gyűjtésére és alapértelmezett nyelvi modelleket használó kritikus (LLM kritikusok) és egyedi pontozók (custom scorers) segítségével az alkalmazási válaszok értékelésére. A kulcsfontosságú funkciók a tranzakciók, az LLM-hívások és az eszköz hívások nyomon követése, valamint a manuális beállítások a kereskedelmi ügynökök számára. A platform támogatja a népszerű SDK-kkal és megvalósítókkal való integrációkat, valamint adatforgalmi szempontból megszólítható ügynök megfigyelését is. Weave Python és TypeScript-könyvtárakat biztosít a platform telepítéséhez és használatához. A Weave-t a Weights & Biases (W&B) rendszeren futtatják, hozzájárulásra és API-jegyre van szükség a W&B fiók és az API azonosítója engedélyezéséhez. A felhasználók képesek visszakövetni a LLK-ket, áttekinteni az eredeti és a kapott eredményeket, majd megtekinteni az ügynök metrikákat a Weave felhasználói felületén. Bár a Weave lehetővé teszi az automatizálást és a LLK-alkalmazások értékelését, ez nem a neve miatt szó szerint a nem-kódú AI workflow építő eszköz, hanem egy egészen más jellegű technológia, mely felhasználóbarátan támogatja a fejlesztési folyamatokat.
Kritériumok szétosztása
- Ügynök nyomon követése és metrika gyűjtése
- Egyéni ügynök megfigyelhetősége
- LLM nyomon követése és értékelése
- OpenTelemetry span támogatás
- Weights & Biases (W&B) integrációk
- Python és TypeScript könyvtárak








