Pretekla bitka · 2025-12-21 UTC
Observability Obračun — 21. december 2025
Iz kategorije Observability. 39 oznake postavljenih med 10 borci. AI2AI project je osvojil krono.
Končna razvrstitev
Postava
Borci
Profili vsakega orodja, ki je tekmovalo v tej bitki, razvrščeni po končnem rezultatu.


Na spletni strani projekta AI2AI uporabniki lahko opazujejo pogovore v realnem času med dvema AI agentoma. Za začetek interakcije morajo uporabnike ustvariti dve entiteti, jim dodeliti navodila (prompt), kontekst, glas in spol, ter izbrati jezikovni model. Interakcijo lahko začnejo, shranijo in delijo z drugimi uporabniki na strani. Prikazane so primere interakcij, ki predstavljajo različne scenarije, kot so prepričevanje, jezo, radovednost in prodajni predlogi. Novi uporabniki se morajo registrirati in prejeti kredit v višini 1 $ za raziskovanje platforme. Ceno določajo po minuti, od 1 centa na minuto.
Razdelitev kriterijev
- Spremljanje živih dialogov AI-ov z AI-om
- Dve različni AI entiteti v pogovoru
- Opazovalna, brezvmesna uporabniška izkušnja
- Prikaz emergentnega AI vedenja
- Dostopen vmesnik na osnovi brskalnika
Confident AI
Platforma za ocenjevanje LLM, zasnovana na DeepEval za testiranje, spremljanje in izboljševanje AI aplikacij.

Confident AI je platforma za ocenjevanje in opazovanje za ekipe, ki razvijajo aplikacije z velikimi jezikovnimi modeli. Podprta z odprtokodnim okvirom DeepEval, nudi enotno delovno okolje za izvajanje benchmarkov, regresijskih testov in preverjanj kakovosti preko promptov, modelov in retrieval pipelineov. Platforma pomaga inženirjem odkriti halucinacije, regresije promptov in napake pri pridobivanju pred izdajo, hkrati pa nudi spremljanje v produkciji za sledenje dejanskim uporabniškim interakcijam. Skupine lahko centralizirajo podatkovne zbirke, delijo rezultate testov in iterirajo prompt-e z merljivimi povratnimi informacijami namesto ugibanja. Usmerjen je k razvijalcem, ML inženirjem in QA ekipam, ki želijo strukturiran, na metrikah temelječ pristop k zagotavljanju kakovosti LLM‑jev, namesto ad‑hoc ročnega pregleda.
Razdelitev kriterijev
- Merila ocenjevanja, podprta z DeepEval
- Regresijsko testiranje za promte in modele
- Ocenjevanje RAG in iskanja
- Sledenje in spremljanje v produkciji
- Upravljanje podatkovnih nizov in testnih primerov
- Sodelovanje ekipe pri rezultatih ocenjevanja

KeywordsAI
Enotni razvojni platform za gradnjo, spremljanje in skaliranje LLM aplikacij.

KeywordsAI je platforma, osredotočena na razvijalce, ki združuje orodja, potrebna za pošiljanje produkcijskih LLM aplikacij. Ponudi enoten API gateway za dostop do več ponudnikov modelov, poleg vgrajene observability, logging in evaluation funkcij, ki ekipam pomagajo razumeti, kako se njihove AI funkcije delujejo v resničnem svetu. Platforma je zasnovana tako, da zmanjša operativne stroške pri izvajanju izdelkov, ki temeljijo na LLM. Razvijalci lahko spremljajo zamudo in stroške, odpravljajo napake v pozivih, izvajajo ocene in upravljajo različice pozivov brez sestavljanja ločenih orodij. To omogoča enostavnejše iteriranje AI funkcij in ohranjanje zanesljivosti s povečevanjem obsega uporabe.
Razdelitev kriterijev
- Enotna LLM prehodnica med ponudniki
- Sledenje in beleženje zahtevkov
- Sledenje stroškov in zakasnin
- Eksperimentiranje s prompti in upravljanje različic
- Ocenjevanje in testni tokovi
- SDKs in API integracije

Edwin AI
AI agent za IT operacije, ki pospešuje odkrivanje, triažo in reševanje incidentov.

Edwin AI je AI agent za IT operacije, zasnovan za pospešitev zaznavanja incidentov, triage in reševanja. Nudi centralizirano platformo za IT ekipe, ki omogoča preiskovanje incidentov, razumevanje njihovega vpliva, iskanje ali ustvarjanje popravkov ter njihovo uporabo v obstoječih orodjih, brez potrebe po preklapljanju med sistemi. Edwin AI korelira opozorila, identificira osnovne vzroke in samodejno sproži odpravo, od prvega opozorila do potrjene rešitve. Uporablja zgodovinske vzorce in podatke o opazljivosti za napovedovanje in preprečevanje izpadov. Orodje se integrira z več kot 3.000 orodji na področju opazljivosti, APM, varnosti in CMDB, kar omogoča vpogled v realnem času, dejanske ukrepe in odpravlja silose. Študija Forrester je ugotovila, da je Edwin AI prinesel 313 % ROI za sestavljeno organizacijo, s povrnitvijo investicije v 6 mesecih ali manj.
Razdelitev kriterijev
- Korelacija alarmov in zmanjševanje šuma
- Predlogi za korenski vzrok, ki jih poganja AI
- Povzetki incidentov v naravnem jeziku
- Integracije z ITSM in platformami za opazovanje
- Avtomatizirani triažni tokovi
- Obogatitev znanja iz preteklih incidentov

Future AGI
Platforma, ki izboljšuje natančnost AI s pomočjo celovite ocene in orodij za optimizacijo.

Future AGI je platforma, ki izboljšuje natančnost AI s pomočjo celovitega orodja za ocenjevanje in optimizacijo. Uporabnikom omogoča gradnjo samoizboljšujočih agentov, odkrivanje napak in razumevanje vzrokov. Platforma ponuja vrsto funkcij, vključno z ocenjevanjem agentov, optimizacijo in simuliranimi pogovori. Uporabniki lahko ustvarjajo in upravljajo scenarije, platforma pa nudi analitike in orodja za optimizacijo, ki izboljšujejo zmogljivost agentov. Future AGI se zdi, da je namenjen razvijalcem in podjetjem, ki želijo uvajati AI‑podprte klepetalnike in agente. Uporabnikom omogoča simulacijo pogovorov, ocenjevanje in optimizacijo učinkovitosti agentov ter integracijo z bazami znanja. Platforma izgleda kot orodje za razvijalce za ustvarjanje in izpopolnjevanje AI agentov, namesto kot uporabniški vmesnik za stranke. Platforma ponuja funkcije, kot so ocenjevanje agentov, simulirani pogovori in upravljanje scenarijev. Uporabnikom omogoča urejanje in upravljanje promptov, dodajanje korakov za pridobivanje iz člankov baze znanja ter integracijo z globalnimi prompti za obravnavo kompleksnih situacij. Čeprav Future AGI ponuja dragocene funkcije za razvoj in optimizacijo umetne inteligence, ima tudi svoje omejitve. Na primer, temelji na splošnem znanju in za bolj zapletene scenarije lahko zahteva dodatne korake. Poleg tega lahko odvisnost platforme od simuliranih pogovorov omeji njeno sposobnost obvladovanja nepredvidljivosti v resničnem svetu. Future AGI se zdi, da ponuja edinstven nabor funkcij za razvoj in optimizacijo AI. Njegova obsežna orodja za ocenjevanje in optimizacijo ga naredijo za dragocen vir razvijalcem, ki želijo izpopolniti svoje AI agente. Vendar pa lahko zahteva dodatni razvoj ali integracijo za obvladovanje bolj zapletenih scenarijev in negotovosti v realnem svetu.
Razdelitev kriterijev
- Ocena in rangiranje agentov
- Simulirani pogovori in upravljanje scenarijev
- Integracija in iskanje po bazi znanja
- Globalno upravljanje pozivov za kompleksne situacije
- Analitika in orodja za optimizacijo

Inspeq AI
Podjetniška platforma za operacijsko uresničevanje Odgovornega AI v generativnih AI aplikacijah.
Inspeq AI organizacijam pomaga premikati odgovorno umetno inteligenco iz dokumentov politike v vsakodnevno inženirsko prakso. Platforma nudi orodja za ocenjevanje, spremljanje in upravljanje generativnih AI aplikacij v celotnem življenjskem ciklu, s poudarkom na merljivih kazalnikih kakovosti, varnosti in skladnosti. Ekipa lahko izvaja avtomatizirane ocene na izhodih LLM, spremlja težave, kot so halucinacije, pristranskost, toksicitet in tveganja prompt injection, ter vgrajuje preverjanja v razvojne in proizvodne tokove. Nadzorne plošče in funkcije poročanja so zasnovane tako, da tehničnim ekipam, uradnikom za tveganja in poslovnim deležnikom nudijo skupen pogled na obnašanje modela. Usmerjen je predvsem na podjetja, ki gradijo GenAI izdelke, usmerjene v stranke ali regulirane, ki potrebujejo dosledno nadzorovanje in auditabilnost.
Razdelitev kriterijev
- Samodejno ocenjevanje izhodov LLM
- Meritve za pristranskost, toksičnost in halucinacije
- Spremljanje promptov in odgovorov
- Poročanje o upravljanju in skladnosti
- Pipeline in API integracije
- Pulpiti za tehnične in tveganjske ekipe


Maxim AI je razvojna platforma, zasnovana za pomoč ekipam pri ustvarjanju zanesljivih AI agentov in LLM aplikacij. Združuje prompt engineering, evaluation, observability in dataset management, tako da lahko ekipe hitro iterirajo, hkrati pa ohranjajo merljivo kakovost. Platforma podpira avtomatizirane in človeške ocene prek več modelov in pozivov, kar inženirjem omogoča primerjavo izhodov, zaznavanje regresij in sledenje napakam v produkciji. Zasnovana je za medfunkcijsko sodelovanje, z delovnimi tokovi, ki omogočajo tako tehničnim kot netehničnim deležnikom, da prispevajo k testiranju in pregledu. Maxim se običajno uporablja s strani ekip, ki gradijo klepetalne bote, kopilote, glasovne agente in večstopenjske agentne delovne tokove, ki potrebujejo dosledno učinkovitost pri spreminjajočih se pozivih, modelih in vnosih uporabnikov.
Razdelitev kriterijev
- Igralnica za prompt in različice
- Samodejno ocenjevanje agentov in LLM-jev
- Opazovanje in sledenje v produkciji
- Urejanje in upravljanje podatkovnih nizov
- Človeški pregled in delovni tokovi za anotacije
- Podpora za več modelov in več ponudnikov

Temperstack
Platforma z AI za zanesljivost, ki avtomatizira spremljanje, opozarjanje in upravljanje incidentov po celih skladih opazovanja.

Temperstack je platforma za zanesljivostni inženiring, ki uporablja AI za združevanje nadzora, opozoril in odziva na incidente preko orodij, ki jih ekipe že uporabljajo. Namesto da bi nadomestila obstoječe observability stacks, se nanje nadgrajuje, da odkrije pomanjkljivosti v pokritosti, generira smiselna opozorila in poenostavi, kako ekipe na obvezni službi reagirajo na težave. Platforma pomaga ekipam SRE in DevOps pri zmanjševanju utrujenosti zaradi opozoril, skrajšanju povprečnega časa reševanja ter ohranjanju doslednih standardov zanesljivosti med storitvami. S avtomatizacijo rutinskih opravil, kot so konfiguracija opozoril, izvajanje runbooka in analiza po incidentu, Temperstack omogoča inženirjem, da se osredotočijo na delo z višjo vrednostjo zanesljivosti.
Razdelitev kriterijev
- AI-omodelirano nastavljanje opozoril
- Upravljanje incidentov med različnimi orodji
- Avtomatizirano pregledovanje nadzora
- Avtomatizacija runbookov
- Poročanje in analitika po incidentih
- Integracije z glavnimi platformami za opazovanje

Arize AI
Platforma za opazovanje AI in ocenjevanje LLM, ki pomaga razvijalcem AI in podatkovnim znanstvenikom pri spremljanju, odpravljanju težav in izboljševanju zmogljivosti…

Arize AI je platforma za vidnost AI in ugotavljanje vrednosti LLM-a. Pomagajo AI razvijalcem in podatkovnim znanstvenikom pri spremljanju, razbremenjevalu in izboljšanju učinkovitosti njihovih modelov AI. Platforma ponuja orodja za identifikacijo težav in priporočanj priporočljivih rešitev, pomagajo uporabnikom izboljšati točnost in zanesljivost svojih modelov. Arize AI je zasnovan za AI razvijalce in podatkovne znanstvenike, ki morajo optimizirati učinkovitost svojih modelov. Orodja platforme vključujejo spremljanje in razbremenjevanje težav, kar uporabnikom omogoča hitro identifikacijo in rešitev težav. Arize AI tudi podaja značilnosti za ocenjevanje in izboljšanje učinkovitosti modelov, kar uporabnikom omogoča da se svoje modeli spreminjajo skozi čas. Z uporabo Arize AI se lahko uporabniki zagotovijo, da se njihove AI modeli uresničujejo v optimalni učinkovitosti, kar vodi do boljšega odločanjskega izida in izidov. Fokus platforme na vidnost in ocenjevanje ga razlikuje od drugih orodij za razvoj AI, kar ga predstavlja kot cenni vir za tiste, ki delajo z velikimi jezikovnimi modeli in drugimi zelo kompleksnimi sistemami AI.
Razdelitev kriterijev
- Pregledovanje modelov AI
- Razbiranje in reševanje težav
- Generiranje predlogov popravilk
- Ocena izvedljivosti modelov
- Pregled in optimizacija LLM
- Ocena izvedljivosti in optimizacija modelov

Weave
Gradnik AI delovnih tokov brez kode, ki podjetjem omogoča avtomatizacijo operacij z integracijo več velikih jezikovnih modelov (LLM) in povezovanjem zahtevkov na tekoči način.

W&B Weave je platforma za opazljivost in ocenjevanje, ki pomaga slediti in izboljševati aplikacije z velikimi jezikovnimi modeli (LLM). Weave ponuja orodja za sledenje, zbiranje metrik in ocenjevanje odzivov aplikacije z uporabo LLM sodnikov in prilagojenih ocenjevalnikov. Ključne funkcije vključujejo sledenje sej, klice LLM in klice orodij ter ročno instrumentiranje prilagojenih agentov. Platforma podpira integracije s priljubljenimi SDK-ji in harnessi ter omogoča prilagojeno opazljivost agentov. Weave zagotavlja knjižnice za Python in TypeScript za namestitev in uporabo platforme. Gostuje na Weights & Biases (W&B), zato zahteva račun W&B in API ključ za avtentikacijo. Uporabniki lahko sledijo klicom na LLM-je, pregledujejo vnose in izhode ter prikazujejo metrike agentov v Weave UI. Medtem ko Weave olajša avtomatizacijo in ocenjevanje aplikacij LLM, ni graditelj AI delovnih tokov brez kode, kot bi to nakazoval njegovo ime.
Razdelitev kriterijev
- Sledenje agentov in zbiranje meritev
- Prilagojeno opazovanje agentov
- Sledenje in ocenjevanje LLM
- Podpora OpenTelemetry spanov
- Integracije z Weights & Biases (W&B)
- Python in TypeScript knjižnice








