Tidligere kamp · 2026-07-24 UTC
Observability Oppgjør — 24. juli 2026
Fra kategorien Observability. 21 merker plassert på tvers av 9 kjempere. Coval (YC S24) tok kronen.
Endelige plasseringer
Oppstillingen
Kjemperne
Profiler av hvert verktøy som konkurrerte i denne kampen, rangert etter sin endelige poengsum.

Coval (YC S24)
Plattform for simulering og evaluering for å testet stemme- og chatteagenter på størst mulig skala.

Coval er en utviklerplattform bygd for å simulere, test og evaluere artificielle agenter før de når produksjon. Den tillater teams å kjøre tusener av syntetiske samtaler mot deres tale eller chatt-agenter, og måle hvordan de håndterer kanttilfeller, forstørringer, integrasjonskall og multi-snar-måltal. Med støtte fra Y Combinator (S24), stiller Coval seg frem som en 'selvstofførte biler-tilnærming' til agentavhengighet, ved å anvende omhu fullførte simulering-baserte tester for konversasjonal AI. Ingenører kan definere scenarier, spille opp produksjons-trafikk, rangere utganger mot kustom metrikker og følge tilbakefall gjennom agent-versjoner. Plattformen rikter seg mot lag som leverer kundrettede agenter i support, salg og drift, hvor reliabilitet og konsekvens er kritisk for samsvisningen.
Kriteriumfordeling
- Simulering av store sammenhenger
- Prøving av stemmegenerator med realistisk dialøg
- Tilsyn med egenskaper og rangering
- Egen tracking av regressjoner over agentversjoner
- Generering av scenarioer og edge-case
- Omspill av produksjonsstrøm

Fiddler AI
AI-observasjons- og sikkerhetsplattform for overvåking, forklaring og styring av ML- og LLM-applikasjoner.

Fiddler AI er en bedriftsplattform som hjelper team med å overvåke, analysere og sikre maskinlæringsmodeller og generativ AI‑applikasjoner i produksjon. Den gir synlighet i modellens ytelse, datadrift, skjevhet og kvalitetsproblemer, samtidig som den tilbyr sikring mot risikoer som er spesifikke for LLM‑er, som hallusinasjoner, prompt‑injeksjon og usikre resultater. Designet for ML‑ingeniører, datavitere og risiko‑ og compliance‑team, Fiddler kombinerer forklarbarhet, sanntidsovervåkning og sikkerhetsmekanismer i en enkelt arbeidsflyt. Den integreres med vanlige ML‑pipelines og sky‑miljøer, og hjelper organisasjoner med å operasjonalisere ansvarlige AI‑praksiser i stor skala.
Kriteriumfordeling
- Overvåking av modellens ytelse og drift
- Deteksjon av LLM-hallusinasjoner og sikkerhet
- Beskyttelse mot promptinjeksjon og jailbreak
- Forklarbar AI og rotårsaksanalyse
- Vurdering av bias og rettferdighet
- Dashbord og varsler for produksjons-AI

Future AGI
En plattform som forbedrer AI-nøyaktighet gjennom omfattende evaluerings- og optimaliseringsverktøy.

Future AGI er en plattform som forbedrer AI‑nøyaktighet gjennom omfattende evaluerings‑ og optimaliseringsverktøy. Den gjør det mulig for brukere å bygge selvforbedrende agenter, fange opp hva som går galt, og forstå hvorfor. Plattformen tilbyr en rekke funksjoner, inkludert agent‑evaluering, optimalisering og simulerte samtaler. Brukere kan lage og administrere scenarier, og plattformen gir analyser og optimaliseringsverktøy for å forbedre agentens ytelse. Future AGI ser ut til å rette seg mot utviklere og bedrifter som ønsker å distribuere AI-drevne chatboter og agenter. Det gjør det mulig for brukere å simulere samtaler, evaluere og optimalisere agentens ytelse, samt integrere med kunnskapsbaser. Plattformen fremstår som et verktøy for utviklere til å lage og finjustere AI-agenter, snarere enn et kunde‑rettet grensesnitt. Plattformen tilbyr funksjoner som agent-evaluering, simulerte samtaler og scenariostyring. Den lar brukere redigere og administrere prompts, legge til hentingssteg for kunnskapsbase-artikler, og integrere med globale prompts for håndtering av komplekse situasjoner. Selv om Future AGI tilbyr verdifulle funksjoner for AI‑utvikling og -optimalisering, har den også begrensninger. For eksempel baserer den seg på generell kunnskap og kan kreve ekstra steg for mer komplekse scenarier. I tillegg kan plattformens avhengighet av simulerte samtaler begrense evnen til å håndtere usikkerheter i den virkelige verden. Future AGI ser ut til å tilby et unikt sett med funksjoner for AI‑utvikling og optimalisering. Dens omfattende evaluerings‑ og optimaliseringsverktøy gjør det til en verdifull ressurs for utviklere som ønsker å finpusse AI‑agentene sine. Imidlertid kan det kreve ytterligere utvikling eller integrasjon for å håndtere mer komplekse scenarier og usikkerheter i den virkelige verden.
Kriteriumfordeling
- Evaluering og rangering av agenter
- Simulerte samtaler og scenariostyring
- Integrasjon og gjenhenting av kunnskapsbase
- Global prompt-håndtering for komplekse situasjoner
- Analyse- og optimaliseringsverktøy


På AI2AI-prosjektets nettsted kan brukere se sanntids samtaler mellom to AI‑agenter. For å starte en interaksjon må brukerne opprette to entiteter, tildele dem et prompt, kontekst, stemme og kjønn, og velge en språkmodell. Interaksjonen kan startes, lagres og deles med andre brukere på siden. Eksempler på interaksjoner er tilgjengelige og viser ulike scenarier, som flørt, sinne, nysgjerrighet og salgsargumenter. Nye brukere må registrere seg og får 1 USD i kreditt for å utforske plattformen. Prisene er basert på en per‑minutt‑rate, fra 0,01 USD per minutt.
Kriteriumfordeling
- Direktvis se AI‑til‑AI‑dialog
- To distinkte AI‑objekter i samtale
- Observasjonell, håndløs brukeropplevelse
- Utstillende emergent AI‑atferd
- Tilgjengelig nettleserbasert grensesnitt

Arize AI
En AI-tilsyns- og LLM-evaluering plattform som hjelper AI-utviklere og dataforskere med å overvåke, feilsøke og forbedre ytelsen…

Arize AI er et plattform for kunstig intuisjon og evaluate løftende kunstig intelligens. Det bistår med å overvåke, løse feil, og forbedre ytelser på deres AI-modeller. Plattformen tilbyr verktøy for å identifisere problemer og foreslå tilpasninger, som hjelper brukerne forbedre nøyaktigheten og påliteligheten til deres modeller. Arize AI er designet for AI-utviklere og datavitenskapere som trenger å forbedre ytelser på deres modeller. Plattformens muligheter inkluderer overvåking og løsing av problemstillinger, som gjør det mulig for brukerne å raskt identifisere og håndhele problemstillinger. Arize AI tilbyr også funksjoner for evaluate og forbedre modell-ytelser, slik at brukerne kan finne på bedre måter over tid. Ved å bruke Arize AI, kan brukerne sikre at deres AI-modeller fungerer på topp ytelser, noe som kommer til å gi bedre beslutninger og utfall. Plattformens fokus på observabilitet og evaluate setter det fra andre AI-utviklingsverktøy, og gjør det til en viktig ressurs for dem som arbeider med løftende språkmøller og andre komplekse AI-systemer.
Kriteriumfordeling
- Overvåking av AI-modeller
- Problemlokalisering og feilhåndtering
- Generering av foreslåtte løsninger
- Evaluering av modell ytelse
- Vurdering og optimalisering av LLM

Edwin AI
AI-agent for IT-drift som gjør oppdagelse, triage og løsning av hendelser raskere.

Edwin AI er en AI-agent for IT-drift designet for å øke hastigheten på hendelsesdeteksjon, triage og løsning. Den gir en sentralisert plattform for IT-team å undersøke hendelser, forstå deres påvirkning, finne eller generere løsninger, og anvende dem på tvers av eksisterende verktøy uten å måtte bytte mellom systemer. Edwin AI korrelerer alarmer, identifiserer rotårsaker og igangsetter utbedring automatisk, fra den første alarmen til verifisert løsning. Den bruker historiske mønstre og observability‑data for å forutsi og forhindre driftsavbrudd. Verktøyet integreres med over 3 000 verktøy innen observability, APM, sikkerhet og CMDB, og gir sanntids, handlingsbare innsikter og eliminerer siloer. En Forrester‑studie fant at Edwin AI leverte 313 % ROI for en sammensatt organisasjon, med en tilbakebetalingsperiode på 6 måneder eller mindre.
Kriteriumfordeling
- Korrelering av varsler og reduksjon av støy
- AI-drevne forslag til rotårsaker
- Oppsummeringer av hendelser på naturlig språk
- Integrasjoner med ITSM- og observabilitetsplattformer
- Automatiserte triage-arbeidsflyter
- Kunnskapsberikelse fra tidligere hendelser


FoundryAI er en utviklingsplattform som fokuserer på å skape AI-agenter som håndterer reelle forretningsarbeidsflyter. Den kombinerer verktøy for agentdesign, testing og kontinuerlig forbedring, slik at team kan gå fra prototype til produksjon uten å måtte sy sammen separate systemer. Plattformen legger vekt på evaluering, og gir utviklere muligheter til å måle agentens ytelse mot definerte oppgaver og finjustere oppførselen over tid. Dette gjør den egnet for organisasjoner som automatiserer kundesupport, interne operasjoner eller repeterende kunnskapsarbeid hvor pålitelighet er viktig. FoundryAI retter seg mot tekniske team som trenger mer kontroll enn det no‑code‑byggere tilbyr, men som ønsker raskere iterasjon enn å bygge agenter helt fra bunnen av.
Kriteriumfordeling
- Miljø for bygging av agenter
- Evaluerings‑ og testverktøy
- Ytelsesovervåking
- Støtte for arbeidsflytautomatisering
- Iterative forbedringssløyfer
- Integrasjon med forretningssystemer
Helicone AI
Alt-i-ett observabilitetsplattform for å overvåke, feilsøke og forbedre produksjons‑LLM‑apper.
Helicone AI er en utviklerfokusert observabilitetsplattform bygget spesielt for applikasjoner drevet av store språkmodeller. Den fanger opp forespørsler, responser, kostnader og latens på tvers av leverandører, og gir ingeniørteam en samlet oversikt over hvordan LLM‑funksjonene deres oppfører seg i produksjon. Utover logging tilbyr Helicone verktøy for feilsøking av prompts, sporing av flerstegs agentarbeidsflyter, kjøring av evalueringer og sporing av bruk på brukernivå. Team kan identifisere regresjoner, kontrollere kostnader og iterere på prompts med data i stedet for gjetting. Den integreres med populære modellleverandører og rammeverk via en lettvektig proxy eller asynkron logging, noe som gjør det enkelt å legge til i eksisterende stacker uten større kodeendringer.
Kriteriumfordeling
- Logging av forespørsler og svar
- Sporing av kostnader og token‑bruk
- Håndtering og versjonering av prompts
- Sporing av agenter og økter
- Egendefinerte evalueringer og dashbord
- Analyser av brukere og hastighetsbegrensninger

llm scout
Overvåk hvordan ditt merke vises på tvers av ChatGPT, Claude, Perplexity og Google AI Overviews.

LLM Scout er et verktøy for merkevareovervåking bygget for generativ søkets tidsalder. Det sporer hvordan selskapet ditt, produktene dine og konkurrentene blir nevnt på tvers av store AI‑assistenter og svarmotorer, og gir markedsførings- og SEO‑teamet innsikt i en kanal som tradisjonelle analyseverktøy overser. Plattformen kjører gjentakende forespørsler mot systemer som ChatGPT, Claude, Perplexity og Googles AI Overviews, og rapporterer deretter om andel av stemmen, stemning, kilde til sitering og endringer over tid. Team kan bruke disse innsiktene for å finjustere innholdsstrategi, identifisere hull der konkurrentene anbefales i stedet, og måle effekten av optimaliseringstiltak rettet mot store språkmodeller.
Kriteriumfordeling
- Spor av merke- og konkurrentomtale
- Overvåkning på tvers av ChatGPT, Claude, Perplexity og AI Overviews
- Analyse av sentiment og share of voice
- Synlighet for sitater og kilder
- Spor av tilpassede prompt
- Rapportering av historiske trender







