Tidligere kamp · 2024-01-11 UTC
Observability Oppgjør — 11. januar 2024
Fra kategorien Observability. 40 merker plassert på tvers av 10 kjempere. Quotient AI tok kronen.
Endelige plasseringer
Oppstillingen
Kjemperne
Profiler av hvert verktøy som konkurrerte i denne kampen, rangert etter sin endelige poengsum.

Quotient AI
Sanntidsovervåknings- og evalueringsplattform for å oppdage AI-feil i søk, RAG og agenter.
Quotient AI er en observabilitets- og evalueringsplattform designet for team som leverer AI-drevne funksjoner. Den overvåker kontinuerlig produksjons‑AI‑systemer – inkludert søk, retrieval‑augmented generation (RAG) og autonome agenter – for å avdekke hallusinasjoner, feil ved henting og andre kvalitetsproblemer før sluttbrukerne opplever dem. Plattformen kombinerer automatiserte evalueringer med sanntidsvarsler, og hjelper ingeniør- og ML-team med å diagnostisere rotårsaker, spore regresjoner på tvers av modell- eller promptendringer, og opprettholde pålitelighet i skala. Ved å instrumentere AI-pipelines gir Quotient utviklere innsikt i hvordan deres applikasjoner faktisk oppfører seg i virkeligheten, i stedet for å stole kun på offline-benchmarks.
Kriteriumfordeling
- Sanntids AI-overvåkning og varsling
- Deteksjon av halusinasjoner og hentefeil
- Evalueringsverktøy for RAG-pipelines
- Sporing og diagnostisering av agentatferd
- Regressionanalyse på tvers av modell- og promptendringer
- Observabilitet i produksjon for AI-applikasjoner

Weave
En no-code arbeidsflytbygger for AI som gjør det mulig for bedrifter å automatisere drift ved å integrere flere store språkmodeller (LLMs) og forbinde spørsmål sammen som en ferdig tekst.

W&B Weave er en plattform for observabilitet og evaluering som hjelper til å spore og forbedre store språkmodeller (LLM) applikasjoner. Weave tilbyr verktøy for å følge spor, samle målinger og evaluere applikasjonsrespons ved hjelp av LLM-judger og anpassede scorere. Nyttige funktioner inkluderer sporinger av sesjoner, kall til LLM og verktøytilkall, samt manuell instrumentering av anpassede agenter. Plattformen støtter integreringer med populære SDKs og harnesser, samt personlig agentobservabilitet. Weave tilbyr Python- og TypeScript-biblioteker for å installere og bruke plattformen. Den er vertskap for Weights & Biases (W&B), og krever en W&B-konto og API-nøkkel for autentisering. Brukere kan følge opp kall til LLMer, vurdere inn- og utganger, samt se agent-metrikkene i Weave-grafisk brukerflate. Slik setter Weave i gang automatisering og vurdering av LLM-applikasjoner, selv om det ikke er en no-code AI-workflow- bygger som navnet foreslår.
Kriteriumfordeling
- Agentsporet og målinger samlet inn
- Personlig agentobservabilitet
- LLM-sporet og evaluering
- OpenTelemetry spennsupport
- Weights & Biases (W&B)-integreringer
- Python og TypeScript biblioteker

AgentOps er en utviklerplattform som fokuserer på livssyklusen til AI‑agenter, og tilbyr sporings-, overvåknings- og feilsøkingsverktøy som gjør det mulig å se hva agentene faktisk gjør ved kjøring. Plattformen registrerer LLM‑kall, verktøybruk, kostnader og feil, slik at team kan forstå agentatferden på tvers av komplekse flertrinnsarbeidsflyter. Utover synlighet tilbyr AgentOps sesjonsavspilling, ytelsesanalyse og integrasjoner med populære agentrammeverk som LangChain, CrewAI og AutoGen. Dette gjør det mulig for ingeniører å gå fra prototype til produksjon med målbar pålitelighet i stedet for å stole på gjetting eller logg-scraping. Det er rettet mot utviklere og team som leverer agentbaserte applikasjoner og som trenger å spore regresjoner, kontrollere utgifter, og bevise at agentene deres oppfører seg korrekt før og etter distribusjon.
Kriteriumfordeling
- Opptak og replay av agentøkter
- Sporing av LLM-tilkallinger og verktøybruk
- Kostnads- og tokenanalyse
- Feil- og feiledeteksjon
- Framework SDKer for Python og JavaScript
- Dashboards for agentytelsesmålinger
Confident AI
LLM‑evalueringsplattform bygget på DeepEval for testing, overvåking og forbedring av AI‑applikasjoner.

Confident AI er en evaluerings‑ og observasjonsplattform for team som bygger applikasjoner basert på store språkmodeller. Drevet av det åpen‑kildekode DeepEval‑rammeverket, gir den et samlet arbeidsområde for å kjøre benchmark, regresjonstester og kvalitetskontroller på tvers av prompt, modeller og retrieval‑pipelines. Plattformen hjelper ingeniører med å oppdage hallusinasjoner, prompt‑regresjoner og hentefeil før utrulling, samtidig som den tilbyr produksjonsmonitorering for å spore faktiske brukerinteraksjoner. Team kan sentralisere datasett, dele testresultater og iterere på prompts med målbar tilbakemelding i stedet for gjetting. Den er rettet mot utviklere, ML‑ingeniører og QA‑team som ønsker en strukturert, metrisk‑drevet tilnærming til LLM‑kvalitetssikring i stedet for ad‑hoc manuell gjennomgang.
Kriteriumfordeling
- DeepEval‑drevne evalueringsmetrikker
- Regresjonstesting for prompts og modeller
- RAG‑ og gjenfinningsevaluering
- Sporing og overvåking i produksjon
- Datasett‑ og testtilfelleadministrasjon
- Team‑samarbeid på evalueringsresultater

Fiddler AI
AI-observasjons- og sikkerhetsplattform for overvåking, forklaring og styring av ML- og LLM-applikasjoner.

Fiddler AI er en bedriftsplattform som hjelper team med å overvåke, analysere og sikre maskinlæringsmodeller og generativ AI‑applikasjoner i produksjon. Den gir synlighet i modellens ytelse, datadrift, skjevhet og kvalitetsproblemer, samtidig som den tilbyr sikring mot risikoer som er spesifikke for LLM‑er, som hallusinasjoner, prompt‑injeksjon og usikre resultater. Designet for ML‑ingeniører, datavitere og risiko‑ og compliance‑team, Fiddler kombinerer forklarbarhet, sanntidsovervåkning og sikkerhetsmekanismer i en enkelt arbeidsflyt. Den integreres med vanlige ML‑pipelines og sky‑miljøer, og hjelper organisasjoner med å operasjonalisere ansvarlige AI‑praksiser i stor skala.
Kriteriumfordeling
- Overvåking av modellens ytelse og drift
- Deteksjon av LLM-hallusinasjoner og sikkerhet
- Beskyttelse mot promptinjeksjon og jailbreak
- Forklarbar AI og rotårsaksanalyse
- Vurdering av bias og rettferdighet
- Dashbord og varsler for produksjons-AI


Portkey er en samlet kontrollplan for å bygge, administrere og overvåke AI-applikasjoner. Det gir en omfattende plattform for AI-team å gå til produksjon, med funksjoner som AI Gateway, Observability, Guardrails, Governance og Prompt Management. Plattformen gjør det mulig for brukere å få tilgang til over 1 600 LLM via en samlet API, noe som forenkler prosessen med å integrere modeller og gjør at team kan fokusere på å bygge i stedet for å administrere. Portkey tilbyr også sanntidsobservabilitet, slik at brukere kan overvåke LLM‑atferd, fange opp avvik tidlig og proaktivt håndtere bruk. I tillegg gir plattformen cache‑kapasitet, som har vist seg å spare brukere tusenvis av dollar ved å redusere overflødige tester. Portkey er designet for AI-team og støtter et bredt spekter av LLM‑er, med over 3 000 GenAI‑team og et stort antall tokens som behandles daglig.
Kriteriumfordeling
- AI-gateway med ruting for flere leverandører
- Prompt-håndtering og versjonering
- Forespørselslogger, spor og analyser
- Semantisk caching og gjenforsøk
- Guardrails for inn- og utdata-validering
- Dashboards for bruk og kostnadsovervåking
Relari (YC W24)
Testing, evaluering og syntetisk datagenereringsplattform for AI-agenter.

Relari er en utviklerplattform som fokuserer på å forbedre påliteligheten til AI-agenter gjennom systematisk testing og evaluering. Den hjelper team med å generere syntetiske datasett, kjøre automatiserte evalueringer og benchmarke agentens ytelse på realistiske scenarier før de rulles ut til produksjon. Støttet av Y Combinator (W24), retter Relari seg mot ingeniørteam som bygger komplekse LLM‑applikasjoner og multi‑step‑agenter der tradisjonell QA ikke er tilstrekkelig. Verktøyet har som mål å bringe programvareingeniørens disiplin—enhetstester, regresjonstester og målbare metrikker—til ikke‑deterministiske AI‑systemer. Plattformen støtter tilpassede evaluatører, scenario-simulering og kontinuerlig overvåking, noe som gjør den nyttig både for validering før lansering og for løpende kvalitetssikring av produksjonsagenter.
Kriteriumfordeling
- Generering av syntetiske datasett
- Automatiserte evalueringspipelines for agenter
- Simulering av scenarier og samtaler
- Tilpassbare evalueringsmetrikker
- Regresjonstesting for LLM-apper
- Ytelsestesting og rapportering

Arize AI
En AI-tilsyns- og LLM-evaluering plattform som hjelper AI-utviklere og dataforskere med å overvåke, feilsøke og forbedre ytelsen…

Arize AI er et plattform for kunstig intuisjon og evaluate løftende kunstig intelligens. Det bistår med å overvåke, løse feil, og forbedre ytelser på deres AI-modeller. Plattformen tilbyr verktøy for å identifisere problemer og foreslå tilpasninger, som hjelper brukerne forbedre nøyaktigheten og påliteligheten til deres modeller. Arize AI er designet for AI-utviklere og datavitenskapere som trenger å forbedre ytelser på deres modeller. Plattformens muligheter inkluderer overvåking og løsing av problemstillinger, som gjør det mulig for brukerne å raskt identifisere og håndhele problemstillinger. Arize AI tilbyr også funksjoner for evaluate og forbedre modell-ytelser, slik at brukerne kan finne på bedre måter over tid. Ved å bruke Arize AI, kan brukerne sikre at deres AI-modeller fungerer på topp ytelser, noe som kommer til å gi bedre beslutninger og utfall. Plattformens fokus på observabilitet og evaluate setter det fra andre AI-utviklingsverktøy, og gjør det til en viktig ressurs for dem som arbeider med løftende språkmøller og andre komplekse AI-systemer.
Kriteriumfordeling
- Overvåking av AI-modeller
- Problemlokalisering og feilhåndtering
- Generering av foreslåtte løsninger
- Evaluering av modell ytelse
- Vurdering og optimalisering av LLM

Edwin AI
AI-agent for IT-drift som gjør oppdagelse, triage og løsning av hendelser raskere.

Edwin AI er en AI-agent for IT-drift designet for å øke hastigheten på hendelsesdeteksjon, triage og løsning. Den gir en sentralisert plattform for IT-team å undersøke hendelser, forstå deres påvirkning, finne eller generere løsninger, og anvende dem på tvers av eksisterende verktøy uten å måtte bytte mellom systemer. Edwin AI korrelerer alarmer, identifiserer rotårsaker og igangsetter utbedring automatisk, fra den første alarmen til verifisert løsning. Den bruker historiske mønstre og observability‑data for å forutsi og forhindre driftsavbrudd. Verktøyet integreres med over 3 000 verktøy innen observability, APM, sikkerhet og CMDB, og gir sanntids, handlingsbare innsikter og eliminerer siloer. En Forrester‑studie fant at Edwin AI leverte 313 % ROI for en sammensatt organisasjon, med en tilbakebetalingsperiode på 6 måneder eller mindre.
Kriteriumfordeling
- Korrelering av varsler og reduksjon av støy
- AI-drevne forslag til rotårsaker
- Oppsummeringer av hendelser på naturlig språk
- Integrasjoner med ITSM- og observabilitetsplattformer
- Automatiserte triage-arbeidsflyter
- Kunnskapsberikelse fra tidligere hendelser


FoundryAI er en utviklingsplattform som fokuserer på å skape AI-agenter som håndterer reelle forretningsarbeidsflyter. Den kombinerer verktøy for agentdesign, testing og kontinuerlig forbedring, slik at team kan gå fra prototype til produksjon uten å måtte sy sammen separate systemer. Plattformen legger vekt på evaluering, og gir utviklere muligheter til å måle agentens ytelse mot definerte oppgaver og finjustere oppførselen over tid. Dette gjør den egnet for organisasjoner som automatiserer kundesupport, interne operasjoner eller repeterende kunnskapsarbeid hvor pålitelighet er viktig. FoundryAI retter seg mot tekniske team som trenger mer kontroll enn det no‑code‑byggere tilbyr, men som ønsker raskere iterasjon enn å bygge agenter helt fra bunnen av.
Kriteriumfordeling
- Miljø for bygging av agenter
- Evaluerings‑ og testverktøy
- Ytelsesovervåking
- Støtte for arbeidsflytautomatisering
- Iterative forbedringssløyfer
- Integrasjon med forretningssystemer






