Mennyt taisto · 2025-12-21 UTC
Observability Yhteenotto — 21. joulukuuta 2025
Kategoriasta Observability. 39 merkkiä asetettu 10 taistelijan kesken. AI2AI project otti kruunun.
Lopulliset sijoitukset
Kokoonpano
Taistelijat
Profiilit jokaisesta työkalusta, joka kilpaili tässä taistossa, järjestettynä lopullisen pistemääränsä mukaan.


AI2AI-projektilta käyttäjien voi tarkastella tarkasta aikaa kahden AI-agentin välisiä keskusteluja. Aloittamaan interaktsiomaisen, käyttäjien täytyy luoda kaksi yksilöä, määritellä näille pääsykysymys, konteksti, ääni ja sukupuoli, sekä valita kielioppi. Keskustelusta on mahdollista aloittaa, tallentaa ja jakaa muille käyttäjille sivustolla. Erikoista käyttäjille tarjotaan esimerkikkiskeskusteluja, esittelemässä erilaisia skenaarioita kuten houkuttelu, vihainen, kyllästynyt, kiinnostunut sekä myyntipuheita. Uusille käyttäjille tarjotaan ilmainen ilmoittautumispalvelu, jossa saat 1 dollaria luottokorttiin tutustua palveluun. Laskutus perustuu yhteen minuutin maksamiseen, joka lähtee 1 sentistä minuuttia kohti.
Kriteerien jakautuminen
- Reaalajaistä AI-työhön katsomiskokemus
- Kaksi erikoista AI-yksilöä keskustellessaan
- Tarkkailtu, käytön käsittämätön käyttäjäkokemus
- Emergentejen AI-käyttäjäkäyttäytyminen esille tuo
- Käytettävissä selaimessa tukea vastava
- sivun peruste
Confident AI
LLM-arvioinnin alustalle rakennettu tarkistus- ja havaintoalusta aiheuttaa AI-sovellusten testauksen, valvontan ja parantamisen.

Confident AI on kehitys- ja havaitsevyöhykealusta ryhmille, jotka kehittävät suuriakin kielenmallien sovelluksia. Sen taustalla on avoimen lähdekoodisen DeepEval-rahastoliikennepaikan, joka tarjoaa kehyksen ajaa benchmarkejä, regressiotestejä sekä laatusihtymishallinnan kaikkia promppeja, malleja ja palautusreittien yhtenä työtilana. Ohjelmistopalvelu auttaa insinöörejä havaitsemaan harhalauseita, promptien tylsennyksiä sekä haisteluhäiriöitä lähettämättä näitä tuotteita markkinoille, samalla se tarjoaa tuotannonvalvontaominaisuuksia kartoittaakseen todelliset käyttäjäkohteet. Joukkoja voidaan keskittää tietokannat, jakaa testitulokset ja kehittää kutsuja takuuttomalla feedbackin varassa eikä arvailuissa. Se on suunniteltu ohjelmistokehittäjille, ML-insinööreille ja laadunvarmistusjoukoille, jotka haluavat mittareiden perässä toimivan, strukturoituneen lähestyksensä kevytkieli-LM- laadunvarmistukseen sijaan epätarkoituksellisesti manuaalisen tarkistuksen sijaan.
Kriteerien jakautuminen
- Tietoarvo-pyritys DeepEval -arviointimitojen tuella
- Pulmatestaus kohteenaan prompseja ja malliopasteita
- RAG- ja käsittelyarviointi
- Tuotantovalvontaan liittyvä seuranta
- Datan ja kohdejärjestelmän hallinta
- Tiedostojen ja tulosyksiköiden yhteistyön parissa arviointituloksien osalta

KeywordsAI
Yhdistetty kehittäjien alusta LLM-sovellusten luomiseen, seuraamiseen ja mittakaavaan

KeywordsAI on kehittäjäkeskeinen alusta, joka kokoaa yhteen tarvittavat työkalut tuotantovalmiiden LLM-sovellusten toimittamiseksi. Se tarjoaa yhdenmukaisen API-portaan useiden mallintojen tarjoajien käyttöön, sekä sisäänrakennetut havainnointi-, lokitus- ja arviointiominaisuudet, joilla tiimit voivat ymmärtää, miten heidän AI-ominaisuutensa toimivat oikeassa maailmassa. Alusta on suunniteltu vähentämään LLM-pohjaisten tuotteiden toiminnan ylläpitokustannuksia. Kehittäjät voivat seurata viivettä ja kustannuksia, debugata syötteitä, suorittaa arvioita ja hallita syöteversioita ilman erillisten työkalujen yhdistämistä. Tämä tekee siitä helpomman insinööritiimille kehittää tehokkaasti uusia AI-ominaisuuksia ja ylläpitää luotettavuutta käytön laajentuessa.
Kriteerien jakautuminen
- Yhdistetty LLM-portaali eri tarjoajien yli
- Pyyntöloki ja jäljitys
- Kustannus- ja viiveen seuranta
- Promptin kokeilu ja versiohallinta
- Arviointi- ja testausvirrat
- SDK:t ja API-integraatiot

Edwin AI
Tietotekniikkayhteyksien automaattinen agentti, joka nopeuttaa tapahtumien havaitsemisen, luokittelun ja ratkaisun.

Edwin AI on AI-kenraali IT-palvelujen toiminnalle suunniteltu, joka nopeuttaa tapahtumien havaitsemista, luokittelua ja ratkaisua. Se tarjoaa keskitetyn tasohyryksen IT-ryhmiin tapahtumaan tutkimiseksi, sen vaikutuksen ymmärtämiseksi, ratkaisujen löytämiseksi tai luomiseksi sekä niiden soveltamiseksi jo olemassa oleviin työkaluihin ilman vaihtamista. Edwin AI yhdistää ilmoituksia, tunnistaa juurikortit ja aloittaa automaattisen oikosulun ensimmäisen ilmoituksen kautta todettuun loppumiseen asti. Sen avulla voidaan pelkistää tulevia rahoitusvaikeuksia ja ennustaa ja ehkäistä laskennallisia ongelmatilanteita. Edwin AI integroidaan yli 3 000 työkalua valvontatekojen, APM, turvallisuuden ja CMDB-alueiden rajojen yli, mahdollistaen reaaliajassa toimivia päätöksenteon pohjaksi olevia tietoja ja estää silon muodostumisen. Forrester-yhtiön tutkimus löysi, että Edwin AI:llä oli 313 prosentin tuottavuuden kasvu yhteiskunnan yksikössä suhteessa investoituun rahoitukseen, joka antoi voiton palautuneen kuukaudessa tai sitä vähemmän.
Kriteerien jakautuminen
- Sähköisen tiedon yhdistäminen ja vihjeiden vähentäminen
- AI-yhdistämien aiheudenmukaisten syiden suositukset
- Luonnollinen kieli tapahtumien yhteenveto
- Integraatioita ITSM- ja havaintoalustoille
- Automatisoitu luokittelurutiinit
- Aikaisempien tapahtumien koulutus tietämys

Future AGI
Ohjelma parantaa AI-tarkkuutta tarkasta evaluoinnista ja kokonaisuuden optimointitoimenpiteistä.

Future AGI on alusta, joka parantaa AI-tiedon precisiota laajalla arvioinnin ja optimointiin liittyvällä toiminalla. Se sallii käyttäjiin rakentaa itseparantavia agentteja, havaita mikä epäonnistuu ja tiedättekää miksi. Alusta tarjoaa valikoitua toimintoja, kuten agentin arviointia, optimointia ja simuloituja keskusteluja. Käyttäjät voivat luoda ja hallita skenaarioita, ja alusta tarjoaa analytiikkaa ja optimointitoimintoja agentin suorituskyvyn parantamiseksi. Future AGI näkee olevan suunniteltu kehittäjiä ja liikeyrityksiä varten, jotka haluavat lähettää AI-voittoisia chatti-robottia ja agentteja. Se antaa käyttäjälle mahdollisuuden simuloituun keskusteluun, agentin suorituskyvyn arviointiin ja parantamiseen sekä tietokantajärjestelmien integroidun kanssa. Alustan näyttää siltä, että se on kehittäjille työkalu kehittää ja kehittää AI-agentteja, eikä asiakaspäällinen käyttöliittymä. Plattforma tarjoaa omia ominaisuuksia, kuten agenttien arviointi, simuloituja keskusteluja ja skenaarioiden hallinta. Se mahdollistaa käyttäjien muokkaamisen ja hallinnan pyyntöjen, lisäämisen tiedoteaskeleita tietokantasarjojen käyttämiselle tiedolla sekä yhdistämisen globaaliseen pyyntöön monimutkisten tilanteiden käsittelyyn. Vaikka Future AGI tarjoaa arvokkaita ominaisuuksia AI-kehitykselle ja optimoinnille, se myös sisältää rajoituksia. Esimerkiksi se perustuu yleiseen tiedostoon ja sen tarvitsee lieneä erillisiä askeleita vaikeampien skenaarioien käsittelystä. Lisäksi laitteiston riippuvuus simulated käyttäytymisestä voi olla heikkoa kykyä käsittää todellisuuden epävarmuuksia. Tulevaisuuden AGI tarjoaa näppärän joukon ominaisuuksia AI-kehitykseksi ja optimointiin. Monipuoliset arviointi- ja optimointitoiminnot tekevät siitä arvokasta resurssin kehittelijöille, joiden tavoitteena on kehittää ja parantaa AI-agenttejaan. Kuitenkin se voi vaatia lisää kehitystyötä tai integroitumista, jotta se on selvinnyt monimutkaisemmista skenaarioista ja todellisen maailman epävarmuuksista.
Kriteerien jakautuminen
- Agenttejen arviointi ja luokittelu
- Simuloitujen keskustelujen ja tilanteiden hallinta
- Osaamistietokannan integraatio ja haku
- Maailmanlaajuinen ehdotusmecanismi monimutkaisten tilanteiden soveltamiseksi
- Tilastot ja optimointitoimet

Inspeq AI
Yritysalueen alusta vastuullisen tekoälynnäyttöön generatiivisissa tekoälysovelluksissa.
Inspeq AI auttaa organisaatioita siirtämään Vastuullisen Älykkään Toiminnan (Responsible AI) käytännöksi päivittäisestä insinöörintyöstä politiikkadokumenteista. Alusta tarjoaa työkaluja arvioida, seurata ja ohjata generatiivisten älykkäiden sovellusten kehitystä koko elinkaaren ajan, keskittyen mittausten laatuun, turvallisuuteen ja määräystenmukaisuusmittareihin. Tiimit voivat suorittaa automaattisia arvioita LLM-tulosteiden kanssa, seurata ongelmia kuten harhakuvia, puolueellisuutta, loukkaavuutta ja ohjausepäiltyjä riskejä, ja integroida tarkastukset kehitys- ja tuotantoputkiin. Ohjauspaneelit ja raportointiominaisuudet on suunniteltu antamaan teknisille tiimeille, riskienhallintavirkamiehille ja liiketoimintasidosryhmille yhteinen näkymä mallin käyttäytymisestä. Sen kohderyhmänä ovat ensisijaisesti yritykset, jotka kehittävät asiakaspalveluun tai sääntelyyn liittyviä GenAI-tuotteita, joista vaaditaan johdonmukaista valvontaa ja auditointikelpoisuutta.
Kriteerien jakautuminen
- Automaattinen LLM-tulosteen arviointi
- Mitattavuus puolueettomuudesta, myrkyllisyydestä ja hallusinaatioista
- Ohjepromptin ja vastausvastaanoton valvonta
- Hallinnon ja mukaisuuden raportointi
- Putken ja API-integraatiot
- Kojauspaneelit teknisille ja riskitiimille


Maxim AI on kehittäjille suunnattu kehitysympäristö, jonka avulla tiimit voivat lähettää luotettavia AI-agentteja ja LLM-sovelluksia. Se tuo yhteen palkkauksen suunnittelu, arviointi, näkyvyys ja tietokannan hallinta, jolloin tiimit voivat kehittyä nopeasti pidemmäksi aikaa säilyttäen laadun mitattavissa. Plattformi tukee automatisoituja ja ihmisten tekemiä arvioita useilla mallilla ja aloitteilla, jolloin insinöörit voivat vertailla tuloksia, havaita kääntyviä vihjeitä ja seurata epäonnistumisia tuotannossa. Se on suunniteltu monikansallisen yhteistyön mahdollistamiseksi, työvaiheilla voidaan myös tekniikan ja teknologian ulkopuoliset osapuolet osallistua testaukseen ja katsomiseen. Maxim on usein käytössä tiimien kanssa, jotka rakentavat dialogipuhelimen, kopilotin, äänikäyttöägen ja usean askeleen agenteita työskenteleville työryhmillä, jotka tarvitsevat vakautta suoriutumisessa muuttuviin kysymyksiin, malleihin ja käyttöjärjestelmien syötteisiin.
Kriteerien jakautuminen
- Kokeiluryhmä ja versioiden hallinta
- Automaattinen agentti- ja LLM-evaluaatio
- Tuotantotarkastelu ja jäljittäminen
- Tietokannan hoidollinen ja hallinnollinen käsittely
- Human-revisio- ja merkintätöiden työflökit
- Monimallinen ja monitoimintatuen tuet

Temperstack
AI-pohjainen luotettavuusalusta, joka automatisoi valvonnan, hälytysten ja tapahtumien hallinnan observability-pinojen yli.

Temperstack on luotettavuusjärjestelmätalusta, joka käyttää tekoälyä yhdistämään valvonnan, hälytykset ja tapahtumien käsittelyn tiimien jo käyttämien työkalujen yli. Sen sijaan, että korvaisi olemassa olevat havaintorakenteet, se kerää ne päälle tunnistaen katveet kattavuudessa, luo merkityksellisiä hälytyksiä ja tehostaen, kuinka on-call-tiimit vastaavat ongelmiin. Alusta auttaa SRE- ja DevOps-tiimejä vähentämään häiriöylätystä, lyhentämään keskimääräistä ratkaisuajan aikaa ja ylläpitämään johdonmukaisia luotettavuusstandardien tasoja palveluiden välillä. Automatisoimalla rutiinitehtäviä, kuten hälytyksen määrittelyä, runbookin suorittamista ja tapahtuman jälkeistä analyysia, Temperstack vapauttaa insinöörit keskittymään arvokkaampaan luotettavuustyöhön.
Kriteerien jakautuminen
- AI-avusteinen hälytysasetusten konfigurointi
- Työkalujen välinen tapahtumien hallinta
- Automaattiset valvontaeuditit
- Runbookin automatisointi
- Tapahtumien jälkeinen raportointi ja analyysi
- Integraatiot suurten observability-alustojen kanssa

Arize AI
Tutkimusaijien observability- ja LLM-tutkimusmuodin alustat, joissa autetaan AI-ohjelmistokehittäjiä ja datatieteilijöitä havaitsee, korjaavat ja parantavat suorituskykyä...

Arize AI on AI:n tulvaraportointi- ja LLM:n arviointipalvelu. Se auttaa AI:ää kehittäjiä ja tilastotieteilijöitä seuraamaan, ongelmien etsimisessä ja korjauksessa sekä parantaessa tietokoneenoppimismallien käytettävyyttä. Palvelun tarjotessa ratkaisuvinkkejä ja niistä käytettävän mallien tarkasti, käyttäjät parantavat tietokoneenoppimismalleja luotettavuutta heikentävien virheitän todennäköisyyttä. Arize AI on suunniteltu tietokoneenoppimisen kehittäjien ja tilastotieteilijöiden tarpeita vastaavan tietokonenoppimismallien suorituskykyyn. Palvelun sisällön kautta saatetaan seurata ja korjata ongelmia. Arize AI tarjoaa myös ominaisuuksia tietokonenoppimismallien suorituskyvyn arvioimiseksi ja parantamiseksi, mikä mahdollistaa käyttäjien mallien parantamisen ajan mukaisesti. Käyttämällä Arize AI:ää, käyttäjät voivat varmistaa siihen liittyvän tietokoneenoppimismallien olevan toiminta-ominaisuuksien suurimman mahdollisen mallin tasolla, mikä johtaa parempaan päätöksenteon toteutukseen ja tuloksiin. Palvelun painopiste tulvaraportoinnissa ja arviointiin antaa sen yksilöllistä puolta, mikä tekee Arize AI:stä arvokkaan resurssin niille työskenteleville, joilla on käytössään suuria suoria kieltämisen tarkoituksessa LLM-sukupolvesta.
Kriteerien jakautuminen
- Mallinennettä seuraaminen
- Ohjelmistovika- ja ongelman tunnistaminen
- Ehdotettujen korjausten luominen
- Mallin Kuntoarvion antaminen
- LLM-arvonnan arvioinnin ja optimoinnin tuki

Weave
No-code AI -työnkulunrakennus, joka mahdollistaa yrityksille operaatioiden automatisoinnin useiden suurten kielimallien (LLM) integroinnilla ja kehotteiden saumattomalla yhdistämisellä.

W&B Weave on havaintokyky- ja arviointialusta, joka auttaa seuraamaan ja parantamaan suurta kielimallia (LLM) käyttämää sovellusta. Weave tarjoaa työkaluja jäljittämiseen, mittareiden keräämiseen ja sovelluksen vastauksien arviointiin LLM-tuomarien ja kustomoitujen pisteytysten avulla. Keskeiset ominaisuudet sisältävät seurantajäljien, LLM-kutsujen ja työkalukutsujen seuraamisen sekä omakustomoitujen agenttien manuaalisen instrumentoinnin. Alusta tukee integraatioita suosittujen SDK-iden ja harnessien sekä räätälöidyn agentin havainnoinnin kanssa. Weave tarjoaa Python- ja TypeScript-kirjastot alustan asentamiseen ja käyttöön. Se on isännöity Weights & Biases (W&B) -palvelussa, ja vaatii W&B-tilin ja API-avaimen todennusprosessiin. Käyttäjät voivat jäljittää LLM-pyynnöt, tarkastella syötteitä ja tuloksia sekä nähdä agenttien mittarit Weave UI:ssä. Vaikka Weave helpottaa LLM-sovellusten automaatiota ja arviointia, se ei ole nimensä mukainen no-code AI workflow builder.
Kriteerien jakautuminen
- Agentin jäljitys ja mittauskeräys
- Mukautettu agentin havaittavuus
- LLM:n jäljitys ja arviointi
- OpenTelemetry-skenen tuki
- Weights & Biases (W&B) -integraatiot
- Python- ja TypeScript-kirjastot








