Mennyt taisto · 2025-06-03 UTC
Observability Yhteenotto — 3. kesäkuuta 2025
Kategoriasta Observability. 20 merkkiä asetettu 7 taistelijan kesken. Quotient AI otti kruunun.
Lopulliset sijoitukset
Kokoonpano
Taistelijat
Profiilit jokaisesta työkalusta, joka kilpaili tässä taistossa, järjestettynä lopullisen pistemääränsä mukaan.

Quotient AI
Omaa aikaista tietojen valvontaa ja arviointiplatemma, jossa voidaan havaita hakemuksilla ja RAG:llä tapahtuvat AI-vaikeudet.
Quotient AI on observability- ja arviointipalvelu, joka on suunniteltu tiimille, jotka lähettävät AI:llä varustettuja ominaisuuksia. Se jatkuu lähettämässä tuottoa AI-järjestelmiä, mukaan lukien etsintä, hakemisonnettomautuneiden geneeroinnin ja autonomisia agentteja, -kohdistamaan hallusinaatioita, hakemisonnettomuuksia, ja muita laatua koskevia ongelmia ennen kuin ne kohtaavat ne loppukäyttäjän. Ohjelmistopalvelu yhdistää automaattisia arvioita reaaliaikaisin varoituksin, auttaen ohjelmistokehitys- ja ML-tiimien määrittämään juurisyynnit, kartoittamaan takaiskuita mallien tai pyynnönmuutosten välillä, ja turvaten suhteen kestävyyttä. Käyttämällä tietokoneoppimisen (AI) prosesseja, Quotient antaa kehittäjille näkemystä siitä, miten heidän sovelluksensa käyttäytyvät todellisessa kokeiluolosuhteissa, eikä vain luottaen kokeellisiin offline-benchmarkteihin.
Kriteerien jakautuminen
- Toiminnoissa tapahtuvan järjestelmän suorituskyvyn katsastus ja varoitus
- Hallusinaatioiden ja palautuksen virheiden havaitseminen
- Arviointitoimenpiteet RAG-potkuihin
- Agenttien käyttäytymisen seuranta ja diagnosointi
- Muunnelmananalyysi mallin ja pyyntömuutosten kohdalla
- Tuotantomuistiinpanot AI-sovelluksille

Arize AI
Tutkimusaijien observability- ja LLM-tutkimusmuodin alustat, joissa autetaan AI-ohjelmistokehittäjiä ja datatieteilijöitä havaitsee, korjaavat ja parantavat suorituskykyä...

Arize AI on AI:n tulvaraportointi- ja LLM:n arviointipalvelu. Se auttaa AI:ää kehittäjiä ja tilastotieteilijöitä seuraamaan, ongelmien etsimisessä ja korjauksessa sekä parantaessa tietokoneenoppimismallien käytettävyyttä. Palvelun tarjotessa ratkaisuvinkkejä ja niistä käytettävän mallien tarkasti, käyttäjät parantavat tietokoneenoppimismalleja luotettavuutta heikentävien virheitän todennäköisyyttä. Arize AI on suunniteltu tietokoneenoppimisen kehittäjien ja tilastotieteilijöiden tarpeita vastaavan tietokonenoppimismallien suorituskykyyn. Palvelun sisällön kautta saatetaan seurata ja korjata ongelmia. Arize AI tarjoaa myös ominaisuuksia tietokonenoppimismallien suorituskyvyn arvioimiseksi ja parantamiseksi, mikä mahdollistaa käyttäjien mallien parantamisen ajan mukaisesti. Käyttämällä Arize AI:ää, käyttäjät voivat varmistaa siihen liittyvän tietokoneenoppimismallien olevan toiminta-ominaisuuksien suurimman mahdollisen mallin tasolla, mikä johtaa parempaan päätöksenteon toteutukseen ja tuloksiin. Palvelun painopiste tulvaraportoinnissa ja arviointiin antaa sen yksilöllistä puolta, mikä tekee Arize AI:stä arvokkaan resurssin niille työskenteleville, joilla on käytössään suuria suoria kieltämisen tarkoituksessa LLM-sukupolvesta.
Kriteerien jakautuminen
- Mallinennettä seuraaminen
- Ohjelmistovika- ja ongelman tunnistaminen
- Ehdotettujen korjausten luominen
- Mallin Kuntoarvion antaminen
- LLM-arvonnan arvioinnin ja optimoinnin tuki


FoundryAI on kehitysympaikka, joka keskittyy luomaan AI- agentteja jotka hoitavat todellisia liiketoimintakäytäntöjä. Tämä integroidaan agenteiden suunnitteluun, testaamiseen ja jatkuvaan kehittämiseen työkaluiksi, jotta ryhmät voi siirtyä prototyypistä tuotantokelpoiseen ilman eri järjestelmien kasaamista yhteen. Alusta korostaa arviointia antaen rakentajille keinoja mittaamiseen agentin suorituskykyä tarkoituksenmukaisiin tehtäviin ja kierreiden yhdistämistä ajan kuluessa. Tämä tekee siitä soveltuvan organisaatioille, jotka automatisoivat asiakaspalvelua, sisäisiä operaatioita tai toistuvaa tietoa, joissa luotettavuus on tärkeää. Foundry AI kohdistuu teknisten joukkueiden kohteeksi, jotka tarvitsevat enemmän hallitusta no-code rakentajien tarjoamasta kuin ovat halukkaita tekemään agentit kokonaan alusta alkaen puhtaasti käsin.
Kriteerien jakautuminen
- Agenttien rakennussyvyys
- Tarkasteluiden ja testausten toolsi
- Suorituskyky-ylläpitosäännöt
- Työvälitystuki suorituskyvylle
- Iteratiivisen parantamisperäisin
- Liiketoiminnan järjestelmiin integraatio
Helicone AI
Yhden neuvonnan määrän observabiliteettiplatvormi, jotta näkee, korjaat ja kehityt tuotantotietoja LLM ohjelmiasi.
Helicone AI on soveltajille tarkoitettu observabiliteetti-alusta, joka on suunniteltu erityisesti suurten kielioppien tukiavaimella toimiviin sovelluksiin. Se on suunniteltu ottamaan vastaan pyynnöt, vastaukset, kustannukset ja latency sekä eri palveluntarjoajilta, tarjoamalla ohjelmistokehityksessä käytävien tehtävien kokonaistarkastelun. Helicone tarjoaa loggaamisen lisäksi työkaluja kelpoisuuden arviointiin, useamman vaiheen agenttitoimintojen jäljentämiseen, arviointien ajamiseen ja käyttäjäkohtaisen käyttön seurantaan. Ryhmät voivat tunnistaa käsittelymenetelmien heikentyneisyyttä, hallita kuluja ja kehittää kysymyksiä tiedoilla eikä satunnaisesti. Se integroi suosituimpiin mallien toimittajiin ja rajojen kehyksiin kautta kevyen proxy:n tai asynkronisen loggauksen kautta, tehdäksemme siitä helppoa lisätä niitä tarvitaessa olemassa oleviin kokoneuvoihin ilman merkittäviä koodimuutoksia.
Kriteerien jakautuminen
- Pyyntö ja vastaus muistiinpanot
- Kustannus ja token käyttöseuranta
- Prompttivakioinnin ja versionsuoritus
- Agentti ja sessio seuranta
- Mukautetut arviointitunnukset ja ikkunat
- Käyttäjä- ja rajoituselementti analytikot

KeywordsAI
Yhdistetty kehittäjien alusta LLM-sovellusten luomiseen, seuraamiseen ja mittakaavaan

KeywordsAI on kehittäjäkeskeinen alusta, joka kokoaa yhteen tarvittavat työkalut tuotantovalmiiden LLM-sovellusten toimittamiseksi. Se tarjoaa yhdenmukaisen API-portaan useiden mallintojen tarjoajien käyttöön, sekä sisäänrakennetut havainnointi-, lokitus- ja arviointiominaisuudet, joilla tiimit voivat ymmärtää, miten heidän AI-ominaisuutensa toimivat oikeassa maailmassa. Alusta on suunniteltu vähentämään LLM-pohjaisten tuotteiden toiminnan ylläpitokustannuksia. Kehittäjät voivat seurata viivettä ja kustannuksia, debugata syötteitä, suorittaa arvioita ja hallita syöteversioita ilman erillisten työkalujen yhdistämistä. Tämä tekee siitä helpomman insinööritiimille kehittää tehokkaasti uusia AI-ominaisuuksia ja ylläpitää luotettavuutta käytön laajentuessa.
Kriteerien jakautuminen
- Yhdistetty LLM-portaali eri tarjoajien yli
- Pyyntöloki ja jäljitys
- Kustannus- ja viiveen seuranta
- Promptin kokeilu ja versiohallinta
- Arviointi- ja testausvirrat
- SDK:t ja API-integraatiot
Relari (YC W24)
Todennäköisyyksien testaus, arviointi sekä tietynäytteen generaatioalusta AI-agentitien parissa.

Relari on kehittäjille suunnattu alusta, joka pyrkii parantamaan AI-agenttien uskottavuutta systemaattisilla testaamislla ja arvioinnilla. Se auttaa ryhmiä lisiittämään synoteettisia tietolähdeviipereitä, ajaa automaatisia arvioituksia ja arvioi agentin suorituskykyä realistisissa tilanteissa ennen kuin agentti lähetetään tuotantoon. Relari on yhtiö, jonka taustaa on Y Combinator (W24). Sen tavoitteena ovat insinööriteemat, jotka kehittävät monimutkaisia LLM-sovelluksia ja monivaiheisia agentteja, joissa perinteinen testaus ei ole riittävä. Sen työkalut ovat tarkoitettu toistamaan ohjelmistokehittäjien tarkat käytännöt, ja sen ansiosta LLM-malleihin ja ei-deterministisiin järjestelmiin tulee yhä mittauksellisempaa mittaustoimia—kuten yksikkötestejä ja regressiotesttej—samalla kun saadaan käyttöön mittaamattomia mitta-asiakkaita. Sovellus tukee persoonallisia arviointijohtimia, kohdekäyttäytymisen simulatorointia sekä jatkuvaa valvontaa, mikä tekee siitä hyödyllistä sekä lähelle loppua kohdistuvien todennäköisyyksien ja laadun tarkastuksessa että on ajoitusjärjestelmien jatkuvaa laatuvarmenpidettä tukevassa käyttöönotossa.
Kriteerien jakautuminen
- Synthetinen datasetin generaatio
- Automatisoitu agenttien arviointiin liittyvä ketterät ketjut
- Skenaariokeskundet ja keskusteltavuuden simulointi
- Muokattavissa olevia arviointimetodeja
- Jälkikäteen testaus LLM-sovelluksille
- Suorituskykykokeet ja raportointi

llm scout
Seuraa, miten merkitseväsi esiin olet kaikissa ai-heikoissa palveluissa, kuten ChatGPT, Claude, Perplexity ja Google AI Overviews.

LLM-kirjanpitäjä on verkkokauppayrityskeskittymän työkalu, joka on suunniteltu generatiivisen hakukelpoisuuden aikakaudelle. Se seuraa, miten yritys, tuotteet ja kilpailijat on mainittu suurten tekoälyapuisten ja selkeän tekstimuotoisen hakukonetyökalujen mukaisesti, tarjoamalla mainostimien ja SEO-joukkonsa näkemystä kanavalta, jota perinteiset analytiikkaratkaisut eivät käy ilmi. Alusta suorittaa toistuvia kysymyksiä kuten ChatGPT, Claude, Perplexity ja Googlen AI Overviews -kytkimiin, ja raportoi äänitorvesta, tunteista, viittomääräihin sekä muutoksista ajan kanssa. Ryhmät voivat käyttää näitä havaintoja sisältöstrategian kohottamiseksi, vastaavien tiettyjen alueiden identifioimiseksi missä kilpailijat ehdotetaan, ja kokeilemaan, kuinka kääntyvät parantamisen toimenpiteet suurten kielioppien suhteen.
Kriteerien jakautuminen
- Merkeistä ja kilpailijamielipuoli seuraaminen
- Seuranta on ChatGPT, Claude, Perplexity, ja AI Overviews -palveluissa
- Sentimentin ja kilpailijoiden äänenosasanan analyysi
- Viittaus ja lähteen näkyvyys
- Mukautettu kysymysjonojen seuraaminen
- Historiallinen trendien raportointi




