Mennyt taisto · 2024-01-17 UTC

LLM Yhteenotto — 17. tammikuuta 2024

Kategoriasta LLM. 37 merkkiä asetettu 8 taistelijan kesken. ASI:One otti kruunun.

Lopulliset sijoitukset

Kokoonpano

Taistelijat

Profiilit jokaisesta työkalusta, joka kilpaili tässä taistossa, järjestettynä lopullisen pistemääränsä mukaan.

1ASI:One logo

ASI:One

Teoreettinen agenttigeni AI apuri, joka koordinoi itsenäisiä agentteja monivaiheisten tehtävien suorittamiseksi.

4.5 (4)
Ilmainen
ASI:One kuvakaappaus

ASI:One on AI-apuli, joka perustuu agenttigeni-käsitteeseen. Yksinkertaistetulla keskustelunäkymällä voivat käyttäjät lähettää ja koordinoi erikoistuneita itsenäisiä agentteja suhteellisen monimutkaisten pyynnöiden hoitamiseksi. Sen sijaan, että se palauttaisi vain tekstin, se voi suunnitella, käynnistää sovelluksia ja suorittaa työvirtauksia käyttäjän edustuksen puolella. ASI:One on rakennettu Artifisial Superintelligence Alliance-ekosysteemin yhteyteen. Se on sijoiteltu eräänä henkilökohtainen AI-agentti, joka integroidaan laajemmille itsenäisille agenttiverkostolle. Käyttäjät voivat keskustella sen kanssa yleisistä kysymyksistä tai siirtää lyhyitä tehtäviä, kuten tutkimuksia, vertailuja, aikatauluja ja hakemuksia yhdessä liitettyihin palveluihin.

Kriteerien jakautuminen

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Tiedottava keskustelunäyttö
  • Itsenäisten agenttien käytännön koordinaatiolaskentat
  • Monivaiheisten tehtävien suunnittelu ja suoritus
  • Yhdistelmä ulkoisen agenttien ja palveluiden kanssa
  • Persoonallinen muistinäyttö ja ympäristömuisti
  • ASI:Allianssin agenttirunko
2Gemini 2.0 Flash logo

Gemini 2.0 Flash

Googlen nopea, monimodaalinen AI-malli reaaliaikaisille agenttitehtäville 1M-token paksuudella kontekstissä

4.6 (5)
Ilmainen
Gemini 2.0 Flash kuvakaappaus

Gemini 2.0 Flash on seuraava sukupolvi, jonka Google DeepMind on suunnitellut nopeuteen, mittakaavuun ja monimodaaliseen ajatteluun soveltuvaksi. Se hyväksyy tekstin, kuvat, äänet ja videot syötteenä ja pystyy generoimaan tekstin, kuvat ja äänit, mikä tekee siitä soveltuvan monimutkaisille interaktiivisille sovelluksille. Mallin on suunniteltu agenteja ajattelevien työvilkaisuuksien mukaan, ja se tuki kotoisinollen sovelluskerroksen käyttämiselle, funktio- ja API-kutsuja sekä 1-miljoonan merkitsevän konsentraatiokentän käytölle suurten dokumenttien, koodipohjien, pitkiä tilaustausta tai pitkittäisten tilausten käsittelyssä. Vähäinen latency, joka tekee siitä käytännöllisen valinnan assisentteja koskevissa tehtävissä, tiukassa real-time -analyysissa tai tuotetason käyttöön. Teknologit voivat yhdistää Gemini 2.0 Flashin kautta Gemini-rajapintaan, Google- AIIudioon ja Vertex AI:hon, ja ohjelmistokehyksiä on saatavilla pääsatakäänkiä kielillä.

Kriteerien jakautuminen

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • 1M-merkin kontekstiuuskienikkö
  • Monimuotoinen syöttö: teksti, kuva, ääni, video
  • Alkuperäinen työkalukutsu ja koodin suorittaminen
  • Reaaliaikaiset virtausvastaukset
  • Kuvan ja äänen generointi
  • Saadaan Gemini API:n ja Vertex AI:n kautta
3Mistral Small 3 logo

Mistral Small 3

Kompakti avoimen lähdekoodin LLM, joka tarjoaa kilpailukykyistä suorituskykyä alhaisemmilla laskentavaatimuksilla.

4.5 (4)
Ilmainen
Mistral Small 3 kuvakaappaus

Mistral Small 3 on kevyt suuri kielimalli yritykseltä Mistral AI, suunniteltu tarjoamaan vahvaa päättely- ja generointikykyä, samalla kun se toimii tehokkaasti vaatimattomalla laitteistolla. Se on suunnattu kehittäjille ja organisaatioille, jotka haluavat käyttää kyvykästä tekoälyä ilman rajottelemattoman skaalan mallien infrastruktuurikustannuksia. Avoimella lisenssillä julkaistua mallia voidaan itse isännöidä, hienosäätää ja integroida kaupallisiin sovelluksiin. Sen tasapaino nopeuden, tarkkuuden ja resurssitehokkuuden välillä tekee siitä sopivan keskustelurobottien, sisällöntuotannon, kooditehtävien ja paikallisten käyttöönottojen kannalta, joissa latenssi tai tietosuojalla on merkitystä.

Kriteerien jakautuminen

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Avoimen painoinen mallijulkaisu
  • Optimoitu tehokasta päättelyä varten
  • Kilpailukykyiset vertailutulos
  • Tukee hienosäätöä ja mukauttamista
  • Sopii paikalliseen käyttöönottoon
  • Monikielinen tekstin luominen
4OpenAI o3 logo

OpenAI o3

OpenAI:n edistynyt päättelymalli monimutkaisiin, monivaiheisiin ongelmanratkaisuihin

4.0 (4)
Ilmainen
OpenAI o3 kuvakaappaus

OpenAI o3 on edistyksellinen päättelymalli, joka on suunniteltu ratkaisemaan ongelmia, jotka vaativat tarkkaa, askel-askeleelta etenevää ajattelua. Se hyödyntää o‑sarjan lähestymistapaa, jossa inferenssiaikana käytetään enemmän laskentatehoa suunnitteluun, tarkistamiseen ja vastausten hiomiseen, mikä tekee siitä erinomaisen matemaattisten, koodaus-, tieteellisten ja loogisen analyysin tehtävien suorittamiseen. Yleiskäyttöisiin chat-malleihin verrattuna o3 painottaa syvyyttä nopeuden sijaan. Se pystyy hajottamaan epäselvät kehotteet, arvioimaan useita lähestymistapoja ja tuottamaan luotettavampia tuloksia testeissä, jotka korostavat päättelyä ja työkalujen käyttöä. Kehittäjät voivat käyttää sitä OpenAI API:n ja ChatGPT:n kautta, jossa se on integroitu työkaluja kuten verkkoselailu, Python ja tiedoston analyysi. Malli on suunnattu tutkijoille, insinööreille ja tehokäyttäjille, jotka tarvitsevat parempaa tarkkuutta vaikeissa ongelmissa ja ovat valmiita uhraamaan hieman latenssia ja kustannuksia korkealaatuisten tulosten saavuttamiseksi.

Kriteerien jakautuminen

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Laajennettu ajatustenketjun päättely
  • Työkalujen käyttö, mukaan lukien koodi-, web- ja tiedostosyötteet
  • Suuri kontekstialue pitkille asiakirjoille
  • API- ja ChatGPT-saatavuus
  • Parannettu tarkkuus STEM-vertailuarvoissa
  • Tukee monimutkaisia agenttipohjaisia työnkulkuja
5DeepSeek R1 logo

DeepSeek R1

Avoin lähdekoodi suuren kielen malli, jossa toiminnassa loistaa päättely, matematiikka ja koodaaminen, ja sen lisensoimaan vapauksella käytetään ja muokataan MIT-määräyksen mukaan.

4.8 (4)
Ilmainen
DeepSeek R1 kuvakaappaus

DeepSeek R1 on avoin kohde suurelle kielelle, joka erinomaisessa tapauksessa pyörittää, laskutoimituksia ja ohjelmointitöitä. Se käyttää Mixture of Experts (MoE) -arkkitehtuuria, jossa on 37 miljardia aktivia parametria ja 671 miljardia yht. parametria ja tukee 128 000 kehän pituutta. Maksiminimmiä modeli sisältää edistyksellisiä ohjausopetus menetelmiä saavuttaakseen itsevarmentumista, monipuolista kaksivaiheista yläreuna ja ihmisen sovituksen tasona pyritytään pyörittämään kykyjä. DeepSeek R1 on saavuttanut edistyksellistä vakiintumista monessa vertailussa, mukaan lukien 97,3 prosentin tarkkuus MATH-500, 79,8 prosentin pääsystahti AIME 2024 ja ylöksytymään 96,3 prosenttia Codeforces osallistujista. Käyttöliittymä on saatavana useassa muodossa, 1,5 miljardiin 70 miljardiin parametria, ja se on lisensoidu kuten MIT vapaasti kaytettava. Vaihtoehtona DeepSeek R1 voidaan pyörittää vapaasti verkkopalvelussa ja WebGPU käytönohjatun vaihtoehdon voidaan käyttää paikalliskoneella ja selaimessa. Malli on suunniteltu monimutkaisen ongelmien ratkaisemiseen, monikieliseen ymmärrykseen sekä tuotantovarmenteiselle koodin luomiselle. Sen taituruudet sisältävät erinomaisen matemaattisen argumentoinnin kyvyn, koodin luomisen sekä luonnollisen kielen ymmärryksen. Kuitenkin, koska se on avoimen lähdekoodin malli, sitä voi tarvita teknillistä asiantuntijaosaamista käyttöönottoon ja tarkistettavuuteen niinikään erityistapauksien mukaan. DeepSeek R1 on sijoitettu maailmanlaajuisiin parhaiten menestyneisiin AI-malleihin, ja sen kyvyt ovat vertailukelpoisia etenkin suuryritysten omistamiin kehittämiin ratkaisuihin. Avoimen lähdekoodin luontainen luonne mahdollistaa yhteisöllisen kehittämisen ja jatkuvia päivityksiä, joista tulee muun muassa multimodaalin tuen, keskusteluiden parantaminen sekä jakohakkuisen inferenssin optimointi. Malli on kehitetty täysin tukiasiantuntijakoulutuksella, joka mahdollistaa sen saavuttavan GPT-4-tasoista matematiikkaa huomattavasti halvemmalla. Käyttöketjukuvauksen taito kohdistaa AI- "mustoihin laatikoihin" (black box challenges) haastamalla, ja tarjoaa näkemyksiä mallin käsittelystä. DeepSeek R1:n API tarjoaa avointa OpenAI-päätepistettä integrointia varten, joka hintaa $0.14 miljoonan aseman kohdalla. Malleissa on avointa painotustiedostoa, jolloin se sallii kaupallisen käytön ja muokkausmahdollisuus.

Kriteerien jakautuminen

Ease of use0
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • MoE -arkkitehtuurin sekoitus
  • Etäistä oppimista hyödyntävät etenkin edistyneet toimintamalli
  • Oma todennettavuus ja monivaiheinen toiminnanpalautusvaihe
  • Instrumentoidut reaaliaikaan alentuneet toiminnantarkoitus ja matematiikka
  • Tuki 128K-syvyisinä osoitteissa
  • Avoin API -pistekirjapyyntö
6DeepSeek V3 logo

DeepSeek V3

Avoin lähdekoodi -mikäli-neuvojamalli tarjoaa GPT-4 tason perustelun neljällä annoksella hintaansa edullisemmin.

4.8 (6)
Ilmainen
DeepSeek V3 kuvakaappaus

DeepSeek V3 on suuren mittakaavan sekä asiantuntijan- että arkkitehtuurista asiantutkimusta (MoE, Mixture-of-Experts) soveltava suullisen kielen malli, jonka on kehittänyt DeepSeek AI. Se käynnistää vain osan kaikkien parametreidensa joukosta per token, mikä mahdollistaa sen antaa vahva tasoinen menestys asiantuntijakäyttäytymisessä, matematiikassa ja ohjelmoinnissa, samalla kun viitearvojen alennus aiheuttaa selvästi verrattaessakin pientä laskennan kustannusta vertailukelpoisemmille tiivistymättömille malleille. DeepSeek V3 julkistettiin avoimilla painorajoin, mikä on tekevänyt sen suosituksi kehittäjien ja tutkijoiden keskuudessa. Heidän tarpeensa on ketterä alkeismalli, joka saa itse isännöidä, jota voidaan tarkkailevasti sovittaa tai integroida API:llä. Mittausarvot sijoittavat sen kilpailevien suojattujen malleiden kanssa, kuten GPT-4o, erityisesti matematiikka- ja looginen johtajuusarviotuoteroissa. DeepSeek V3 on sopiva tekniikkapalveluille, koodin tuottamispolkuille, tutkimuskäytäntöjen työkaluille ja milloin tahansa soveltuville sovelluksille, missä käytännön logiikka ja budjettitoimittavuus ovat arvoja.

Kriteerien jakautuminen

Ease of use1
Value for money1
Features & power0
Integrations0
Support & docs1
Reliability0
  • Mikäli-eksperttiarkkitehtuuri
  • Kilpailukykyiset perustelu- ja matematiikkatehokkuukset
  • Avoin mallin painot
  • API-tietoiskuja kautta DeepSeek alustaa
  • Kauaspyörivän tilan tuki
  • Viimeistelty mukava muunneltavuus
7Llama 3.3 logo

Llama 3.3

Meta-yhteisön avoin, monikielinen LLM, joka on optimoitu tehokkaan ja laadukkaan tekstin luomiseen.

4.8 (5)
Ilmainen
Llama 3.3 kuvakaappaus

LLM Llama 3.3 on suuri kielenmalli, jonka on suunniteltu antamaan vahvoja ajattelun, koodauksen ja monikielisyydensaavutuksia, mikä tapahtuu aiemmista suurista hahmossaan tehokkaammin. Se tuki laajaa kirjoa kieliä ja on sopiva chat-avustajien, sisällöntuotannon, kokonaisuuksien päättelyyn sekä kehittäjälisenssien tavoittelemiselle. Se julkaistiin avoimilla painotusten, ja se voidaan asettaa paikallisesti tai suureen määrään nuolinäyttöjen ja ennustuspalveluntarjoajien välityksellä, tarjoamalla tiimille mahdollisuuden säätää kustannukset, latency, datahanke. Sen oppetussovitettu muunnos on optimoitu siitä, että se seuraa käyttäjän ohjeita tarkasti ja tuottaa palautteellisia, konversaatioon keskimääräisiä vastauksia. Pohjanaiksi kehitetään tyypillisesti Llama 3.3 sovelluksia eri aloille, hakutietoälykkyysyksikköä sisältäviä generointijärjestelmiä sekä agenteja, jotka toimivat työryhmiä vastaan.

Kriteerien jakautuminen

Ease of use0
Value for money0
Features & power1
Integrations1
Support & docs1
Reliability0
  • Monikielinen tekstin luominen
  • Oppikas-tutkimusmuotoisuuden laadun optimointi
  • Pitkän kontekstin tuet
  • Tiedonsyöte ja päätöksenteon kyky
  • Avoin paino käyttötarkoituksille optimoinnin avuksi
  • Suuri tuken ominaisuudet suorituskyvyn kannalta
8Pronoia logo

Pronoia

Arabialähtöinen suuri kielimalli, tarkennettu natiivitason ymmärtämiseen ja generointiin.

4.7 (6)
Ilmainen

Pronoia on suuri kielimalli, joka on erityisesti hienosäädetty arabian kielelle, ja sen tavoitteena on tarjota tarkempaa ymmärrystä, generointia ja päättelykykyä kielessä kuin yleiskäyttöiset monikieliset mallit. Se on asemoitu johtavaksi arabian keskittyväksi LLM:ksi, jossa on optimoitu murteisiin, klassisiin muotoihin ja nykyaikaiseen standardiarabiaan. Mallia voidaan käyttää tehtäviin kuten sisällöntuotanto, tiivistys, käännös, asiakastuki ja keskusteleva tekoäly arabiaa puhuvilla markkinoilla. Keskittymällä koulutuksensa arabian dataan, Pronoia pyrkii huomioimaan nyansseja, kuten morfologia, diakriittiset merkit ja kulttuurinen konteksti, joita laajemmat mallit usein käsittelevät epäjohdonmukaisesti.

Kriteerien jakautuminen

Ease of use0
Value for money1
Features & power0
Integrations1
Support & docs0
Reliability0
  • Arabiaan optimoitu kielimalli
  • Tekstin generointi ja tiivistäminen
  • Käännöstuki
  • Keskustelu- ja chatbot-ominaisuudet
  • Sopii yritystason arabiankieliseen NLP:hen
  • Kattaa nykyaikaisen kirjallisen arabian (MSA) ja murteet