Mennyt taisto · 2025-08-08 UTC
LLM Yhteenotto — 8. elokuuta 2025
Kategoriasta LLM. 28 merkkiä asetettu 6 taistelijan kesken. DeepSeek V3 otti kruunun.
Lopulliset sijoitukset
Kokoonpano
Taistelijat
Profiilit jokaisesta työkalusta, joka kilpaili tässä taistossa, järjestettynä lopullisen pistemääränsä mukaan.

DeepSeek V3
Avoin lähdekoodi -mikäli-neuvojamalli tarjoaa GPT-4 tason perustelun neljällä annoksella hintaansa edullisemmin.

DeepSeek V3 on suuren mittakaavan sekä asiantuntijan- että arkkitehtuurista asiantutkimusta (MoE, Mixture-of-Experts) soveltava suullisen kielen malli, jonka on kehittänyt DeepSeek AI. Se käynnistää vain osan kaikkien parametreidensa joukosta per token, mikä mahdollistaa sen antaa vahva tasoinen menestys asiantuntijakäyttäytymisessä, matematiikassa ja ohjelmoinnissa, samalla kun viitearvojen alennus aiheuttaa selvästi verrattaessakin pientä laskennan kustannusta vertailukelpoisemmille tiivistymättömille malleille. DeepSeek V3 julkistettiin avoimilla painorajoin, mikä on tekevänyt sen suosituksi kehittäjien ja tutkijoiden keskuudessa. Heidän tarpeensa on ketterä alkeismalli, joka saa itse isännöidä, jota voidaan tarkkailevasti sovittaa tai integroida API:llä. Mittausarvot sijoittavat sen kilpailevien suojattujen malleiden kanssa, kuten GPT-4o, erityisesti matematiikka- ja looginen johtajuusarviotuoteroissa. DeepSeek V3 on sopiva tekniikkapalveluille, koodin tuottamispolkuille, tutkimuskäytäntöjen työkaluille ja milloin tahansa soveltuville sovelluksille, missä käytännön logiikka ja budjettitoimittavuus ovat arvoja.
Kriteerien jakautuminen
- Mikäli-eksperttiarkkitehtuuri
- Kilpailukykyiset perustelu- ja matematiikkatehokkuukset
- Avoin mallin painot
- API-tietoiskuja kautta DeepSeek alustaa
- Kauaspyörivän tilan tuki
- Viimeistelty mukava muunneltavuus

Janus pro
DeepSeekin avoin monimodaalinen malli kuvien luontiin ja visuaaliseen ymmärtämiseen yhdistetyssä arkkitehtuurissa.

Janus Pro on DeepSeekin avoimen lähdekoodin monitapahtuva AI-malli, jota on saatavilla sekä 1B että 7B parametriversiona. Se yhdistää visuaalisen ymmärtämisen ja kuvien generoinnin yhteen kehykseen erottamalla visuaalisen koodauspolun, jolloin malli pystyy sekä tulkkaamaan kuvia että luomaan niitä tekstipromptien avulla. 7B-muunnelma saavuttaa kilpailukykyisiä tuloksia teksti-kuva-synteesin ja visuaalisten kysymysten vastaamisen vertailuissa, usein vastaten tai ylittäen suurempien erikoistuneiden mallien suorityskykyä. Julkaistu MIT-lisenssillä, Janus Pro voidaan isännöidä itse, hienosäätää ja integroida tutkimus- tai tuotantoputkiin ilman käyttörajoituksia. Se sopii kehittäjille, tutkijoille ja harrastajille, jotka tarvitsevat joustavan monitilausmalliperustan kokeiluun, prototyyppien luomiseen tai sovellusten luomiseen, jotka yhdistävät kuvien luomisen kuvien ymmärtämiseen.
Kriteerien jakautuminen
- Teksti-kuvan generointi
- Visuaalinen kysymys-vastaus ja kuvan analyysi
- Yhdistetty transformer-arkkitehtuuri
- 1B ja 7B parametrioptiot
- MIT-lisensoidut avoimet painot
- Monimodaalisen syötteen ja tulosteen tuki

DeepSeek R1
Avoin lähdekoodi suuren kielen malli, jossa toiminnassa loistaa päättely, matematiikka ja koodaaminen, ja sen lisensoimaan vapauksella käytetään ja muokataan MIT-määräyksen mukaan.

DeepSeek R1 on avoin kohde suurelle kielelle, joka erinomaisessa tapauksessa pyörittää, laskutoimituksia ja ohjelmointitöitä. Se käyttää Mixture of Experts (MoE) -arkkitehtuuria, jossa on 37 miljardia aktivia parametria ja 671 miljardia yht. parametria ja tukee 128 000 kehän pituutta. Maksiminimmiä modeli sisältää edistyksellisiä ohjausopetus menetelmiä saavuttaakseen itsevarmentumista, monipuolista kaksivaiheista yläreuna ja ihmisen sovituksen tasona pyritytään pyörittämään kykyjä. DeepSeek R1 on saavuttanut edistyksellistä vakiintumista monessa vertailussa, mukaan lukien 97,3 prosentin tarkkuus MATH-500, 79,8 prosentin pääsystahti AIME 2024 ja ylöksytymään 96,3 prosenttia Codeforces osallistujista. Käyttöliittymä on saatavana useassa muodossa, 1,5 miljardiin 70 miljardiin parametria, ja se on lisensoidu kuten MIT vapaasti kaytettava. Vaihtoehtona DeepSeek R1 voidaan pyörittää vapaasti verkkopalvelussa ja WebGPU käytönohjatun vaihtoehdon voidaan käyttää paikalliskoneella ja selaimessa. Malli on suunniteltu monimutkaisen ongelmien ratkaisemiseen, monikieliseen ymmärrykseen sekä tuotantovarmenteiselle koodin luomiselle. Sen taituruudet sisältävät erinomaisen matemaattisen argumentoinnin kyvyn, koodin luomisen sekä luonnollisen kielen ymmärryksen. Kuitenkin, koska se on avoimen lähdekoodin malli, sitä voi tarvita teknillistä asiantuntijaosaamista käyttöönottoon ja tarkistettavuuteen niinikään erityistapauksien mukaan. DeepSeek R1 on sijoitettu maailmanlaajuisiin parhaiten menestyneisiin AI-malleihin, ja sen kyvyt ovat vertailukelpoisia etenkin suuryritysten omistamiin kehittämiin ratkaisuihin. Avoimen lähdekoodin luontainen luonne mahdollistaa yhteisöllisen kehittämisen ja jatkuvia päivityksiä, joista tulee muun muassa multimodaalin tuen, keskusteluiden parantaminen sekä jakohakkuisen inferenssin optimointi. Malli on kehitetty täysin tukiasiantuntijakoulutuksella, joka mahdollistaa sen saavuttavan GPT-4-tasoista matematiikkaa huomattavasti halvemmalla. Käyttöketjukuvauksen taito kohdistaa AI- "mustoihin laatikoihin" (black box challenges) haastamalla, ja tarjoaa näkemyksiä mallin käsittelystä. DeepSeek R1:n API tarjoaa avointa OpenAI-päätepistettä integrointia varten, joka hintaa $0.14 miljoonan aseman kohdalla. Malleissa on avointa painotustiedostoa, jolloin se sallii kaupallisen käytön ja muokkausmahdollisuus.
Kriteerien jakautuminen
- MoE -arkkitehtuurin sekoitus
- Etäistä oppimista hyödyntävät etenkin edistyneet toimintamalli
- Oma todennettavuus ja monivaiheinen toiminnanpalautusvaihe
- Instrumentoidut reaaliaikaan alentuneet toiminnantarkoitus ja matematiikka
- Tuki 128K-syvyisinä osoitteissa
- Avoin API -pistekirjapyyntö

ASI:One
Teoreettinen agenttigeni AI apuri, joka koordinoi itsenäisiä agentteja monivaiheisten tehtävien suorittamiseksi.

ASI:One on AI-apuli, joka perustuu agenttigeni-käsitteeseen. Yksinkertaistetulla keskustelunäkymällä voivat käyttäjät lähettää ja koordinoi erikoistuneita itsenäisiä agentteja suhteellisen monimutkaisten pyynnöiden hoitamiseksi. Sen sijaan, että se palauttaisi vain tekstin, se voi suunnitella, käynnistää sovelluksia ja suorittaa työvirtauksia käyttäjän edustuksen puolella. ASI:One on rakennettu Artifisial Superintelligence Alliance-ekosysteemin yhteyteen. Se on sijoiteltu eräänä henkilökohtainen AI-agentti, joka integroidaan laajemmille itsenäisille agenttiverkostolle. Käyttäjät voivat keskustella sen kanssa yleisistä kysymyksistä tai siirtää lyhyitä tehtäviä, kuten tutkimuksia, vertailuja, aikatauluja ja hakemuksia yhdessä liitettyihin palveluihin.
Kriteerien jakautuminen
- Tiedottava keskustelunäyttö
- Itsenäisten agenttien käytännön koordinaatiolaskentat
- Monivaiheisten tehtävien suunnittelu ja suoritus
- Yhdistelmä ulkoisen agenttien ja palveluiden kanssa
- Persoonallinen muistinäyttö ja ympäristömuisti
- ASI:Allianssin agenttirunko

Latest DeepSeek R2
Pienet- generaatioon keskittynyt arviointi- ja tiedonhaun tulevaisuus tulee DeepSeekiltä

DeepSeek:n R2 oli yleissivistävyyteen kohotettu seuraaja DeepSeekin R1-ratkaisumallille, joka tarjoaa kehittyneen askelisketutkimuksen matematiikkaan, koodaukseen ja analyytiikkaan. Sen tavoitteena on laajentaa avointa tutkimustyötä, joka tekoi aiempia DeepSeek-julkaisuja suosituksi tekniikoille ja tutkijoille. Malli on suunniteltu parantamassa tarkkuuttaa, mittakaavaa ja tehokkuutta verrattuna edeltäjiinsä, joten se on sopiva käytölle teknisille avustimilla, toiminnallistamisessa agenteilla ja integroinnissa omakustannallisiin sovelluksiin. Käyttömahdollisuudet ja tarkat tekniset specifiikat riippuvat DeepSeekin virallisesta lähdekoodista. Käyttäjät saavat yleensä tarkastaa mallia API-ääniä, keskustelu-oliota tai ajamalla avoimen painon, jos saatavilla, osoittavat tämän mahdollistamalla sekä yksittäisen kokeilun että tuottavuuden lopputuotteen suunnittelu.
Kriteerien jakautuminen
- Tehoisa ketju-tekijöiden ajattelu
- Laitteiden ympäröivä monitarkkailuikkuna
- Ohjelmointikoodin ylläpito ja koodiongelmien korjaaminen
- Monikielinen ymmärrys
- API-tuki sekä keskusteluvaikutteinen asiakaspalvelu
- Edustaa agendistaatioita
Pronoia
Arabialähtöinen suuri kielimalli, tarkennettu natiivitason ymmärtämiseen ja generointiin.
Pronoia on suuri kielimalli, joka on erityisesti hienosäädetty arabian kielelle, ja sen tavoitteena on tarjota tarkempaa ymmärrystä, generointia ja päättelykykyä kielessä kuin yleiskäyttöiset monikieliset mallit. Se on asemoitu johtavaksi arabian keskittyväksi LLM:ksi, jossa on optimoitu murteisiin, klassisiin muotoihin ja nykyaikaiseen standardiarabiaan. Mallia voidaan käyttää tehtäviin kuten sisällöntuotanto, tiivistys, käännös, asiakastuki ja keskusteleva tekoäly arabiaa puhuvilla markkinoilla. Keskittymällä koulutuksensa arabian dataan, Pronoia pyrkii huomioimaan nyansseja, kuten morfologia, diakriittiset merkit ja kulttuurinen konteksti, joita laajemmat mallit usein käsittelevät epäjohdonmukaisesti.
Kriteerien jakautuminen
- Arabiaan optimoitu kielimalli
- Tekstin generointi ja tiivistäminen
- Käännöstuki
- Keskustelu- ja chatbot-ominaisuudet
- Sopii yritystason arabiankieliseen NLP:hen
- Kattaa nykyaikaisen kirjallisen arabian (MSA) ja murteet




