Praeita kova · 2025-08-08 UTC

LLM Susirėmimas — 2025 m. rugpjūčio 8 d.

LLM kategorijos. 28 įvertinimai pateikti tarp 6 kovotojų. DeepSeek V3 laimėjo vainiką.

Galutiniai rezultatai

Dalyviai

Kovotojai

Kiekvieno šioje kovoje dalyvavusio įrankio profiliai, surikiuoti pagal galutinį rezultatą.

1DeepSeek V3 logo

DeepSeek V3

Atviras mėginių modelis, siūlantysis GPT-4 lygio priežastingumą vos nežemesnei kainai.

4.8 (6)
Nemokama
DeepSeek V3 ekrano nuotrauka

DeepSeek V3 yra didelio masto mėginių (MaE) kalbos modelis, sukurtas DeepSeek AI. Jis veikia tik dalykinės savo visų parameterių, leidžiant jį delistirdinti gausiąją atliekamą performanciją kovos, matematikos bei programinės kodu realizacijos uždaviniais, todėl infekcinės užteiktų sąnaudų sumažėja lyginant su taip patiųjų tankiųjų modelių. DeepSeek V3 atviro svoris išleistas, jis tapo populiariausiu variantu programuotojams ir tyrėjams, kurie nori gali savimi nuošalų pagrindinį modelį, kurį jiems gali pasididžioti, ar integruoti API. Įvertinimai sakyja, kad jis prieigos prie lyderių savininkų, tokio paties kaip GPT-4o modelioi, kad labanore matematikos ir logiko priežastingumo įvertinimų. Jis labai tinkamiai sudaro savo paslaugas specialistams, kode generavimo tiekime, mokslinių tyrimų workflow, bei visai sąvokai, kuriai yra svarbus atsiskaityti dėl priežastingumo kokybės bei biudžeto efektyvumo.

Kriterijų išskirstymas

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Mėginių kovos architektūra
  • Mėginių kovų bei matematikos įvertinimų bendrųjų vertinimai
  • Atviro svoris, kuris galioja savimi išsaugotui
  • API bei svoris, kuris pridedamas DeepSeek platformoje
  • Gamtinės konteksto langelės palaikymas
  • Labai gerai atsiskaitytų savininkų bei integracijų prijungimas
2Janus pro logo

Janus pro

DeepSeek atliekų rinkinyje skirta atviro multimodalio modelis nuotykinės supratimo ir nuotraukų generavimo vieningai architektūroje.

4.8 (4)
Nemokama
Janus pro ekrano nuotrauka

Janas Pro yra atviro kodo daugialaidis AI modelis iš DeepSeek, prieinamas 1 miliarde ir 7 miliarde parametru versijose. Jis jungia vaizdų suprasimą ir vaizdų generavimą į vieną framework, atskirtų vaizdų kodsavimo kelių sąlygojus, leidžiant modeliui siaubti vaizdus ir sukurti juos iš tekstų prašymų. Šiuolaikinė 7B variantas suteikia varžymo rezultatus teksto į vaizdą sintezės ir vaizdo klausimų atsakymo uždoviui atliekant, kartais sėkmingai sutampa arba viršina kitaip specializuotuose, didesniuose modeliuose. Išleistas sąlygon, kad bus atliekami pagal MIT licencinę sutartį, 'Janus Pro' gali būti savyje saugomas, paprastintas ir įtrauktas į tyrimų ar produkcijos srautus be naudojimo sąlygų ribų. Janus pro tinko su programuotojams, šaltininkams ir entuziastams, kuriems reikia lanksčios multimodalų pagrindinio modelio, esant reikalavimams įvykdyti eksperimentus, prototipuoti, arba kurti taiklininkus, jungiantį vaizdo kūrimą su vaizdo supratimu.

Kriterijų išskirstymas

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Nuotraukų-tekstro generavimas
  • Nuotraukų klausimas ir analizė
  • Jungtinė transformerių architektūra
  • 1B ir 7B parametru variantai
  • MIT licencijos atviros svarbos sujungtos išvados
  • Multimodalų įėjimų ir išėjimų paramai
3DeepSeek R1 logo

DeepSeek R1

Atvirųjų šaltinių didelis žiūrių modelis, pagerintis problemų išsprendimą, matematiką ir kodus, naudojantis MIT licenzija sąlygomis neiįprastai be mokesčių.

4.8 (4)
Nemokama
DeepSeek R1 ekrano nuotrauka

DeepSeek R1 yra atvirasjųjų didelių jutikų modelių šaknis, kuris išsipjauna gebėjimą nagrinėti abstraktinius ryšius, matematinės matematikos uždaras bei kodo uždovynes. Jis naudoja Mixture of Experts (MoE) architektūrą su 37 mlrd. veikiamų parametrų ir 671 mlrd. parametru, paspėdina 128K konteksto ilgį. Šis modelis įtaisija pasitelktį mokymosi išmokymą pasiekti savo verifikavimą, keliojų refleksiją bei žmogiško orientuotąjų raiškos širdžius. DeepSeek R1 pasiekęs visų sąlygujų geriausių rezultatus keliojų standartų, žemęjant 97.3% taikslumo pagal MATH-500, 79.8% sėkmės laipsniui pagal AIME 2024, bei priešpaskutiniuosių 96.3% uždarytojų Codeforces. Šis modelis pasižymi daugybemi variantais, besiskiriantais nuo 1,5 mlrd. iki 70 mlrd. parametru, ir pateikiamas pagal MIT licenciją be jokių išlaidų. DeepSeek R1 taip pat naudojamas internete už nulinį išlaidų ir įtaisijamas paspėtinio WebGPU pagrindu, leidžianti kiekvienąjį vartotoją paleisti ir pasirūpinti tinklavietės aplinkybėmis. Modelis sukurtas kompleksinių problemai sprendimo, daugialypių kalbų įtraukties ir pagrindinio kodui generavimo tikslais. Jo gebėjimai apima nuostabių matematikinių argumentacijų, kodą generuojančių, bei prirodžios kalbos supratimo galių. Vienintelis, bet modelis yra atvira prieigos sistema, nors galbūt norint tobulinti ir išsaugoti modelio bei pritaikyti jį konkretniems naudojimams, reikia naudoti techninių žinių. DeepSeek R1 yra įvertinamas už aukštųjų AI modelių rango pasaulyje, su galiomis panašiomis į lyderių savitines sprendinius. Jo atvirųjų šaltinių (open-source) priklausomybė leidžia bendruomeniniam vystymui ir toliau vykstančioms patobulinimams, tarp jų numatytame multimodaliojo palaikymo bei pokalbių užteisinimo, bei panaudojimo plieniniuose įrenginiuose (distributed inference) optimizacijai. Modelis turi tiesioginę mokytojos mokymosi raidą, kas leidžia jo pasiekti GPT-4 lygio matematikos funkcionalumo ženkliai auktžemes kostė. Sukauptos minties vizualizavimo galimybės spragša „juodojo skydo“ AI iššūkius, suteikiančios įrangos mokymosi procesų atvaizdą. DeepSeek R1 šioje sistemoje API suteikia atvirojo API bei vykdo OpenAI - kompatybę, integruojamą bei taikantį $0,14 per milijoną žodžių bei mokesčius. Modelio svoriu yra atviro kaltis, leidžiantis komercinei veiklai ir permainamui.

Kriterijų išskirstymas

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability0
  • Mixture of Experts (MoE) architektūra
  • Papildinti kartų mokymosi technika
  • Savarankiškas apvertinimas bei daugiaspakos išsprendimai:
  • Logikos orientuotas mokymasis.
  • Atžava 128K konteksto ilgumas
  • OpenAI kompatybingas API endpoint
4ASI:One logo

ASI:One

Koordinuojantis agente, kuris iškviečia savitaręs autonomiją turinčius agentus vykdyti sudėtingų užduočių

4.5 (4)
Nemokama
ASI:One ekrano nuotrauka

ASI:One - tai tokia AI asistenco sistema, kuri sukuriama apie agentinę intelektualą idėją, kuri leidžia sąsiuvinį sąsajos su vartotoju laikantis ir koordinuojanti specializuotus nepriklausomus agentus, kad valdytų sudėtingas prašymus. Ji negali grąžinti tik tekstą, bet gali planuoti, pasiimti rankas už darbą įvairioms programėlėms bei vykdyti workflows, pagal vartotojo užklauso. Sukurtos ASI:One sistemos viduje, kurios yra Artificial Superintelligence Alliance ekosistemo dalis, personalinė AI agentas, integruojanti su decentralizuotais agentų tinklais. Naudojotojai galės skaitytis su juo kasdienines klausimus arba suteikti ilgesnius užduotis, tokias kaip tyrimai, palyginimai, nuotolinės planavimo sistemos ir duomenų paieška per jungtus prie tinklų.

Kriterijų išskirstymas

Ease of use0
Value for money0
Features & power1
Integrations1
Support & docs1
Reliability1
  • Prašalų sąveikos sąsaja
  • Autonomijų agentų koordinacija
  • Sudėginiai užduočių plano ir išlaikyme
  • Siekimo prisegtųjų ir agentų priklausomis priemonių
  • Asistento pamato ir konteksto prisignetimas
  • Sukurti ASI aljanso agentų stogo
5Latest DeepSeek R2 logo

Latest DeepSeek R2

Naujos kartos žmogiškuju asmenybe nukreipta DeepSeek modelis

4.8 (6)
Nemokama
Latest DeepSeek R2 ekrano nuotrauka

DeepSeek R2 yra tęsinys iš ankstesnių DeepSeek R1 matematikai skirtus modelių, kurie pasižymėjo užtikrinta žingsnių problemos sprendimu matematikoje, rengimu ir analizuose. Modelis siekia praplėsti atviro tyrimų poveikį, kuris prieš tai padarė DeepSeek išleidimus populiariai su programininkais ir mokslininkais. Šis modelis siekia pagerinti tikslumą, ilgą konteksto valandų tvarkymą bei dažnesnį apytikslį prieš lyginant su prieš tai, kurie pagerina jį savo praeiviui, padeda techniniams padedžiams, agenciems tvarkymams bei integravimų į naudojamą pramonine programa. Prieigos ir precizijos tikslai priklausomi nuo DeepSeek oficialiai kanalų išleidimo. Naudojotojai gali tiesiogiai prieigą į modelį pasiekti per API, žodžių sąkastę, arba atidaromus weigetas kurie pateikti, dota, leidžiant pasirinkti tarp individualiems tyrimams ir produkcijos įdiegimams.

Kriterijų išskirstymas

Ease of use1
Value for money1
Features & power1
Integrations0
Support & docs0
Reliability1
  • Plinti chain-of-thought tiksliųjų žymes
  • Rengsi ilga konteksto angalą
  • Kodų generavimo ir tvarkymo parametrai
  • Daugia kalbų supratimas
  • API ir žodžių sąkastės prieigos
  • Sukurtas agencių programavimas
6Pronoia logo

Pronoia

Didžiuliais rytų šiaurės arabu kalbos modelis, specialiai apdorinta tam, kad sukurtų natyvių kalbos užimtumo ir susiekimo galimybes.

4.7 (6)
Nemokama

Pronoia yra didelis kalbos modelis, skirtas specifikiškai paprastos susijaudinimo Arabų kalbą, taikantis savo gebėjimus pagerinti tikslumą susiiejame supratimui, visuometiniam sukūrimui ir logikai. Jis yra įvardijamas kaip viena pagrindinių Arabų kalbos LLM modelių, su optimizacija dialektams, klasikinėms formoms ir moderniems standardiniam arabų kalbos variantams. Modelis gali būti naudojamas užduočių atliekimui, tokių kaip turinio kūrimas, santraukų sukūrimas, vertimas, klientų aptarnavimas ir pokalbiniai AI paslaugos kalbą kalbantiems arabų kalbos kalbančiuose rinkose. Koncentruodami savo mokymą arabų duomenims, Pronoia siūlo modelis pažymi arabų kalbos savybes kaip morfologija, diakritiniai ženklai ir kultūrinė kontekstas, kuris plačiau modeliai dažnai neišsiprastę labai konsistelišku būdu.

Kriterijų išskirstymas

Ease of use1
Value for money0
Features & power1
Integrations1
Support & docs0
Reliability0
  • Arabu kalbą adaptuotas kalbos modelis
  • Teksto generavimas ir suminėjimuos
  • Tolkymo palaikymas
  • Konversaciniu ir chatt robotu galimybes
  • Paskirtas įmoninę arabu NLP
  • MSA ir dialektų pokrypiajų apdorų galimybes