Praeita kova · 2026-08-01 UTC
LLM Susirėmimas — 2026 m. rugpjūčio 1 d.
Iš LLM kategorijos. 14 įvertinimai pateikti tarp 5 kovotojų. DeepSeek R1 laimėjo vainiką.
Galutiniai rezultatai
Dalyviai
Kovotojai
Kiekvieno šioje kovoje dalyvavusio įrankio profiliai, surikiuoti pagal galutinį rezultatą.

DeepSeek R1
Atvirųjų šaltinių didelis žiūrių modelis, pagerintis problemų išsprendimą, matematiką ir kodus, naudojantis MIT licenzija sąlygomis neiįprastai be mokesčių.

DeepSeek R1 yra atvirasjųjų didelių jutikų modelių šaknis, kuris išsipjauna gebėjimą nagrinėti abstraktinius ryšius, matematinės matematikos uždaras bei kodo uždovynes. Jis naudoja Mixture of Experts (MoE) architektūrą su 37 mlrd. veikiamų parametrų ir 671 mlrd. parametru, paspėdina 128K konteksto ilgį. Šis modelis įtaisija pasitelktį mokymosi išmokymą pasiekti savo verifikavimą, keliojų refleksiją bei žmogiško orientuotąjų raiškos širdžius. DeepSeek R1 pasiekęs visų sąlygujų geriausių rezultatus keliojų standartų, žemęjant 97.3% taikslumo pagal MATH-500, 79.8% sėkmės laipsniui pagal AIME 2024, bei priešpaskutiniuosių 96.3% uždarytojų Codeforces. Šis modelis pasižymi daugybemi variantais, besiskiriantais nuo 1,5 mlrd. iki 70 mlrd. parametru, ir pateikiamas pagal MIT licenciją be jokių išlaidų. DeepSeek R1 taip pat naudojamas internete už nulinį išlaidų ir įtaisijamas paspėtinio WebGPU pagrindu, leidžianti kiekvienąjį vartotoją paleisti ir pasirūpinti tinklavietės aplinkybėmis. Modelis sukurtas kompleksinių problemai sprendimo, daugialypių kalbų įtraukties ir pagrindinio kodui generavimo tikslais. Jo gebėjimai apima nuostabių matematikinių argumentacijų, kodą generuojančių, bei prirodžios kalbos supratimo galių. Vienintelis, bet modelis yra atvira prieigos sistema, nors galbūt norint tobulinti ir išsaugoti modelio bei pritaikyti jį konkretniems naudojimams, reikia naudoti techninių žinių. DeepSeek R1 yra įvertinamas už aukštųjų AI modelių rango pasaulyje, su galiomis panašiomis į lyderių savitines sprendinius. Jo atvirųjų šaltinių (open-source) priklausomybė leidžia bendruomeniniam vystymui ir toliau vykstančioms patobulinimams, tarp jų numatytame multimodaliojo palaikymo bei pokalbių užteisinimo, bei panaudojimo plieniniuose įrenginiuose (distributed inference) optimizacijai. Modelis turi tiesioginę mokytojos mokymosi raidą, kas leidžia jo pasiekti GPT-4 lygio matematikos funkcionalumo ženkliai auktžemes kostė. Sukauptos minties vizualizavimo galimybės spragša „juodojo skydo“ AI iššūkius, suteikiančios įrangos mokymosi procesų atvaizdą. DeepSeek R1 šioje sistemoje API suteikia atvirojo API bei vykdo OpenAI - kompatybę, integruojamą bei taikantį $0,14 per milijoną žodžių bei mokesčius. Modelio svoriu yra atviro kaltis, leidžiantis komercinei veiklai ir permainamui.
Kriterijų išskirstymas
- Mixture of Experts (MoE) architektūra
- Papildinti kartų mokymosi technika
- Savarankiškas apvertinimas bei daugiaspakos išsprendimai:
- Logikos orientuotas mokymasis.
- Atžava 128K konteksto ilgumas
- OpenAI kompatybingas API endpoint

Eye2.AI
Suspausykite atsakymus iš šių pirmaujančių MA modelių priešingoje pusėje su vienu klausimu — be sąskaitos, be registruojantis.

Eye2.AI yra daugmodelio AI modelių palyginimo verslo priemonė, kuria naudojantis naudotojas gali atsiuntį vieną keliamąjį keliamąjį keliamajam keliamajam vienam keliamam LLM modeliams ir žiūrėt jų atsakymus tiesiogiai. Priešpriešinęs skirtumus tonui, tikslumą, gylį ir pagrįstumą, ji padeda vartotojams pasirinkti kokia modelis labiau tinka tam tikram uždaviniui bez nuobodžiant keles keliamajam keliamiems ir maksimaliam keliamam kiekiu. Šis paslauga yra nemokama naudoti ir neprieštarauja registracija, todėl lengviau galima eksperimentuoti, tyrėji kasdieninius faktus bei tikrinti modelių skirtumus. Ši paslauga labiau naudinga rašytojams, programinėms pramonei, moksleiviems bei visiems, kurie yra patikinti, kaip skirtingos AI sistemos atskleidžia panašius klausimus.
Kriterijų išskirstymas
- Susiūlykite vieną klausimą ir peržiūrėkite kelias didelės lingvistinės modeliai šonai prie šono
- Atsparumas lydėti atsakymus šonai prie šono
- Prieiga prie geriausių ir visų MA vien trumpuose
- Nereikia prieštaraujantis registravosi
- Nereikia sąskaitos
- Sutrumpinta eksperimentų su klausimais išėjimų

OpenAI o3
Atviros AI o3: galingas abstrukcinis modelis kompleksioms, daugiastepiam aiškintiems uždaviniams.

O3 OpenAI yra pirmagilumo teisinimo modelis, kuris yra suprojektuotas, kad sprendžytų problemus, reikalingus kritiškomis, žingsnes iki žingsnio, kalbimuisi. Tai baigtosi remiantis o-šerijos metodika, išlaisvalant reikiamo daugiau skaičiavimo įsigaliojimo metu planuoti, patvirtinti ir papratai atsakymo, dėl to tai gerai pritaikyta užduočių atlikti matematikoje, programavime, mokslas, ir logikoje analize. Palyginus su išvyrinčiais švarkavimo modeliais, o3 dėmesio skiria gylį, nei greitį. Jis gali prieštaringų įrankio įspėjimus skaidrinti, įvertinti daugelį pristangų ir sukurti daugiau reliabilius išvestis, taikant bazių, kurios stiprina sąmonę ir technologijų naudojimą įvertinimus. Programavimo specialistai gali prieigą patekti per OpenAI API ir ChatGPT, kuris integravęs įrankius, kaip vėliavos naršinimo, Python ir failų analizės funkcijas. Šis modelis skirtas tyrimų darbuotojams, inžinieriams ir galingiems naudotojams, kurie reikalauja stipresnės tikslumo už sausąsio problemas ir taip pat pasirinkti laisvoji trukmė bei kaupiai dėl aukštą kokybių rezultatų.
Kriterijų išskirstymas
- Ilgas argumentacijos eiga
- Kita prijungtų priemonių panaudojimas
- Didelė konteksto anglis, kad galėtų apdabinti ilgus tekštus
- Prieinama API ir ChatGPT per Atvirą AI
- Imtis tobulės tikslumui STEM prišdėties
- Palaiko kompleksus agentų darbų procesus
Pronoia
Didžiuliais rytų šiaurės arabu kalbos modelis, specialiai apdorinta tam, kad sukurtų natyvių kalbos užimtumo ir susiekimo galimybes.
Pronoia yra didelis kalbos modelis, skirtas specifikiškai paprastos susijaudinimo Arabų kalbą, taikantis savo gebėjimus pagerinti tikslumą susiiejame supratimui, visuometiniam sukūrimui ir logikai. Jis yra įvardijamas kaip viena pagrindinių Arabų kalbos LLM modelių, su optimizacija dialektams, klasikinėms formoms ir moderniems standardiniam arabų kalbos variantams. Modelis gali būti naudojamas užduočių atliekimui, tokių kaip turinio kūrimas, santraukų sukūrimas, vertimas, klientų aptarnavimas ir pokalbiniai AI paslaugos kalbą kalbantiems arabų kalbos kalbančiuose rinkose. Koncentruodami savo mokymą arabų duomenims, Pronoia siūlo modelis pažymi arabų kalbos savybes kaip morfologija, diakritiniai ženklai ir kultūrinė kontekstas, kuris plačiau modeliai dažnai neišsiprastę labai konsistelišku būdu.
Kriterijų išskirstymas
- Arabu kalbą adaptuotas kalbos modelis
- Teksto generavimas ir suminėjimuos
- Tolkymo palaikymas
- Konversaciniu ir chatt robotu galimybes
- Paskirtas įmoninę arabu NLP
- MSA ir dialektų pokrypiajų apdorų galimybes

Gemini 2.0 Flash
Žemės gyvos, dažniai modulio AI modelis, kurių tikslas yra tiesioginis veiksnių vykdymas su 1M-token konteksto langine.

Gemini 2.0 Flash yra Google DeepMind keturiasdešimtais modelis, optimizuotas greičio, mastumo ir daugmodalių suvokimų užtvaras. Jis priima tekstą, vaizdo įrašus, garso įrašus ir vaizdo įrašus kaip įvestį ir gali generuoti tekstą, vaizdo įrašus ir garso įrašus kaip išvadą, taip padedamas kuriam kuo turtingesnių interaktyvių aplikacijų. Sukurtas agentų darbo užtvarais, modelis prisijunkinę natyvių įrankių naudojimui, funkcijų vadinimui ir 1M-tokeno konteksto langą užtvarkoiamui dideliems dokumentams, kodavimo bazėms ar ilgalaikiems sesijoms. Mažas laukimas jį paverčia svarbia priklausomybe asistentų, realiuoju analizės bei produkcijos šaukinio įrenginiams. Programuotojai gali prisijungti prie Gemini 2.0 Flash per Gemini API, Google AI Studio bei Vertex AI, su SDK prieinamais daugelio kalbų.
Kriterijų išskirstymas
- 1M-token konteksto židinys
- Dažniausioįs įvesties forma: žinoklė, paveikslėlis, garsas, vaizdas
- Gamtinių priemonių naudojimas ir uždavinio atliksna užgalvyti
- Ieškimo prieiga už realųjį laiką
- Paveikslėlių ir garsų generavimo
- Galima prieiga į Gemini API ir Vertex AI



