Iepriekšējā cīņa · 2026-08-01 UTC
LLM Sadursme — 2026. gada 1. augusts
No LLM kategorijas. 14 atzīmes izvietotas starp 5 cīnītājiem. DeepSeek R1 izcīnīja kroni.
Gala rezultāti
Sastāvs
Cīnītāji
Katra rīka profili, kas piedalījās šajā cīņā, sarindoti pēc to gala rezultāta.

DeepSeek R1
Atvērts lielais valodas modelis, kas izceļas loģikas, matemātikas un kodēšanas uzdevumos, ar MIT licence brīvas izmantošanas un modificēšanas tiesībām.

DeepSeek R1 ir atvērtais kodeksa liela valodu modelis, kas pārveidojas ar analīzi, matemātikas uzdevumiem un programmēšanas uzskaņošanai. Tā lieto Mixture of Experts (MoE) architektūru ar 37T aktīviem parametriem un 671T parametriem kopsummu, atbalstot 128T T maiņu ilgumu. Modelis iekļauj pazīstītus apmācības mācīšanas tehnikas, lai sasniegtu pašizcelšanos, daudzgadīgu refleksiju un cilvēkam piemērotu analīzes spēju. DeepSeek R1 ir sasniedzis uzlabotu panākumu daudzos benchmarkiem, to skaitā 97,3% precīzību MATH-500, 79,8% veiksmību AIME 2024, un ir pārspējušis 96,3% Codeforces dalībnieku. Modelis ir pieejams dažādos variantos, no 1,5T līdz 70T parametru, un tiek izdodams ar MIT licenzi no bezmaksas izmantošanas un modificēšanas. DeepSeek R1 var tiešsaistē lietot bez maksas, un WebGPU-accelerētais variantam ir iespēja izmantot to arī lokāli pārlūkā. Modēls ir paredzēts kompleksu problēmu risināšanai, daudzu valodu saprīšanai un ražošanas kvalitātes koda izveidošanai. To pamatīgās prasības ietver izņēmuma matemātisko argumentāciju, kodu izveidošanu un natīviegas valodu saprīšanu spējas. Tomēr, kā atvērtā-souce modēla, to saskaņošana un speciālu lietotāju gadījumu papildināšana var prasīt tehnisko pieredzi. DeepSeek R1 atrodas tajos pamatos, kur ir augsti ierindoti pasaules AI modeli, savas iespējas izvietojoties virs vadošo, privātīgu risinājumu līmeņa modeliem. Atvērtā sūtīšanas dabība ļāwa ar komūnu sadarbību veikt attīstību un aizsāk, ietverot plānotos multimodālās atbalsta, saruninieka paplašinājumu un sadali atvasiņu palielinājumu. Modelis ir pilnīgi cēloņu mācīšanās attīstība, kas ļauj to sasniedzēt GPT-4 līmeņa matemātikas rezultātus ar vēlams zemāku cenu. Ceļa gatavības vizualizācijas iespēja skar ar IA "melna došu" izaicinājumiem, nododot ieksversmu modela domāšanas procesā. DeepSeek R1 API piedāvā atvērtā izmantošanas OpenAI atbilstīgu punktu, integrēšanai cenā 0,14 USD miljonos tokenu. Modela svarus ir atvērtā izmantošanas, ļaujot komerciālu izmantošanu un modificēšanu.
Kritēriju sadalījums
- Ekspertu sajaukuma (MoE) arhitektūra
- Paplašinātas pastiprināšanas mācīšanās tehnoloģijas
- Pašpārbaudes un vairāku soļu refleksijas iespējas
- Cilvēka saskaņota loģiskā domāšana
- Atbalsts 128 K konteksta garumam
- OpenAI-saderīgs API galapunkts

Eye2.AI
Salīdziniet atbildes no vadošajiem AI modeļiem vienlaicīgi ar vienu prasību — bez maksas, bez reģistrēšanās.

Eye2.AI ir daudzu modeļu veida intelektuāla komparācijas rīks, ko izmantošanā var ievadīt vienu uzskaņu vairākiem vadošiem lieliem valodas modeliem un uz skatīt tos pusapa vidusī, salīdzinošā kārtā. Iespējošanasot atšķirības tonā, tikšanī, dziļuma un rīkošanas dējumu, tas palīdz lietotājam noteikt kāda modelis vislabāk pielīdzinās noteiktam uzdevumam bez maksājumiem par vairākiem abonējumiem. Šis pakalpojums ir brīvais izmantot un nepiecieš neka konkrēta konta, kas padzītina pieejamību par labu paplašinājumu, pētniecību un brīvu faktu pārbaudi arī modeliem. Tādēļ tas ir īpaši labvēlīgs rakstniekiem, programmētājiem, studentiem un tiem, kas interesējas par to, kā dažādi AI sistēmu atcelo tie paši jautājumus.
Kritēriju sadalījums
- Vienas prasības, vairāku modeļu vaicājums
- Atbildes izkārtojums vienlaicīgi
- Pieejas augstākajiem AI modeļiem vienuviet
- Nav nepieciešams konts vai pieslēgšanās
- Bezmaksas lietošanai
- Ātra prasības eksperimentēšanas darba plūsma

OpenAI o3
OpenAI vērsts uz prasmīgu domāšanu sarežģītām, vairāku soli problēmu risināšanai

OpenAI o3 ir priekšstāvjiesto precesiju modelis, kas saskaņota ar problēmu risināšanu, kas prasa pazīstigu saskarsmi un noteiktu, kārtātu domāšanu. Tam ir pamatsērija o-sērijas pieejas principos, kurās koksā daudz lieliem datorzinību resursiem izmantodami tiešās ieteikšanas laikā, veidojot plānu, pārbaudot un izrādījumu, tādējādi tas ir īpaši piemērots uzdevumiem matematikā, programmatūras izstrādē, zinātnē un logiskajā analizē. Salīdzinot ar vispusīgām dialoga modelēm, o3 piesaista dziļumu pie ātruma. Tas var saskatīt neizpratnīgas norīšanas priekšmetus, vērtē dažādas metodes un izveidot vērtspilnu iegultus uz biežotākajām testem, kas piesaista domāšanu un lietojumprogrammām. Ražotāji var piekļūt to nolūkiem caur OpenAI API un ChatGPT, kur tas tiešsavienojas ar līdzekliem, tādiem kā web brīvība, Python, un failu pārvalde. Modelis tiek veidots pēc pamatprogrammatūras, inženieriem, izstrādātājiem un enerģisks lietotājiem, kurajiem nepieciema stiprāka precizitāte īsā laika problēmās un tas jāsaskaņo ar augstāku kvalitāti, kas varētu ietverēt pieauga lētājā un kustību dēļ latences. Jālieto sākotnējie resursi maksimāli efektīvi, lai iegūtu lielāko izaiciendas.
Kritēriju sadalījums
- Paplašināta domāšanas ķēde
- Rīku izmantošana, tostarp kods, tīmeklis un failu ievades
- Liela konteksta logs garajiem dokumentiem
- API un ChatGPT pieejamība
- Uzlabota precizitāte STEM pārbaudē
- Atbalsta sarežģītus agentu darbplūsmas
Pronoia
Arābu valodas oriģinālais liels valodas modelis, kurš ir paredzēts savienojumam un ģenerēšanai ar dzimtās kvalitātes izpratni
Pronoia ir liela valodas modelis, kas specificēti fine-tunēts, lai precīzi pamostītos arābu valodu un sniegt precīzākas komprehijs, izveidošanas un pēdējo līdzekļu izvēles ietvaros, tādējādi pārspējojot vispārīgas, daudzvalodīgu modelī. Tā ir izaugsme arābu valodu orientēto LLM, ar optimizācijām dialektiem, klasiciskajiem formas formām un mūsdienu standartu arābu valodai. Šis models var tiek izmantots darbībām, kādām ir saturu rakstīšana, saistīšana, tulkošana, klientu atbalsts un dzirdēšana, kādas tiek izmantotas Arābijas valstu tirgos. Koncentrējoties uz trainings darbu uz Arābijas duļķiem modelis norķina svarīgi aspekti, kā arī gramatiskās formas un dialektu speciālās burtu zīmju noteikšanu, kā arī kultūras kontekstu, kas plašākajos modelos nav tik konsekventi nodrošināti.
Kritēriju sadalījums
- Arābu valodas optimizēts valodas modelis
- Teksta ģenerēšana un kopsavilkuma veidošana
- Tulkošanas atbalsts
- Konversāciju un čata robotu iespējas
- Piemērots uzņēmumu arābu NLP
- MSA un dialektu pārvaldība

Gemini 2.0 Flash
Google ātrs, multimediju AI modelis, izstrādāts reāllaika agentu uzdevumiem ar 1M tokenu konteksta logu.

Gemini 2.0 Flash ir nākamās paaudzes modelis no Google DeepMind, kas ir optimizēts ātrumā, rādvērtībai un multimodālai prasmē. Tas piešķir teksstu, bildes, audioskopu un video ievadi ar iepriekš un var ģenerēt tekstu, bildes un audioskopu izvadi, kas to padara pareizu izvēlu saistībā ar izkusiņiem. Izdots ar agendentu darbiem sevī piesātinātiem workflowu, modelis atbalsta savdabisko tools lietošanu, funkciju saukšanu un 1 M tokenu kontekstva logu, lai apsūtītu lielus dokumentus, kodu bāzes vai ilgāku sesiju apstrādi. Neliela trūkuma laiks padara to izdzīvotāju izvēli par asistentiem, reālbraukšanas analizēm un ražošanas skaliņos uzturēšanai. Programmatūras izstrādātāji var piekļūt Gemini 2.0 Flash atbalstam caur Gemini API, Google AI Studio un Vertex AI, ar SDK palīdzību pieejamu galvenajās valodās.
Kritēriju sadalījums
- 1M tokenu konteksta logs
- Multimodālais ievads: teksts, attēls, audio, video
- Nativs rīku izsaukums un koda izpilde
- Reāllaika straumēšanas atbildes
- Attēlu un audio ģenerēšana
- Pieejams caur Gemini API un Vertex AI



