Minulý súboj · 2026-08-01 UTC
LLM Súboj — 1. augusta 2026
Z kategórie LLM. 14 body udelených medzi 5 bojovníkov. DeepSeek R1 získal korunu.
Konečné poradie
Zostava
Bojovníci
Profily každého nástroja, ktorý súťažil v tomto súboji, zoradené podľa ich konečného skóre.

DeepSeek R1
Open-source veľký jazykový model excelujúci v úsudku, matematike a kódovacích úlohách s licenciou MIT pre bezplatné použitie a úpravu.

DeepSeek R1 je open-source veľký jazykový model, ktorý vyniká v úlohách uvažovania, matematiky a kódovania. Využíva architektúru Mixture of Experts (MoE) s 37B aktívnymi parametrami a 671B celkovými parametrami, podporujúc dĺžku kontextu 128K. Model využíva pokročilé techniky posilňovania učenia pre dosiahnutie samooverenia, viacstupňovej reflexie a ľudsky zosúladených schopností uvažovania. DeepSeek R1 dosiahol najmodernejší výkon v rôznych benchmarkoch, vrátane 97,3% presnosti na MATH-500, 79,8% miery úspešnosti na AIME 2024 a prekonaní 96,3% účastníkov Codeforces. Model je dostupný v niekoľkých variantoch, od 1,5B do 70B parametrov, a je licencovaný pod MIT pre bezplatné použitie a úpravy. DeepSeek R1 možno používať online zadarmo a WebGPU-urýchlená verzia môže bežať lokálne v prehliadači. Model je navrhnutý pre komplexné riešenie problémov, viacjazyčné porozumenie a generovanie kódu na produkčnej úrovni. Jeho silné stránky zahŕňajú výnimočné matematické uvažovanie, schopnosti generovania kódu a porozumenia prirodzenému jazyku. Avšak ako open-source model môže vyžadovať technické znalosti na nasadenie a dolaďovanie pre konkrétne prípady použitia. DeepSeek R1 sa umiestňuje medzi najlepšie výkonné modely umelej inteligencie na celom svete, s možnosťami porovnateľnými s poprednými proprietárnymi riešeniami. Jeho otvorený zdrojový kód umožňuje vývoj komunitou a neustále vylepšovanie, vrátane plánovanej multimodálnej podpory, konverzačného vylepšenia a optimalizácie distribuovaného odvodenia. Model má čistý vývoj založený na posilňovacom učení, čo mu umožňuje dosiahnuť výkonnosť úrovne GPT-4 v matematike za výrazne nižšie náklady. Funkcia vizualizácie reťazca myšlienok rieši výzvy AI „čiernej skrinky“ a poskytuje informácie o procese uvažovania modelu. API služby DeepSeek R1 ponúka OpenAI-kompatibilný endpoint pre integráciu, ktorý je ocenený na 0,14 dolárov za milión tokenov. Hmotnosti modelu sú open-source, čo umožňuje komerčné využitie a úpravy.
Rozdelenie kritérií
- Architektúra Mixture of Experts (MoE)
- Pokročilé techniky posilňovania učenia
- Schopnosti samo-verifikácie a viac-krokových úvah
- Ludzky zhodou zameraný úsudok
- Podpora pre 128K dĺžku kontextu
- OpenAI-kompatibilný API endpoint

Eye2.AI
Porovnajte odpovede z najlepších AI modelov vedľa seba s jediným podnetom — zadarmo, bez registrácie.

Eye2.AI je nástroj na porovnávanie viacerých AI modelov, ktorý umožňuje používateľom odoslať jeden podnet niekoľkým popredným veľkým jazykovým modelom a zobraziť ich odpovede vedľa seba. Zobrazovaním rozdielov v tóne, presnosti, hĺbke a uvažovaní pomáha používateľom rozhodnúť, ktorý model najlepšie vyhovuje danej úlohe bez platenia za viacero predplatných. Táto služba je zadarmo a nevyžaduje si účet, čím znižuje prekážku pre neformálne experimentovanie, výskum a rýchle overovanie faktov naprieč modelmi. Je obzvlášť užitočná pre písateľov, vývojárov, študentov a kohokoľvek zvedavého na to, ako rôzne AI systémy pristupujú k tej istej otázke.
Rozdelenie kritérií
- Dopytovanie viacerých modelov jednou otázkou
- Rozloženie odpovedí vedľa seba
- Prístup k popredným AI modelom na jednom mieste
- Nie je potrebný účet alebo prihlásenie
- Zadarmo
- Rýchly pracovný postup experimentovania s otázkami


OpenAI o3 je špičkový model uvažovania navrhnutý na riešenie problémov, ktoré vyžadujú starostlivé, krok za krokom myslenie. Stavia na prístupe o-série, ktorý využíva viac výpočtovej kapacity počas inferencie na plánovanie, overovanie a vylepšovanie odpovedí, čo ho robí vhodným pre úlohy v matematike, programovaní, vede a logickej analýze. Na rozdiel od všeobecných chatovacích modelov kladie o3 dôraz na hĺbku namiesto rýchlosti. Dokáže rozložiť nejednoznačné výzvy, vyhodnotiť viacero prístupov a poskytovať spoľahlivejšie výstupy na benchmarkoch, ktoré testujú uvažovanie a používanie nástrojov. Vývojári ho môžu používať cez OpenAI API a ChatGPT, kde je integrovaný s nástrojmi ako webové prehliadanie, Python a analýza súborov. Model je určený pre výskumníkov, inžinierov a pokročilých používateľov, ktorí potrebujú vyššiu presnosť pri riešení náročných úloh a sú ochotní akceptovať vyššiu latenciu a cenu výmenou za kvalitnejšie výsledky.
Rozdelenie kritérií
- Rozšírené uvažovanie v reťazci myšlienok
- Používanie nástrojov vrátane kódu, webu a vstupov zo súborov
- Veľké okno kontextu pre dlhé dokumenty
- Dostupnosť cez API a ChatGPT
- Zlepšená presnosť na STEM benchmarkoch
- Podporuje komplexné agentné pracovné toky
Pronoia
Arabsky orientovaný veľký jazykový model jemne doladený pre porozumenie a generovanie na úrovni rodeného hovoriaceho.
Pronoia je veľký jazykový model špecificky doladený pre arabský jazyk, zameraný na poskytovanie presnejšieho porozumenia, generovania a uvažovania v tomto jazyku ako všeobecné viacjazyčné modely. Je umiestnený ako popredný arabsko-zameraný LLM s optimalizáciami pre dialekty, klasické formy a moderný štandardný arabský jazyk. Model môže byť použitý pre úlohy ako je vytváranie obsahu, sumarizácia, preklad, zákaznícka podpora a konverzačná AI na arabsky hovoriacich trhoch. Koncentráciou svojho tréningu na arabské dáta sa Pronoia zameriava na nuansy ako je morfológia, diakritika a kultúrny kontext, ktoré širšie modely často zvládajú nekonzistentne.
Rozdelenie kritérií
- Arabsky optimalizovaný jazykový model
- Generovanie textu a sumarizácia
- Podpora prekladu
- Konverzačné a chatbotové schopnosti
- Vhodný pre podnikovú arabskú NLP
- Pokrytie MSA a dialektov

Gemini 2.0 Flash
Rýchly, multimodálny AI model od Google, navrhnutý pre agentické úlohy v reálnom čase s kontextovým oknom 1M tokenov.

Gemini 2.0 Flash je ďalšia generácia modelu Google DeepMind optimalizovaná pre rýchlosť, rozsah a multimodálne uvažovanie. Prijíma text, obrázky, zvuk a video ako vstup a môže vygenerovať výstup vo forme textu, obrázkov a zvuku, čo ho robí vhodným pre bohaté interaktívne aplikácie. Navrhnutý s ohľadom na agenty pracovné postupy, model podporuje natívne použitie nástrojov, volanie funkcií a 1M-tokenové okno kontextu pre spracovanie veľkých dokumentov, kódových základov alebo dlhodobo prebiehajúcich session. Nízka latencia ho robí praktickou voľbou pre asistenty, analýzy v reálnom čase a nasadenia v produkčnom rozsahu. Vývojári môžu pristupovať k Gemini 2.0 Flash prostredníctvom Gemini API, Google AI Studio a Vertex AI, pričom SDK sú k dispozícii pre väčšinu hlavných jazykov.
Rozdelenie kritérií
- 1M-tokenové kontextové okno
- Multimodálny vstup: text, obrázok, audio, video
- Rovinné volanie nástrojov a vykonávanie kódu
- Reálny časový streaming odpovedí
- Generovanie obrázkov a audio
- Dostupné cez Gemini API a Vertex AI



