Minulý súboj · 2025-08-08 UTC
LLM Súboj — 8. augusta 2025
Z kategórie LLM. 28 body udelených medzi 6 bojovníkov. DeepSeek V3 získal korunu.
Konečné poradie
Zostava
Bojovníci
Profily každého nástroja, ktorý súťažil v tomto súboji, zoradené podľa ich konečného skóre.

DeepSeek V3
DeepSeek V3 - Open zahájanie, zvyšenie kvality obmedzenia a výhradne náročných též aplikácií.

DeepSeek V3 je rozsiahly jazykový model typu zmes expertov (MoE) vyvinutý spoločnosťou DeepSeek AI. Aktivuje len podmnožinu svojich celkových parametrov na token, čo mu umožňuje dosiahnuť vysoký výkon v úlohách uvažovania, matematiky a kódovania, zatiaľ čo náklady na inferenciu sú výrazne nižšie ako pri porovnateľných hustých modeloch. Vydaný s otvorenými váhami, DeepSeek V3 sa stal populárnou voľbou pre vývojárov a výskumníkov, ktorí potrebujú schopný základný model, ktorý môžu sami hostiť, dolaďovať alebo integrovať cez API. Benchmarky ho umiestňujú súťaživo proti popredným proprietárnym modelom ako GPT-4o, najmä pri hodnoteniach matematiky a logického uvažovania. Model je vhodný pre technických asistentov, potrubia generovania kódu, výskumné pracovné postupy a všetky aplikácie, kde záleží na kvalite uvažovania a efektivite rozpočtu.
Rozdelenie kritérií
- Architektúra Mixture-of-experts
- Konkurenčné benchmarky uvažovania a matematiky
- Open-source modelové váhy
- Prístup k API cez platformu DeepSeek
- Podpora dlhého kontextového okna
- Priateľské k jemnému ladeniu

Janus pro
Open multimodálny model DeepSeeku pre generovanie obrázkov a vizuálne porozumenie v jednej zjednotenej architektúre.

Janus Pro je open-source multimodálny model AI od DeepSeeku, dostupný vo verziách s 1B a 7B parametrami. Zjednotuje vizuálne porozumenie a generovanie obrázkov v jednom rámci tým, že oddeluje cesty vizuálneho kódovania, čo umožňuje modelu interpretovať obrázky aj vytvárať ich z textových výziev. 7B variant dosahuje konkurencieschopné výsledky na benchmarkoch pre text-to-image syntézu a vizuálne otázky a odpovede, často sa vyrovnávajúc alebo prevyšujúc väčšie špecializované modely. Uvedený pod licenciou MIT môže byť Janus Pro self-hostovaný, jemne vyladený a integrovaný do výskumných alebo produkčných potrubí bez obmedzení používania. Je vhodný pre vývojárov, výskumníkov a nadšencov, ktorí potrebujú flexibilný multimodálny základný model pre experimentovanie, prototypovanie alebo vytváranie aplikácií, ktoré kombinujú vytváranie obrázkov s ich porozumením.
Rozdelenie kritérií
- Generovanie obrázkov z textu
- Vizuálne otázky a odpovede a analýza obrázkov
- Zjednotená architektúra transformátorov
- Možnosti 1B a 7B parametrov
- Open weights s licenciou MIT
- Podpora multimodálnych vstupov a výstupov

DeepSeek R1
Open-source veľký jazykový model excelujúci v úsudku, matematike a kódovacích úlohách s licenciou MIT pre bezplatné použitie a úpravu.

DeepSeek R1 je open-source veľký jazykový model, ktorý vyniká v úlohách uvažovania, matematiky a kódovania. Využíva architektúru Mixture of Experts (MoE) s 37B aktívnymi parametrami a 671B celkovými parametrami, podporujúc dĺžku kontextu 128K. Model využíva pokročilé techniky posilňovania učenia pre dosiahnutie samooverenia, viacstupňovej reflexie a ľudsky zosúladených schopností uvažovania. DeepSeek R1 dosiahol najmodernejší výkon v rôznych benchmarkoch, vrátane 97,3% presnosti na MATH-500, 79,8% miery úspešnosti na AIME 2024 a prekonaní 96,3% účastníkov Codeforces. Model je dostupný v niekoľkých variantoch, od 1,5B do 70B parametrov, a je licencovaný pod MIT pre bezplatné použitie a úpravy. DeepSeek R1 možno používať online zadarmo a WebGPU-urýchlená verzia môže bežať lokálne v prehliadači. Model je navrhnutý pre komplexné riešenie problémov, viacjazyčné porozumenie a generovanie kódu na produkčnej úrovni. Jeho silné stránky zahŕňajú výnimočné matematické uvažovanie, schopnosti generovania kódu a porozumenia prirodzenému jazyku. Avšak ako open-source model môže vyžadovať technické znalosti na nasadenie a dolaďovanie pre konkrétne prípady použitia. DeepSeek R1 sa umiestňuje medzi najlepšie výkonné modely umelej inteligencie na celom svete, s možnosťami porovnateľnými s poprednými proprietárnymi riešeniami. Jeho otvorený zdrojový kód umožňuje vývoj komunitou a neustále vylepšovanie, vrátane plánovanej multimodálnej podpory, konverzačného vylepšenia a optimalizácie distribuovaného odvodenia. Model má čistý vývoj založený na posilňovacom učení, čo mu umožňuje dosiahnuť výkonnosť úrovne GPT-4 v matematike za výrazne nižšie náklady. Funkcia vizualizácie reťazca myšlienok rieši výzvy AI „čiernej skrinky“ a poskytuje informácie o procese uvažovania modelu. API služby DeepSeek R1 ponúka OpenAI-kompatibilný endpoint pre integráciu, ktorý je ocenený na 0,14 dolárov za milión tokenov. Hmotnosti modelu sú open-source, čo umožňuje komerčné využitie a úpravy.
Rozdelenie kritérií
- Architektúra Mixture of Experts (MoE)
- Pokročilé techniky posilňovania učenia
- Schopnosti samo-verifikácie a viac-krokových úvah
- Ludzky zhodou zameraný úsudok
- Podpora pre 128K dĺžku kontextu
- OpenAI-kompatibilný API endpoint

ASI:One
Agenticí AI asistent je danou pracovnou helou, ktorá špecializuje sa na agentovia obyvateľského typu, ktorú orchehuje a zaútočuje na hlúčené úlohy a úklidy:

ASI:One je umelý asistent postavený okolo konceptu agenskej inteligencie, kde konverzačné rozhranie môže odosielať a koordinovať špecializované autonómne agenty pre spracovanie zložitých požiadaviek. Namiesto vrátenia iba textu môže plánovať, volať nástroje a vykonávať pracovné postupy v mene používateľa. Vyvinuté v rámci ekosystému Artificial Superintelligence Alliance, je pozicionované ako osobný AI agent, ktorý sa integruje s decentralizovanými sieťami agentov. Používatelia s ním môžu chatovať o každodenných otázkach alebo delegovať dlhšie úlohy, ako je výskum, porovnávania, plánovanie a vyhľadávanie údajov cez pripojené služby.
Rozdelenie kritérií
- Konverzácia a hovory slabby: Kódače zvládá úlohy a výhrady
- Podpora agentov slabého typu
- Rozpoznavanie hlúčených úloh a orchestracie agentov
- Integrovanie s agentovia odpočinkového typu
- Zvládajúci slabé inštrukcia a zaúčtovanie výhrady
- Orquestrační obrázky a slabé slovenské alebo inho rekhvézia


Najnovší DeepSeek R2 je nástupcom modelu DeepSeek R1 zameraného na uvažovanie, ktorý má za cieľ poskytnúť silnejšie postupné riešenie problémov v oblasti matematiky, kódovania a analytických úloh. Rozširuje otvorený výskumný prístup, ktorý umožnil skorším vydaniam DeepSeek získať popularitu medzi vývojármi a výskumníkmi. Model sa zameria na zlepšenú presnosť, dlhšie spracovanie kontextu a efektívnejšie odvodenie v porovnaní so svojím predchodcom, čo ho robí vhodným pre technických asistentov, agentové pracovné postupy a integráciu do vlastných aplikácií. Dostupnosť a presné špecifikácie závisia od oficiálnych kanálov DeepSeek. Používatelia zvyčajne majú prístup k modelu prostredníctvom rozhrania API, chatového rozhrania alebo spustením otvorených váh, kde sú poskytnuté, čo umožňuje flexibilitu pre individuálne experimentovanie aj produkčné nasadenie.
Rozdelenie kritérií
- Pokročilé chain-of-thought reasoning
- Rozšírené okno kontextu
- Podpora generovania a ladenia kódu
- Viacjazyčné porozumenie
- Prístup cez API a chat
- Vhodné pre agentické aplikácie
Pronoia
Arabsky orientovaný veľký jazykový model jemne doladený pre porozumenie a generovanie na úrovni rodeného hovoriaceho.
Pronoia je veľký jazykový model špecificky doladený pre arabský jazyk, zameraný na poskytovanie presnejšieho porozumenia, generovania a uvažovania v tomto jazyku ako všeobecné viacjazyčné modely. Je umiestnený ako popredný arabsko-zameraný LLM s optimalizáciami pre dialekty, klasické formy a moderný štandardný arabský jazyk. Model môže byť použitý pre úlohy ako je vytváranie obsahu, sumarizácia, preklad, zákaznícka podpora a konverzačná AI na arabsky hovoriacich trhoch. Koncentráciou svojho tréningu na arabské dáta sa Pronoia zameriava na nuansy ako je morfológia, diakritika a kultúrny kontext, ktoré širšie modely často zvládajú nekonzistentne.
Rozdelenie kritérií
- Arabsky optimalizovaný jazykový model
- Generovanie textu a sumarizácia
- Podpora prekladu
- Konverzačné a chatbotové schopnosti
- Vhodný pre podnikovú arabskú NLP
- Pokrytie MSA a dialektov




