Pretekla bitka · 2026-08-01 UTC
LLM Obračun — 1. avgust 2026
Iz kategorije LLM. 14 oznake postavljenih med 5 borci. DeepSeek R1 je osvojil krono.
Končna razvrstitev
Postava
Borci
Profili vsakega orodja, ki je tekmovalo v tej bitki, razvrščeni po končnem rezultatu.

DeepSeek R1
Odprtokodni veliki jezikovni model, ki izstopa pri razmišljanju, matematiki in programiranju, z licenco MIT za brezplačno uporabo in spreminjanje.

DeepSeek R1 je odprtokodni veliki jezikovni model, ki izstopa pri razmišljanju, matematiki in programiranju. Uporablja arhitekturo Mixture of Experts (MoE) s 37 B aktivnimi parametri in 671 B skupnimi parametri, podpora za 128 K dolžino konteksta. Model vključuje napredne tehnike okrepitvenega učenja, da doseže samoverifikacijo, večkorakovno refleksijo in razmišljanje usklajeno s človekom. DeepSeek R1 je dosegel state-of-the-art zmogljivost v različnih benchmarkih, vključno s 97,3 % natančnostjo na MATH‑500, 79,8 % stopnjo uspešnosti na AIME 2024 ter prehitel 96,3 % udeležencev Codeforces. Model je na voljo v več različicah, od 1,5 B do 70 B parametrov, in je licenciran pod MIT za brezplačno uporabo in spreminjanje. DeepSeek R1 lahko uporabljate brezplačno na spletu, različica, ki izkorišča WebGPU, pa lahko teče lokalno v brskalniku. Model je zasnovan za reševanje kompleksnih problemov, večjezično razumevanje in generiranje kode proizvodne kakovosti. Njegove prednosti vključujejo izjemno matematično razmišljanje, generiranje kode ter sposobnosti naravnega jezikovnega razumevanja. Vendar pa kot odprtokodni model lahko zahteva tehnično strokovnost za njegovo namestitev in fino nastavljanje za specifične primere uporabe. DeepSeek R1 se uvršča med vrhunske AI modele po vsem svetu, s sposobnostmi, ki so primerljive z vodilnimi lastniškimi rešitvami. Njegova open‑source narava omogoča razvoj, ki ga poganja skupnost, in stalne nadgradnje, vključno s načrtovano multimodalno podporo, izboljšanjem konverzacijskih zmogljivosti ter optimizacijo porazdeljene inferenčne. Model ima čisto reinforcement learning razvoj, kar mu omogoča doseganje matematične zmogljivosti na nivoju GPT-4 po precej nižjih stroških. Možnost vizualizacije chain-of-thought naslavlja izzive AI "black box" in zagotavlja vpogled v proces razmišljanja modela. DeepSeek R1-jev API ponuja OpenAI‑kompatibilno končno točko za integracijo po ceni $0.14 na milijon žetonov. Teže modela so odprtokodne, kar omogoča komercialno uporabo in spreminjanje.
Razdelitev kriterijev
- Arhitektura Mešanice strokovnjakov (MoE)
- Napredne tehnike okrepljenega učenja
- Samospreverjanje in večkorakovne refleksijske zmožnosti
- Razmišljanje usklajeno z ljudmi
- Podpora za dolžino konteksta 128 K
- API končna točka, združljiva z OpenAI

Eye2.AI
Primerjajte odgovore vrhunskih AI modelov drug ob drugem z enim pozivom — brezplačno, brez registracije.

Eye2.AI je orodje za primerjavo več AI modelov, ki uporabnikom omogoča, da pošljejo en prompt več vodilnim velikim jezikovnim modelom in si ogledajo njihove odzive ob strani. S tem, ko izpostavlja razlike v tonu, natančnosti, globini in logiki, pomaga uporabnikom izbrati, kateri model najbolje ustreza določenemu opravilu, brez plačevanja več naročnin. Storitev je brezplačna za uporabo in ne zahteva računa, kar znižuje oviro za neformalno eksperimentiranje, raziskave in hitro preverjanje dejstev med modeli. Posebej je uporabna za pisatelje, razvijalce, študente in vse, ki jih zanima, kako različni AI sistemi pristopajo k isti vprašanje.
Razdelitev kriterijev
- Poizvedovanje po več modelih z enim pozivom
- Postavitev odgovorov eno ob drugem
- Dostop do najboljših AI modelov na enem mestu
- Ni potrebe po računu ali prijavi
- Brezplačna uporaba
- Hitro eksperimentiranje s pozivi

OpenAI o3
OpenAI-jev napredni model razmišljanja za zapletene, večkorakovne rešitve problemov

OpenAI o3 je napredni model za razmišljanje, zasnovan za reševanje problemov, ki zahtevajo skrbno, korak‑po‑koraku razmišljanje. Temelji na pristopu o‑serije, pri katerem se med inferenčnim časom porabi več računalniške moči za načrtovanje, preverjanje in izpopolnjevanje odgovorov, kar ga naredi posebej primernega za naloge iz matematike, programiranja, znanosti in logične analize. V primerjavi s splošno namenjenimi klepetalnimi modeli o3 poudarja globino pred hitrostjo. Sposoben je razčleniti nejasna navodila, oceniti več pristopov in proizvesti bolj zanesljive rezultate na testih, ki poudarjajo razmišljanje in uporabo orodij. Razvijalci mu lahko dostopajo prek OpenAI API-ja in ChatGPT, kjer se integrira z orodji, kot so brskanje po spletu, Python in analiza datotek. Model je namenjen raziskovalcem, inženirjem in naprednim uporabnikom, ki potrebujejo višjo natančnost pri zahtevnih problemih in so pripravljeni sprejeti nekaj zakasnitve ter višje stroške v zameno za rezultate višje kakovosti.
Razdelitev kriterijev
- Razširjeno razmišljanje v verigi misli
- Uporaba orodij, vključno s kodnimi, spletnimi in datotečnimi vnosi
- Veliko kontekstno okno za dolge dokumente
- API in razpoložljivost ChatGPT
- Izboljšana natančnost na STEM benchmarkih
- Podpira zapletene agentne delovne tokove
Pronoia
Arabsko-centriran velik jezikovni model, prilagojen za razumevanje in generiranje z materni kakovostjo.
Pronoia je velik jezikovni model, posebej fino prilagojen arabščini, ki cilja na natančnejše razumevanje, generiranje in sklepanja v jeziku kot splošni večjezični modeli. Je vodilni arabsko-osredotočen LLM, ki je optimiziran za dialekte, klasične oblike in sodobni standardni arabski jezik. Model se lahko uporablja za naloge, kot so ustvarjanje vsebin, povzemanje, prevajanje, podpora strankam in pogovorna AI na trgih, ki govorijo po arabskem jeziku. Z usmeritvijo svojega usposabljanja na arabskih podatkih Pronoia zajema subtilnosti, kot so morfologija, diakritični znaki in kulturni kontekst, ki jih širši modeli pogosto obravnavajo neskladno.
Razdelitev kriterijev
- Arabsko optimiziran jezikovni model
- Generiranje besedil in povzemanje
- Podpora za prevajanje
- Možnosti pogovornega in chatbot-a
- Prilagojen za poslovno NLP v arabščini
- Pokriva sodobno standardno arabščino in dialekte

Gemini 2.0 Flash
Googleov hiter, multimodalni AI model, zasnovan za naloge v realnem času z 1M-token oknom konteksta.

Gemini 2.0 Flash je naslednje generacije model podjetja Google DeepMind, optimiziran za hitrost, obseg in multimodalno razmišljanje. Sprejema besedilo, slike, zvok in video kot vhod ter lahko generira besedilo, slike in zvočni izhod, kar ga naredi primernega za bogate interaktivne aplikacije. Oblikovan z mislijo na agentske delovne tokove, model podpira izvorno uporabo orodij, klicanje funkcij in kontekstno okno s 1M‑tokeni za obravnavo velikih dokumentov, kodebaza ali dolgoročne seje. Nizka zakasnitev ga naredi praktično izbiro za asistente, analizo v realnem času in implementacije v produkcijskem merilu. Razvijalci lahko dostopajo do Gemini 2.0 Flash prek Gemini API, Google AI Studio in Vertex AI, pri čemer so SDK‑ji na voljo v večini glavnih jezikov.
Razdelitev kriterijev
- Okno konteksta 1M-tokenov
- Multimodalni vhod: besedilo, slika, zvok, video
- Izvirno klicanje orodij in izvajanje kode
- Odgovori v realnem času s pretakanjem
- Ustvarjanje slik in zvoka
- Na voljo prek Gemini API in Vertex AI



