Prošla bitka · 2026-08-01 UTC
LLM Obračun — 1. kolovoza 2026.
Iz kategorije LLM. 14 oznaka postavljeno među 5 boraca. DeepSeek R1 je preuzeo krunu.
Konačni poredak
Postava
Borci
Profili svakog alata koji se natjecao u ovoj bitci, rangirani prema konačnom rezultatu.

DeepSeek R1
Otvoreno-kodu veliki model jezika koji se izdvaja u razumevanju, matematicama i kođiranju uz dozvolu MIT za besplatan uporab i mijenjaj.

DeepSeek R1 je otvorenosloženi velik model beseda koji je izrazito dobr za zasnivanje zaključaka, rješavanje matematičkih problema i programsku podršku. Upotrebljava Mixture of Experts (MoE) arhitekturu sa 37 milijardama akcione mogućnosti i ukupno 671 milijardu paramtera, podržava dužinu konteksta do 128K slogova. Model uključuje napredne tehničke tehnike učenja sustava za postizanje samoupravljanja, multi-step refleksije i razumijevanja usmjerenih prema ljudima svojstava. DeepSeek R1 je učinio velik napredak u različitim benchmark testovima, uključujući 97,3 posto točnosti na MATH-500, 79,8 posto uspješnosti na AIME 2024, i je superiorniji u odnosu na 96,3 posto sudionika na Codeforces-u. Model je dostupan u mnogim varijantama, od 1,5 milijarde do 70 milijardi paramatera, i je ličen pod MIT licencom za besplatan uporab i modifikaciju. DeepSeek R1 može se upotrijebiti online besplatno, te je preporučena verzija podržava WebGPU za lokalno izvođenje u web pregledniku. Model je dizajniran za kompleksno rešavanje problema, razumijevanje više jezika i generiranje proizvodnog stepena koda. Svojim jakostima uključuje iznimno matematičko razumevanje, generiranje koda te mogućnosti razumijevanja prirodnog jezika. Međutim, kao otvorena-source model, moguće ga je potrebno kandidati tehničkom znanju za implementaciju i fino podešavanje za specifične primjene DeepSeek R1 je pozicioniran među najboljim performansama AI modela u svijetu, sa mogućnostima komparabilnima sa vodećim samostalnim rješenjima. Javno dostupan status omogućava zajednički pokretane razvojne procese i kontinuiranu updatiranje, uključujući planirana multimodalna podrška, poboljšanje konverzacije i optimizaciju distibuirane izvršbe. Model ima čistu razvojnu potporu učenja na nagradu, što mu omogućava dostići performanse u matematici na razini GPT-4-a sa znatno nižim troškovima. Kapacitet za vizualizaciju lanca razmišljanja adresa izazove "crne kutije" u AI, pružajućiinsighte u postupak modelove razičite. DeepSeek R1 nudi API endpoint kompatibilan s OpenAI, koji se može integrirati i koji se tara po 0,14 dolara po milijuni tokena. Težine modela su dostupne kao otvoreni kod, dozvoljavajući njihovu komercijalnu upotrebu i modifikaciju.
Razljepljivanje kriterija
- Mješanje stručnjaka (MoE) arhitektura
- Napredne tehnike učenja po utvrđivanju
- Autoverifikacija i više-koracna pogubljenja sposobnost
- Ljudski-aligeniran razumljivanje
- Potpora za duge kontekstačne dužine od 128K
- Otvoreni API-endpoint kompatibilan s OpenAI-om

Eye2.AI
Uredi odgovore s vrhunskim AI modelima rame uz rame s jednim upitom—besplatno, bez prijave.

Eye2.AI je alat za usporedbu multi-modela umjetne inteligencije koji korisnicima omogućava slanje jednog upita više vodećim velikim jezičnim modelima i pregled njihovih odgovora uzajamno. Time što ističe razlike u tonu, preciznosti, dubini i razumljivosti, pomaže korisnicima odlučiti koji model najbolje odgovara određenom zadatku bez plaćanja više pretplata. Usluga je besplatna za korištenje i ne zahtijeva račun, što smanjuje prepreke za povremeni eksperiment, istraživanje i brzo provjeru činjenica između različitih modela. Posebno je korisna za pisce, programere, studente i sve one koji su znatiželjni kako različiti sustavi umjetne inteligencije pristupaju istom pitanju.
Razljepljivanje kriterija
- Upitivanje više modela s jednim upitom
- Raspored odgovora rame uz rame
- Pristup vrhunskim AI modelima na jednom mjestu
- Nije potreban račun ni prijava
- Besplatno za korištenje
- Brzi radni tok eksperimentiranja s upitima

OpenAI o3
Najavljena jeje OpenAI-jeva napredna sposobnost razmišljanja za složene, više-korpuse problema razlučivanje

OpenAI o3 je napredni model rezonančne misli koji je dizajniran da pruži rješenja za probleme koji zahtijevaju pozornost i detaljan, korak-po-korak proces. On se oslanja na abecedni pristup smanjenja više računanja u vrijeme provedbe da bi kreirao, provjerio i dopunio odgovore, te se kao takav dobro uklopaju u zadatke u matematici, programiranju, znanosti i analizi logike. U poredbi s općim čvorovima za dijалог, o3 naglašava dubina umjesto brzine. Može razdijeliti neizvjesne potiče za razgovor, ocjeniti više pristupa, i proizvesti pouzdane rezultate na benchmarkima koji stresuju razmišljanje i korištenje alata. Razvojači mogu pristupiti mu kroz otvoreni API i ChatGPT, gdje se integrira s alatima kao što su pregled web stranica, Python i analiza datoteka. Model je namijenjen istraživačima, inženjerima i korisnicima koji zahtijevaju bolju točnost za teže probleme i koji su spremni zamijeniti neki od brzine i cijena za bolju kvalitetu rezultata.
Razljepljivanje kriterija
- Izdvojeni lanac razmišljanja za dugocasni problem razlučivanje
- Koristiti različitim dijelovima: kod, web, datoteke
- Veći kontekstni prozor za dugotrajne tekstove
- API i dostupnost ChatGPT-a
- Poboljšano točno tijeka na STEM benchmarkovima
- Podržava sloštene aktorske radnje
Pronoia
Arabski kao prvi veliki model jezika fine-tuniran za potpune kvalitete razumevanja i generacije nativnim kvalitetama.
Pronoia je veliki jezikovni model posebno fine-tuniran za arapski jezik, s ciljem boljeg razumijanja, generiranja i razmišljanja u jeziku nego što bi generalni multinacionalni modeli mogli ponuditi. Točno je različito postavljeno kao vodeći model baziran na većem jeziku, s optimaliziranjem dijalekata, klasičnog arapskog i moderne standardnog arapskog. Model se može upotrijebiti za zadaće kao što su stvaranje sadržaja, rezime, prevođenje, podrška kupcu, te konverzacijski AI u arapskom govornom tržištu. Koncentrirajući se na obuku s arapskim podacima, Pronoia ciljano pridobiva uočljive detalje kao što su oblik morfema, dijakritike i kulturni kontekst koji su širiji modeli rjeđe upotrebljavaju konsistentno.
Razljepljivanje kriterija
- Arabski-optimizirani model jezika
- Generiranje tekstova i sažimanje
- Podrška prijevodima
- Kapacitet za konverzacije i aplikacije robota za razgovor
- Prikladnost za poslovni sustav arabizirane NLPr (NLP arabizirano)
- Korisnost MSArh i dialektalnih govora

Gemini 2.0 Flash
Brza Googleova multi-modalna AI model za real-time agencije zadatake s 1M-token okruženom prozorom.

Gemini 2.0 Flash je sljedeće generacije model izraden od strane Google DeepMind-a, optimiziran za brzinu, skalu i više-modalno razmišljanje. On prihvaća tekst, slike, audio i video kao ulazne podatke i može generirati tekst, slike kao i audio izlaz, čime je pogodan za bogate interaktivne aplikacije. Dizajniran s namjerom agencijskih tokova rada, model podržava native koristanje alata, pozivanje funkcija te poznavanje 1M-token kontekstualnog okvira za rad s velikim dokumentima, kôd bazama ili dugotrajnim sesijama. Niska latentnost čini ga praktičnim izborom za asistente, real-time analizu i razvoju skale za proizvodnju. Programeri mogu pristupiti Gemini 2.0 Flash preko Gemini API-a, Google AI Studija i Vertex AI-a, sa SDK-ovima dostupnim na glavne jezike.
Razljepljivanje kriterija
- Bračni okružen 1M tokova
- Multimodalni ulaz: tekst
- slika
- audio
- video
- Nativa prijavnica poziva i koda izvršavanja



