Prošla bitka · 2024-01-17 UTC

LLM Obračun — 17. siječnja 2024.

Iz kategorije LLM. 37 oznaka postavljeno među 8 boraca. ASI:One je preuzeo krunu.

Konačni poredak

Postava

Borci

Profili svakog alata koji se natjecao u ovoj bitci, rangirani prema konačnom rezultatu.

1ASI:One logo

ASI:One

Agentni asistent umjetne inteligencije koji koordinira samostalne agente kako bi izvršio višekorakne taskove.

4.5 (4)
Besplatno
Slika od ASI:One

ASI:One je asistent AI koji je dizajniran oko pojma agencijske inteligencije, gdje je interaktivan dijaloški sučelje mogoće šalje i koordinira specializirane autonomne agente da riješe složene potrebe. Umjesto vratiti samo tekst, to može planirati, pozivati alate i izvršavati protokole rada na računalu korisnika. Razvijen unutar ekosustava Artificial Superintelligence Alliance, predstavljen je kao lični agent AI koji se integrira s decentraliziranim mrežama agenata. Korisnici mogu razgovarati s njim o svakodnevnom pitanjima ili delegirati dulje zadatke kao što su istraživanje, usporedba, planiranje i pretraživanje podataka u vezi s povezanim uslugama.

Razljepljivanje kriterija

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Interfejs za razgovor u obliku časa
  • Orkestracija samostalnih agenata
  • Planiranje i izvršavanje višekoraknih zadataka
  • Povezanost s vanjskim agentima i uslugama
  • Osobni asistentni stil memorije i konteksta
  • Izgrađen na stacku agenta ASI Alliance
2Gemini 2.0 Flash logo

Gemini 2.0 Flash

Brza Googleova multi-modalna AI model za real-time agencije zadatake s 1M-token okruženom prozorom.

4.6 (5)
Besplatno
Slika od Gemini 2.0 Flash

Gemini 2.0 Flash je sljedeće generacije model izraden od strane Google DeepMind-a, optimiziran za brzinu, skalu i više-modalno razmišljanje. On prihvaća tekst, slike, audio i video kao ulazne podatke i može generirati tekst, slike kao i audio izlaz, čime je pogodan za bogate interaktivne aplikacije. Dizajniran s namjerom agencijskih tokova rada, model podržava native koristanje alata, pozivanje funkcija te poznavanje 1M-token kontekstualnog okvira za rad s velikim dokumentima, kôd bazama ili dugotrajnim sesijama. Niska latentnost čini ga praktičnim izborom za asistente, real-time analizu i razvoju skale za proizvodnju. Programeri mogu pristupiti Gemini 2.0 Flash preko Gemini API-a, Google AI Studija i Vertex AI-a, sa SDK-ovima dostupnim na glavne jezike.

Razljepljivanje kriterija

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Bračni okružen 1M tokova
  • Multimodalni ulaz: tekst
  • slika
  • audio
  • video
  • Nativa prijavnica poziva i koda izvršavanja
3Mistral Small 3 logo

Mistral Small 3

Kompaktna otvorena LLM s konkurentskom performansom s manjim zahtjevima za računalo

4.5 (4)
Besplatno
Slika od Mistral Small 3

Mistral Small 3 je lagani veliki model jezika iz produktnog portfolija Mistral AI, koji je dizajniran kako bi nudio snažne zaključke i generacijske mogućnosti uz efikasno korištenje skromnog hardvera. Cilj je razvojača i organizacija koje žele sposobne AI bez troškova infrastrukture za modelima vrhunskog ranga. U otvorenom licenci razvijen, model se može samostalno hostovati, fine-tunirati i integrirati u komercijalne aplikacije. Njegova ravnoteža između brzine, točnosti i učinkovitosti u upotrebi resursa čini ga pogodnim za chat asistente, generiranje sadržaja, zadatke vezane za kôd i lokalne implementacije gdje je važno brzina odgovora ili privatnost.

Razljepljivanje kriterija

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Izdanje modela otvorenog vjećanja
  • Optimirano za efektivan inferenciju
  • Konkurentni rezultati benchmarka
  • Podržava oplemenjivanje i prilagođavanje
  • Uspješno pogodan za lokalnu instalaciju
  • Generiranje tekstualnih sadržaja više jezikâ
4OpenAI o3 logo

OpenAI o3

Najavljena jeje OpenAI-jeva napredna sposobnost razmišljanja za složene, više-korpuse problema razlučivanje

4.0 (4)
Besplatno
Slika od OpenAI o3

OpenAI o3 je napredni model rezonančne misli koji je dizajniran da pruži rješenja za probleme koji zahtijevaju pozornost i detaljan, korak-po-korak proces. On se oslanja na abecedni pristup smanjenja više računanja u vrijeme provedbe da bi kreirao, provjerio i dopunio odgovore, te se kao takav dobro uklopaju u zadatke u matematici, programiranju, znanosti i analizi logike. U poredbi s općim čvorovima za dijалог, o3 naglašava dubina umjesto brzine. Može razdijeliti neizvjesne potiče za razgovor, ocjeniti više pristupa, i proizvesti pouzdane rezultate na benchmarkima koji stresuju razmišljanje i korištenje alata. Razvojači mogu pristupiti mu kroz otvoreni API i ChatGPT, gdje se integrira s alatima kao što su pregled web stranica, Python i analiza datoteka. Model je namijenjen istraživačima, inženjerima i korisnicima koji zahtijevaju bolju točnost za teže probleme i koji su spremni zamijeniti neki od brzine i cijena za bolju kvalitetu rezultata.

Razljepljivanje kriterija

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Izdvojeni lanac razmišljanja za dugocasni problem razlučivanje
  • Koristiti različitim dijelovima: kod, web, datoteke
  • Veći kontekstni prozor za dugotrajne tekstove
  • API i dostupnost ChatGPT-a
  • Poboljšano točno tijeka na STEM benchmarkovima
  • Podržava sloštene aktorske radnje
5DeepSeek R1 logo

DeepSeek R1

Otvoreno-kodu veliki model jezika koji se izdvaja u razumevanju, matematicama i kođiranju uz dozvolu MIT za besplatan uporab i mijenjaj.

4.8 (4)
Besplatno
Slika od DeepSeek R1

DeepSeek R1 je otvorenosloženi velik model beseda koji je izrazito dobr za zasnivanje zaključaka, rješavanje matematičkih problema i programsku podršku. Upotrebljava Mixture of Experts (MoE) arhitekturu sa 37 milijardama akcione mogućnosti i ukupno 671 milijardu paramtera, podržava dužinu konteksta do 128K slogova. Model uključuje napredne tehničke tehnike učenja sustava za postizanje samoupravljanja, multi-step refleksije i razumijevanja usmjerenih prema ljudima svojstava. DeepSeek R1 je učinio velik napredak u različitim benchmark testovima, uključujući 97,3 posto točnosti na MATH-500, 79,8 posto uspješnosti na AIME 2024, i je superiorniji u odnosu na 96,3 posto sudionika na Codeforces-u. Model je dostupan u mnogim varijantama, od 1,5 milijarde do 70 milijardi paramatera, i je ličen pod MIT licencom za besplatan uporab i modifikaciju. DeepSeek R1 može se upotrijebiti online besplatno, te je preporučena verzija podržava WebGPU za lokalno izvođenje u web pregledniku. Model je dizajniran za kompleksno rešavanje problema, razumijevanje više jezika i generiranje proizvodnog stepena koda. Svojim jakostima uključuje iznimno matematičko razumevanje, generiranje koda te mogućnosti razumijevanja prirodnog jezika. Međutim, kao otvorena-source model, moguće ga je potrebno kandidati tehničkom znanju za implementaciju i fino podešavanje za specifične primjene DeepSeek R1 je pozicioniran među najboljim performansama AI modela u svijetu, sa mogućnostima komparabilnima sa vodećim samostalnim rješenjima. Javno dostupan status omogućava zajednički pokretane razvojne procese i kontinuiranu updatiranje, uključujući planirana multimodalna podrška, poboljšanje konverzacije i optimizaciju distibuirane izvršbe. Model ima čistu razvojnu potporu učenja na nagradu, što mu omogućava dostići performanse u matematici na razini GPT-4-a sa znatno nižim troškovima. Kapacitet za vizualizaciju lanca razmišljanja adresa izazove "crne kutije" u AI, pružajućiinsighte u postupak modelove razičite. DeepSeek R1 nudi API endpoint kompatibilan s OpenAI, koji se može integrirati i koji se tara po 0,14 dolara po milijuni tokena. Težine modela su dostupne kao otvoreni kod, dozvoljavajući njihovu komercijalnu upotrebu i modifikaciju.

Razljepljivanje kriterija

Ease of use0
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Mješanje stručnjaka (MoE) arhitektura
  • Napredne tehnike učenja po utvrđivanju
  • Autoverifikacija i više-koracna pogubljenja sposobnost
  • Ljudski-aligeniran razumljivanje
  • Potpora za duge kontekstačne dužine od 128K
  • Otvoreni API-endpoint kompatibilan s OpenAI-om
6DeepSeek V3 logo

DeepSeek V3

Otvoreni model mješavine stručnjaka koji nudi razumijevanje na razini GPT-4o po fragmentu troška.

4.8 (6)
Besplatno
Slika od DeepSeek V3

DeepSeek V3 je velika, hibridna jezična inteligencija (mixture-of-experts, MoE) koju je razvila tvrtka DeepSeek AI. Ona aktivira samo podskup svojih ukupnih parametara po token, što joj omogućava da postigne snažne rezultate u razumijevanju, matematici i programskim zadacima, a istovremeno podržava znatno niže trošak inferencije u usporedbi s gustim modelima. Objavljen s otvorenim tezginama, DeepSeek V3 je postao popularan izbor za razvijatelje i istraživače koji trebaju sposoban osnovni model koji mogu samostalno hostati, fino podešiti ili integrirati putem API-ja. Benchmarkovi ga stavljaju u konkurentski odnos prema vodećim privatnim modelima poput GPT-4o, posebno na ocjenama matematike i logičkog razumljivaњa. Model je dobro prilagođen tehničkim asistentima, cjevovodima za generiranje koda, istraživačkim radnim tokovima i svim aplikacijama u kojima kvaliteta razumljivosti i efikasnost proračuna imaju istovremeno važnu ulogu.

Razljepljivanje kriterija

Ease of use1
Value for money1
Features & power0
Integrations0
Support & docs1
Reliability0
  • Arhitektura mješavine stručnjaka
  • Konkurentno razumijevanje i matematički benchmarki
  • Otvoreni modele težina
  • Pristup API-u putem platforme DeepSeek
  • Podrška za dugi kontekstualni prozor
  • Prijateljski za fino podešavanje
7Llama 3.3 logo

Llama 3.3

Metaova multinacionalna otvorena težina LLM za potrebama učinkovitog i visokokvalitetnog tekstualnog generiranja.

4.8 (5)
Besplatno
Slika od Llama 3.3

Llama 3.3 je veliki jezikovni model iz programa Meta, dizajniran za izradu jake analitičke skupoće, programiranje i mnogojezične funkcionalnosti, dok je energije koje zahtijeva znatno manja od ranijih zalogajnih modela. Podržava širok spektar jezika i pogodan je za korisnike koji žele razviti razgovorne asiste, sadržaj za generaciju, prezentaciju ukratko i tools za razvojnera i različite druge primjene. Objavljen s otvorenim težinama, može se instalirati na lokaciji ili kroz glavne cloud i provjere pružatelje, što pruža timovima fleksibilnost u pogledu cijena, lagana komunikacija i obrada podataka. Njegova podrška preko uputa je optimalizirana za ispravno slijeganje uputa i proizvodnju korisnih, konverzacija odgovora. Programeri često koriste Llama 3.3 kao osnovu za fine-tuniranje domenski specifičnih aplikacija, sustava za generiranje i preuzimanje podrške te agenčkih radnih tokova.

Razljepljivanje kriterija

Ease of use0
Value for money0
Features & power1
Integrations1
Support & docs1
Reliability0
  • Multiljezička tekstualna generacija
  • Instrukcija-trenažirani chat variant
  • Dugi kontekst podrška
  • Umišljene mogućnosti za programiranje i mišljenje
  • Otvorena težina za fino-tuniranje
  • Sudioni s većim glavnim upravljačkim okvirima
8Pronoia logo

Pronoia

Arabski kao prvi veliki model jezika fine-tuniran za potpune kvalitete razumevanja i generacije nativnim kvalitetama.

4.7 (6)
Besplatno

Pronoia je veliki jezikovni model posebno fine-tuniran za arapski jezik, s ciljem boljeg razumijanja, generiranja i razmišljanja u jeziku nego što bi generalni multinacionalni modeli mogli ponuditi. Točno je različito postavljeno kao vodeći model baziran na većem jeziku, s optimaliziranjem dijalekata, klasičnog arapskog i moderne standardnog arapskog. Model se može upotrijebiti za zadaće kao što su stvaranje sadržaja, rezime, prevođenje, podrška kupcu, te konverzacijski AI u arapskom govornom tržištu. Koncentrirajući se na obuku s arapskim podacima, Pronoia ciljano pridobiva uočljive detalje kao što su oblik morfema, dijakritike i kulturni kontekst koji su širiji modeli rjeđe upotrebljavaju konsistentno.

Razljepljivanje kriterija

Ease of use0
Value for money1
Features & power0
Integrations1
Support & docs0
Reliability0
  • Arabski-optimizirani model jezika
  • Generiranje tekstova i sažimanje
  • Podrška prijevodima
  • Kapacitet za konverzacije i aplikacije robota za razgovor
  • Prikladnost za poslovni sustav arabizirane NLPr (NLP arabizirano)
  • Korisnost MSArh i dialektalnih govora