Korábbi csata · 2024-01-17 UTC
LLM Leszámolás — 2024. január 17.
A(z) LLM kategóriából. 37 jelölés elhelyezve 8 versenyző között. ASI:One szerezte meg a koronát.
Végeredmény
A felállás
A versenyzők
Minden eszköz profilja, amely ebben a csatában versenyzett, a végső pontszámuk szerint rangsorolva.

ASI:One
Agentikus AI-asszisztens, amely koordinálja az autonóm ügynököket többlépcsős feladatok elvégzéséhez.

ASI:One egy AI asszisztens, amely az agentikus intelligencia koncepciójára épül, ahol egy konverzációs felület képes feladatokat delegálni és koordinálni specializált autonóm ügynököket a komplex kérések kezelésére. Csak szöveget nem ad vissza, hanem tervez, eszközöket hív meg, és munkafolyamatokat hajt végre a felhasználó nevében. Az Artificial Superintelligence Alliance ökoszisztémáján belül fejlesztették, személyes AI ügynökként helyezkedik el, amely integrálódik a decentralizált ügynökségi hálózatokkal. A felhasználók mindennapi kérdéseire cseveghetnek vele, vagy hosszabb feladatokat (kutatás, összehasonlítás, ütemezés, adatlekérdezés) delegálhatnak kapcsolódó szolgáltatásokon keresztül.
Kritériumok szétosztása
- Konverzációs chat felület
- Autonóm ügynökök összehangolása
- Többlépcsős feladattervezés és végrehajtás
- Kapcsolódás külső ügynökökhöz és szolgáltatásokhoz
- Személyre szabott asszisztens stílusú memória és kontextus
- Az ASI Alliance ügynök-alkatrészekre épít

Gemini 2.0 Flash
A Google gyors, multimodális AI modellje épül a valós idejű agens feladatokhoz 1M-ből álló kontextablakkal.

A Gemini 2.0 Flash a Google DeepMind következő generációs modellje, amely a sebesség, a skálázhatóság és a multimodális érvelés optimalizálására lett tervezve. Szöveget, képeket, hangot és videót fogad bemenetként, és szöveg, kép és hang kimenetet tud generálni, így alkalmas gazdag interaktív alkalmazásokhoz. Az ügynöki munkafolyamatokra tervezve, a modell támogatja a natív eszközhasználatot, a függvényhívást, és egy 1 M tokenes kontextusablakot, amely nagy dokumentumok, kódbázisok vagy hosszú futású munkamenetek kezelésére alkalmas. Az alacsony késleltetés praktikus választássá teszi asszisztensek, valós idejű elemzés és termelési méretű üzembe helyezések számára. A fejlesztők a Gemini 2.0 Flash-hez a Gemini API-n, a Google AI Studio-ban és a Vertex AI-n keresztül férhetnek hozzá, SDK-k pedig a főbb nyelveken elérhetők.
Kritériumok szétosztása
- 1M-tokén kontextablak
- Multimodális input: szöveg, kép, audió, vizio
- Natív műszerhívás és kód futtatás
- Valós idejű streaming válaszok
- Kép és audió generálás
- Elérhető a Gemini API és a Vertex AI által

Mistral Small 3
Kompatibilis, nyílt forráskódú LLM alacsonyabb erőforrás-követelmények mellett versenyképes teljesítményt nyújt.

A Mistral Small 3 a Mistral AI által kifejlesztett könnyű nagymértékű nyelvi modell, amelyet a erős érvelés- és generálási képességek biztosítása mellett a gazdaságos háttér infrastruktúrára figyelemmel alkottak ki. Célja a fejlesztők és az olyan szervezetek elérése, amelyek képességi AI-t szeretnének, anélkül hogy a határhelyzetű módell infrastruktúrájának költségeire kényszerüljenek. Nyílt licensz alapján megjeleníti a modelt, ami önállóan is telepíthető, finetuningolható, és integrálható kereskedelmi alkalmazásokba. Előnyös azonosítást nyújt az esetek gyorsaságában, pontosságában és erőforrás-összegzési hatékonyságában, amivel megfelel a kommunikációs segítőknek, az új tartalmak létrehozásának, a kódfeladatoknak, és az on-premise üzemzéshez, amikor a késlekedés vagy az adatvédelem fontoskodik.
Kritériumok szétosztása
- Nyílt súlytartalom-javítás
- Optimalizálva adattömörítések miatt történő következtetéshez
- Versenyszintű hatásossági eredmények
- Támogatja a finomhangolást és a különbözőséget
- Csaknem független megjelenéshez
- Gyors szövegtömörítés és a nyelvi szintézis a különböző nyelveken

OpenAI o3
Az OpenAI kifejezetten komplex, többlépéses probléma megoldására tervezett előremutató bizonyítási modellje

Az OpenAI o3 egy olyan előremenetel-modell, amelyik a gyors és pontatlan, körüljárások nélküli gondolkodástól eltérő, ügyes, lépéssoros gondolkodást alkalmaz az értelmezési problémák megoldására. Az o-sorozat módszereinek kidolgozásán alapul, ahol több számítási kapacitás kerül a körüljárásokhoz a válasz elképzelésénél, valamint a megerősítéséhez és a javításához, így jól alkalmazható matematikai, programozási, tudományos és logikai elemzési feladatok kezelésére. Az általános célú chat-modellekhez képest, a o3 a mélység előtt az sebesség előtt áll. Le tudja bontani az egyértelműsített kérdéseket, értékelheti több megközelítést, és az oksági és eszközhasználati tesztekhez megbízhatóbb kimeneteleket produkálhat. A fejlesztők hozzáféréshez a OpenAI API-vel és a ChatGPT-vel érhetik el, ahol integrálódik olyan eszközökkel, mint a webbrowzerek, a Python, és az állományelemzés. A model célkitűzése azok, akikre az utómunkások, mérnökök és kutatók számítanak, akikre szükségük van erős precizitásra olyan nehéz problémák során, amelyekért a magasabb minőségű eredmények eléréséért késésre és magasabb költségre késznek áldozni.
Kritériumok szétosztása
- Hosszabb láncolathoz tartozó gondolkodási bizonyítás
- Alkalmazás használata, beleértve a kódot is, a webet is és a fájlokat
- Nagy kontextusablak hosszú dokumentumokhoz
- API és ChatGPT-hoz való hozzáférés
- Iratott precizitás az STEM-ben
- Támogatja a komplex ügynökségi folyamatokat

DeepSeek R1
Nyílt forráskódú nagy nyelvi modell, amely kiemelkedően teljesíti a logikai, számítástechnikai és kódolási feladatokat az MIT-licenc segítségével ingyenesen használható és módosítható.

A DeepSeek R1 egy nyílt forráskódú, nagy nyelvi modell, amely kiválóan teljesít az érvelési, matematikai és kódolási feladatokban. Egy szakértők kombinációját (MoE) használó architektúrával rendelkezik 37MILLIÁRD aktív paraméterrel és 671MILLIÁRD összes paraméterrel, támogatva a 128E context hosszát. A modell fejlett megerősítési tanulási technikákat alkalmaz az önmegvédés, a többlépes reflexió és az emberközpontú érvelési képességek eléréséhez. A DeepSeek R1 csúcskategóriás teljesítményt ért el számos benchmarkban, beleértve a 97,3%-os pontosságot az MATH-500-on, 79,8%-os átmeneti rátát az AIME 2024-ben, és felülmúlja a Codeforces résztvevők 96,3%-át. A modell több változatban is elérhető, 1,5MILLIÁRD-tól 70MILLIÁRD paraméterig terjed, és az MIT licensz alatt ingyenesen használható és módosítható. A DeepSeek R1 ingyenesen használható online, és egy WebGPU-gyorsított verzió helyileg is futtatható egy böngészőben. A modell összetett problémamegoldásra, többnyelvű megértésre és termelési szintű kódgenerálásra készült. Erősségei közé tartozik a kiváló matematikai okoskodás, kódgenerálás és természetes nyelvi megértési képességek. Mivel nyílt forráskódú modell, technikal expertízét igényelheti a telepítése és finomhangolása specifikus használati esetekhez. A DeepSeek R1 a világ legjobb teljesítményű AI modellei közé tartozik, képességei összehasonlíthatóak a vezető, Tulajdonosi megoldásokkal. Nyílt forráskódja lehetővé teszi a közösség által vezérelt fejlesztést és a folyamatos frissítéseket, beleértve a tervezett multimodális támogatást, a beszélgetésfejlesztést és a distribuált inference optimalizálást. A modell tisztán megerősítés-alapú tanulással készült, amely lehetővé teszi, hogy GPT-4 szintű matematikai teljesítményt érjen el lényegesen alacsonyabb költségek mellett. A gondolkodási láncok vizualizációs képessége megoldja a mesterséges intelligencia "fekete doboz" kihívásait, betekintést nyújtva a modell okgondolkodási folyamatába. A DeepSeek R1 API egy OpenAI-kompatibilis végpontot kínál integrációhoz, $0,14-es árral milliónkénti tokenenként. A modell súlyai nyílt forráskódúak, ami lehetővé teszi a kereskedelmi felhasználást és módosítást.
Kritériumok szétosztása
- Mixture of Experts (MoE) architektúrá
- Magasabb szintű erősítési tanulási technikák
- Saját ellenőrzés és többszintű visszavérzés
- Ember-célú logika
- 128 K kontext hossz támogatás
- OpenAI kompatibilis végpont API

DeepSeek V3
Nyílt forráskódú szakértők összetétele egy modell, amely az árarányos mértékű GPT-4 szintű érvelést kínál.

A DeepSeek V3 egy nagy méretű mixture-of-experts (MoE) nyelvi modell, amelyet a DeepSeek AI fejlesztett ki. Csak paramétereinek egy részét активálja minden egyes tokenhez, ami lehetővé teszi, hogy erős teljesítményt nyújtson az érvelésben, a matematikában és a kódolási feladatokban, miközben lényegesen alacsonyabb inferencia költségeket tart fenn, mint a hasonló sűrű modellek. Nyílt súlyokkal kiadva a DeepSeek V3 népszerű választás lett azoknak a fejlesztőknek és kutatóknak, akik olyan képes alapmodellt keresnek, amelyet saját környezetben üzemeltethetnek, finomíthatnak vagy API-n keresztül integrálhatnak. A benchmark tesztek azt mutatják, hogy versenyképes a vezető licenszelt modellekkel szemben, mint például a GPT-4o, különösen a matematikai és logikai érvelési értékelések terén. A modell jól használható técnai asszisztenseknek, kódgeneráló pipeline-oknak, kutatási munkafolyamoknak és minden olyan alkalmazásnak, ahol a következtetés minősége és a költséghatékonyság is számít.
Kritériumok szétosztása
- Szakértők összetétele
- Versenyképes érvelési és matematikai teljesítmény
- Nyílt modell súlyok
- API hozzáférés a DeepSeek platformon keresztül
- Hosszú kontextusablak támogatás
- Fine-tuning barátó
Llama 3.3
Meta nyelvfeldolgozó modellje több nyelven, megújult súlyokkal, hatékony és magas minőségű szöveg generálásért.

A Llama 3.3 egy nagy nyelvi modell a Meta társaság tervezésében, amelynek a gyökeres értelmi képesség, kódolás és többnyelvű képesség alapján kell erősen szerepelni, valamint hatékonyabban kell futtatni, mint korábbi ikonikus modellek. Széles nyelvi palettát támogat és megfelelő a chat-botoknak, tartalomgenerálásnak, összegzésnek és fejlesztő eszközökhöz. Az összes súly nyitott kiadásban jelent meg, így egyaránt megtehető az on-premises telepítés, vagy a jelentős felhő- és inferenceszolgáltatók keresztül, csökkentve a költségeket, a leütés idejét és a adatkezelési munkálatokat. Az instrukciókhoz finomhangolt változata a szándékolt feladatok pontos követésére és segítő, konversationszerű válaszok adására van specializálva. A fejlesztők általában Llama 3.3-et használják alapnak a domain-specifikus alkalmazások fine-tuningjéhez, a lekérdezési-generációs rendszerekhez és az agens workflow-khoz, beleértve az ügynökök fejlesztését is.
Kritériumok szétosztása
- Több nyelvű szöveg generálás
- Megtanított instrukciók alapján működő chat-variáns
- Hosszú-szöveg támogatás
- Kódolási és érvelési képességek
- Nyitott súlyok a szakterület-specifikus alkalmazásokhoz
- Kompatibilitás a vezető kódolási keretrendszerrel
Pronoia
Arabic-fő Large Language Model, amely finetuning a nemzeti minőségű megértést és generálást szolgáltat.
A Pronoia egy nagyméretű nyelvtani modell, amely szigorúan ki lett finetuneelve arabra, és tökéletesebb értelmezési, generálási és érvelési képességeket kíván kínálni, mint az általános célú többnyelvű modelljei. A vezető arab-orientált LLM-nek tekintjük, amelyet a dialektusokhoz, a klasszikus szabásokhoz és a modern standard arabhoz rendeztek be. A modellevelezőt olyan feladatokhoz használhatja, mint a tartalmi megalkotás, a összefoglalás, a fordítás, a vevőtámogatás és dialógus-alapú AI a arab országok érdekeit szolgáló piacokon. Az arab adatokra összpontosítva a kiképzését, a Pronoia különösen odafigyel a morfológiára, a diakritikára és a kulturális kontextusra, melyet általánosabb modelljei gyakran egyenlőtlenül kezelnek.
Kritériumok szétosztása
- Arab-optimizált nyelvi model
- Szöveg és összefoglalás generálása
- Fordítási támogatás
- Közbeszéd és chatbot képességek
- A vállalatközi arab NLP számításokhoz alkalmas
- Az MSA és a dialektusok lefedése





