Praeita kova · 2024-01-17 UTC
LLM Susirėmimas — 2024 m. sausio 17 d.
Iš LLM kategorijos. 37 įvertinimai pateikti tarp 8 kovotojų. ASI:One laimėjo vainiką.
Galutiniai rezultatai
Dalyviai
Kovotojai
Kiekvieno šioje kovoje dalyvavusio įrankio profiliai, surikiuoti pagal galutinį rezultatą.

ASI:One
Koordinuojantis agente, kuris iškviečia savitaręs autonomiją turinčius agentus vykdyti sudėtingų užduočių

ASI:One - tai tokia AI asistenco sistema, kuri sukuriama apie agentinę intelektualą idėją, kuri leidžia sąsiuvinį sąsajos su vartotoju laikantis ir koordinuojanti specializuotus nepriklausomus agentus, kad valdytų sudėtingas prašymus. Ji negali grąžinti tik tekstą, bet gali planuoti, pasiimti rankas už darbą įvairioms programėlėms bei vykdyti workflows, pagal vartotojo užklauso. Sukurtos ASI:One sistemos viduje, kurios yra Artificial Superintelligence Alliance ekosistemo dalis, personalinė AI agentas, integruojanti su decentralizuotais agentų tinklais. Naudojotojai galės skaitytis su juo kasdienines klausimus arba suteikti ilgesnius užduotis, tokias kaip tyrimai, palyginimai, nuotolinės planavimo sistemos ir duomenų paieška per jungtus prie tinklų.
Kriterijų išskirstymas
- Prašalų sąveikos sąsaja
- Autonomijų agentų koordinacija
- Sudėginiai užduočių plano ir išlaikyme
- Siekimo prisegtųjų ir agentų priklausomis priemonių
- Asistento pamato ir konteksto prisignetimas
- Sukurti ASI aljanso agentų stogo

Gemini 2.0 Flash
Žemės gyvos, dažniai modulio AI modelis, kurių tikslas yra tiesioginis veiksnių vykdymas su 1M-token konteksto langine.

Gemini 2.0 Flash yra Google DeepMind keturiasdešimtais modelis, optimizuotas greičio, mastumo ir daugmodalių suvokimų užtvaras. Jis priima tekstą, vaizdo įrašus, garso įrašus ir vaizdo įrašus kaip įvestį ir gali generuoti tekstą, vaizdo įrašus ir garso įrašus kaip išvadą, taip padedamas kuriam kuo turtingesnių interaktyvių aplikacijų. Sukurtas agentų darbo užtvarais, modelis prisijunkinę natyvių įrankių naudojimui, funkcijų vadinimui ir 1M-tokeno konteksto langą užtvarkoiamui dideliems dokumentams, kodavimo bazėms ar ilgalaikiems sesijoms. Mažas laukimas jį paverčia svarbia priklausomybe asistentų, realiuoju analizės bei produkcijos šaukinio įrenginiams. Programuotojai gali prisijungti prie Gemini 2.0 Flash per Gemini API, Google AI Studio bei Vertex AI, su SDK prieinamais daugelio kalbų.
Kriterijų išskirstymas
- 1M-token konteksto židinys
- Dažniausioįs įvesties forma: žinoklė, paveikslėlis, garsas, vaizdas
- Gamtinių priemonių naudojimas ir uždavinio atliksna užgalvyti
- Ieškimo prieiga už realųjį laiką
- Paveikslėlių ir garsų generavimo
- Galima prieiga į Gemini API ir Vertex AI

Mistral Small 3
Kompaktusis atvira LLM teikia konkuruojančią performanciją mažesniems kompiuteriniams reikalavimams.

Mistral Small 3 yra ledo didelis kalbų modelis iš Mistral AI, projektuotas pasiūlodeti stipriąją priežastinę ir generacinę galią efektyviai atliekančias mažiausiuose kompiuterų rango įrenginiuose. Ši mada skirta programuočiui ir organizacijai, reikia galingoji AI gali, bet be priešėjų masto modelių įrenginių įsigyjimo kaistųjų. Releases pradedžiojo savo atvira licencija, modelis gali būti savajos įdiegimas, paprastojimui ir integravimui į komercinius programavimą. Jo greičio, tikslumo ir resursų efektyvumo pusiausvyra padeda tinkšti, kad atliktų juokavimo pasiūlymas, turinio kūrimą, kodo užduotis ir priemiesne įrengimai, kuriose aklumu ar privatacum žingsnis yra svarbus.
Kriterijų išskirstymas
- Atvirų svertų modelio išleidimas
- Optimizuotas efficiento išplėtimo užklausa
- Konkuruojančių benchmarkų rezultatai
- Podrįsijimas ir individualizavimas
- Suitablas on-premiže vėžimuis
- Šiuolaikinės kultūros tekstų sintezė

OpenAI o3
Atviros AI o3: galingas abstrukcinis modelis kompleksioms, daugiastepiam aiškintiems uždaviniams.

O3 OpenAI yra pirmagilumo teisinimo modelis, kuris yra suprojektuotas, kad sprendžytų problemus, reikalingus kritiškomis, žingsnes iki žingsnio, kalbimuisi. Tai baigtosi remiantis o-šerijos metodika, išlaisvalant reikiamo daugiau skaičiavimo įsigaliojimo metu planuoti, patvirtinti ir papratai atsakymo, dėl to tai gerai pritaikyta užduočių atlikti matematikoje, programavime, mokslas, ir logikoje analize. Palyginus su išvyrinčiais švarkavimo modeliais, o3 dėmesio skiria gylį, nei greitį. Jis gali prieštaringų įrankio įspėjimus skaidrinti, įvertinti daugelį pristangų ir sukurti daugiau reliabilius išvestis, taikant bazių, kurios stiprina sąmonę ir technologijų naudojimą įvertinimus. Programavimo specialistai gali prieigą patekti per OpenAI API ir ChatGPT, kuris integravęs įrankius, kaip vėliavos naršinimo, Python ir failų analizės funkcijas. Šis modelis skirtas tyrimų darbuotojams, inžinieriams ir galingiems naudotojams, kurie reikalauja stipresnės tikslumo už sausąsio problemas ir taip pat pasirinkti laisvoji trukmė bei kaupiai dėl aukštą kokybių rezultatų.
Kriterijų išskirstymas
- Ilgas argumentacijos eiga
- Kita prijungtų priemonių panaudojimas
- Didelė konteksto anglis, kad galėtų apdabinti ilgus tekštus
- Prieinama API ir ChatGPT per Atvirą AI
- Imtis tobulės tikslumui STEM prišdėties
- Palaiko kompleksus agentų darbų procesus

DeepSeek R1
Atvirųjų šaltinių didelis žiūrių modelis, pagerintis problemų išsprendimą, matematiką ir kodus, naudojantis MIT licenzija sąlygomis neiįprastai be mokesčių.

DeepSeek R1 yra atvirasjųjų didelių jutikų modelių šaknis, kuris išsipjauna gebėjimą nagrinėti abstraktinius ryšius, matematinės matematikos uždaras bei kodo uždovynes. Jis naudoja Mixture of Experts (MoE) architektūrą su 37 mlrd. veikiamų parametrų ir 671 mlrd. parametru, paspėdina 128K konteksto ilgį. Šis modelis įtaisija pasitelktį mokymosi išmokymą pasiekti savo verifikavimą, keliojų refleksiją bei žmogiško orientuotąjų raiškos širdžius. DeepSeek R1 pasiekęs visų sąlygujų geriausių rezultatus keliojų standartų, žemęjant 97.3% taikslumo pagal MATH-500, 79.8% sėkmės laipsniui pagal AIME 2024, bei priešpaskutiniuosių 96.3% uždarytojų Codeforces. Šis modelis pasižymi daugybemi variantais, besiskiriantais nuo 1,5 mlrd. iki 70 mlrd. parametru, ir pateikiamas pagal MIT licenciją be jokių išlaidų. DeepSeek R1 taip pat naudojamas internete už nulinį išlaidų ir įtaisijamas paspėtinio WebGPU pagrindu, leidžianti kiekvienąjį vartotoją paleisti ir pasirūpinti tinklavietės aplinkybėmis. Modelis sukurtas kompleksinių problemai sprendimo, daugialypių kalbų įtraukties ir pagrindinio kodui generavimo tikslais. Jo gebėjimai apima nuostabių matematikinių argumentacijų, kodą generuojančių, bei prirodžios kalbos supratimo galių. Vienintelis, bet modelis yra atvira prieigos sistema, nors galbūt norint tobulinti ir išsaugoti modelio bei pritaikyti jį konkretniems naudojimams, reikia naudoti techninių žinių. DeepSeek R1 yra įvertinamas už aukštųjų AI modelių rango pasaulyje, su galiomis panašiomis į lyderių savitines sprendinius. Jo atvirųjų šaltinių (open-source) priklausomybė leidžia bendruomeniniam vystymui ir toliau vykstančioms patobulinimams, tarp jų numatytame multimodaliojo palaikymo bei pokalbių užteisinimo, bei panaudojimo plieniniuose įrenginiuose (distributed inference) optimizacijai. Modelis turi tiesioginę mokytojos mokymosi raidą, kas leidžia jo pasiekti GPT-4 lygio matematikos funkcionalumo ženkliai auktžemes kostė. Sukauptos minties vizualizavimo galimybės spragša „juodojo skydo“ AI iššūkius, suteikiančios įrangos mokymosi procesų atvaizdą. DeepSeek R1 šioje sistemoje API suteikia atvirojo API bei vykdo OpenAI - kompatybę, integruojamą bei taikantį $0,14 per milijoną žodžių bei mokesčius. Modelio svoriu yra atviro kaltis, leidžiantis komercinei veiklai ir permainamui.
Kriterijų išskirstymas
- Mixture of Experts (MoE) architektūra
- Papildinti kartų mokymosi technika
- Savarankiškas apvertinimas bei daugiaspakos išsprendimai:
- Logikos orientuotas mokymasis.
- Atžava 128K konteksto ilgumas
- OpenAI kompatybingas API endpoint

DeepSeek V3
Atviras mėginių modelis, siūlantysis GPT-4 lygio priežastingumą vos nežemesnei kainai.

DeepSeek V3 yra didelio masto mėginių (MaE) kalbos modelis, sukurtas DeepSeek AI. Jis veikia tik dalykinės savo visų parameterių, leidžiant jį delistirdinti gausiąją atliekamą performanciją kovos, matematikos bei programinės kodu realizacijos uždaviniais, todėl infekcinės užteiktų sąnaudų sumažėja lyginant su taip patiųjų tankiųjų modelių. DeepSeek V3 atviro svoris išleistas, jis tapo populiariausiu variantu programuotojams ir tyrėjams, kurie nori gali savimi nuošalų pagrindinį modelį, kurį jiems gali pasididžioti, ar integruoti API. Įvertinimai sakyja, kad jis prieigos prie lyderių savininkų, tokio paties kaip GPT-4o modelioi, kad labanore matematikos ir logiko priežastingumo įvertinimų. Jis labai tinkamiai sudaro savo paslaugas specialistams, kode generavimo tiekime, mokslinių tyrimų workflow, bei visai sąvokai, kuriai yra svarbus atsiskaityti dėl priežastingumo kokybės bei biudžeto efektyvumo.
Kriterijų išskirstymas
- Mėginių kovos architektūra
- Mėginių kovų bei matematikos įvertinimų bendrųjų vertinimai
- Atviro svoris, kuris galioja savimi išsaugotui
- API bei svoris, kuris pridedamas DeepSeek platformoje
- Gamtinės konteksto langelės palaikymas
- Labai gerai atsiskaitytų savininkų bei integracijų prijungimas
Llama 3.3
Meta LLM multilingviškas atviroji sverįjantis modelis pritaikytas efektyviui aukštos kokybės tekstų generavimui.

LM laiškas 3.3 yra didelis kalbos modelis iš Meta, skirtas teikti stabilų teisišką kalbą, kodavimą ir daugiašalio kalbų sąsajas, būdami daug efektyvesni nei anksčiau pristatyti didelio žmogĮ modeliai. Jame yra supažintas plačias kalbos sąsajas ir yra tinkamas užduočių padėjėjams, turinio generavimo sistemoms į SaaS, santrumpų ir vartotojo programistams į SDK. Išleistas atviro paketo svorio, jis gali būti įdiegiamas įrenginiuose ar per pagrindinius nubėgiamąją ir reiškinį teikėjus, suteikiant komandoms komandoms bendruosius teises dėl kiekio, latencijos ir duomenų tvarkymo. Jo prielaidų suderinamas variantas yra optimizuotas tobulinti užklausų lyderiai tiksliai ir pradinanti naudingai, konversacinus atsakymus. Programuotojai paplitę susinaudoti Llama 3.3 kaip aki, kuri leidžia finišuoti skirtumas aplikacijos, įgyvendinimo sistemos bei agenteles dirbtuvės.
Kriterijų išskirstymas
- Daugialypiškas tekstų generavimas
- Instrukcijos nustatytas chat variantas
- Ilgos konteksto parama
- Kodo ir priežasties galimybių
- Atviri sveriai fine tunningui
- Pasitaikantis žymiausiomis įtraukimo platformomis
Pronoia
Didžiuliais rytų šiaurės arabu kalbos modelis, specialiai apdorinta tam, kad sukurtų natyvių kalbos užimtumo ir susiekimo galimybes.
Pronoia yra didelis kalbos modelis, skirtas specifikiškai paprastos susijaudinimo Arabų kalbą, taikantis savo gebėjimus pagerinti tikslumą susiiejame supratimui, visuometiniam sukūrimui ir logikai. Jis yra įvardijamas kaip viena pagrindinių Arabų kalbos LLM modelių, su optimizacija dialektams, klasikinėms formoms ir moderniems standardiniam arabų kalbos variantams. Modelis gali būti naudojamas užduočių atliekimui, tokių kaip turinio kūrimas, santraukų sukūrimas, vertimas, klientų aptarnavimas ir pokalbiniai AI paslaugos kalbą kalbantiems arabų kalbos kalbančiuose rinkose. Koncentruodami savo mokymą arabų duomenims, Pronoia siūlo modelis pažymi arabų kalbos savybes kaip morfologija, diakritiniai ženklai ir kultūrinė kontekstas, kuris plačiau modeliai dažnai neišsiprastę labai konsistelišku būdu.
Kriterijų išskirstymas
- Arabu kalbą adaptuotas kalbos modelis
- Teksto generavimas ir suminėjimuos
- Tolkymo palaikymas
- Konversaciniu ir chatt robotu galimybes
- Paskirtas įmoninę arabu NLP
- MSA ir dialektų pokrypiajų apdorų galimybes





