Tidligere kamp · 2024-01-17 UTC
LLM Oppgjør — 17. januar 2024
Fra kategorien LLM. 37 merker plassert på tvers av 8 kjempere. ASI:One tok kronen.
Endelige plasseringer
Oppstillingen
Kjemperne
Profiler av hvert verktøy som konkurrerte i denne kampen, rangert etter sin endelige poengsum.

ASI:One
Agentisk AI-assistent som koordinerer autonome agenter for å fullføre flertrinnsoppgaver.

ASI:One er en AI-assistent bygget rundt ideen om agentisk intelligens, der et samtalergrensesnitt kan dispatchere og koordinere spesialiserte autonome agenter for å håndtere komplekse forespørsler. I stedet for å returnere kun tekst, kan den planlegge, kalle verktøy og utføre arbeidsflyter på vegne av brukeren. Utviklet innenfor Artificial Superintelligence Alliance‑økosystemet, er den posisjonert som en personlig AI‑agent som integreres med desentraliserte agentnettverk. Brukere kan chatte med den for hverdagslige spørsmål eller delegere lengre oppgaver som forskning, sammenligninger, planlegging og dataoppslag på tvers av tilkoblede tjenester.
Kriteriumfordeling
- Samtale-basert chatgrensesnitt
- Orkestrering av autonome agenter
- Planlegging og utførelse av flertrinnsoppgaver
- Tilkobling til eksterne agenter og tjenester
- Minne og kontekst i personlig assistentstil
- Bygget på ASI Alliance-agentstakken

Gemini 2.0 Flash
Googles raske, multimodale AI-modell bygget for sanntids‑agentoppgaver med et 1M‑token kontekstvindu.

Gemini 2.0 Flash er Google DeepMinds neste generasjonsmodell, optimalisert for hastighet, skala og multimodal resonnering. Den tar imot tekst, bilder, lyd og video som input og kan generere tekst, bilder og lyd som output, noe som gjør den egnet for rike interaktive applikasjoner. Designet med agentbaserte arbeidsflyter i tankene, støtter modellen native verktøybruk, funksjonskalling og et kontekstvindu på 1 M‑tokens for håndtering av store dokumenter, kodebaser eller langvarige økter. Lav latens gjør den til et praktisk valg for assistenter, sanntidsanalyse og produksjons‑skala-utrullinger. Utviklere kan få tilgang til Gemini 2.0 Flash gjennom Gemini API, Google AI Studio og Vertex AI, med SDK-er tilgjengelige på de viktigste programmeringsspråkene.
Kriteriumfordeling
- 1M‑token kontekstvindu
- Multimodal input: tekst, bilde, lyd, video
- Innebygd verktøykalling og kodekjøring
- Sanntids‑streaming‑svar
- Generering av bilder og lyd
- Tilgjengelig via Gemini API og Vertex AI

Mistral Small 3
Kompakt, åpen kildekode LLM som gir konkurransedyktig ytelse med lavere beregningskrav.

Mistral Small 3 er en lettvekts stor språkmodell fra Mistral AI, designet for å tilby sterke resonnerings- og generasjonsevner samtidig som den kjører effektivt på rimelig maskinvare. Den retter seg mot utviklere og organisasjoner som ønsker kraftig AI uten infrastrukturkostnadene for frontier‑scale modeller. Utgitt under en åpen lisens kan modellen være self‑hosted, finjustert og integrert i kommersielle applikasjoner. Dens balanse mellom hastighet, nøyaktighet og ressursbruk gjør den egnet for chatassistenter, innholdsgenerering, kodeoppgaver og on‑premise‑installasjoner der latency eller privacy er viktig.
Kriteriumfordeling
- Utgivelse av modell med åpne vekter
- Optimalisert for effektiv inferanse
- Konkurransedyktige benchmarkresultater
- Støtter finjustering og tilpasning
- Passer for on‑prem-implementering
- Flerspråklig tekstgenerering

OpenAI o3
OpenAI sitt avanserte resonnementmodell for komplekse, multisteg problemstillinger

OpenAI o3 er en frontier reasoning-modell designet for å takle problemer som krever nøye, trinnvis tenkning. Den bygger på o-seriens tilnærming som bruker mer beregning ved inferens for å planlegge, verifisere og forbedre svar, og gjør den egnet for oppgaver innen matematikk, koding, vitenskap og logisk analyse. Sammenlignet med generelle chat-modeller legger o3 vekt på dybde fremfor hastighet. Den kan bryte ned tvetydige prompts, evaluere flere tilnærminger, og produsere mer pålitelige resultater på benchmark-tester som stiller krav til resonnement og verktøybruk. Utviklere kan få tilgang til den via OpenAI API og ChatGPT, der den integreres med verktøy som nettlesing, Python og filanalyse. Modellen er rettet mot forskere, ingeniører og erfarne brukere som trenger sterkere nøyaktighet på vanskelige problemer og er villige til å avstå noe latens og kostnad for resultater av høyere kvalitet.
Kriteriumfordeling
- Utvidet tankekjede
- Verktøybruk som inkluderer kode, nett og filinnspill
- Stor kontekstvindu for lange dokumenter
- API- og ChatGPT-tilgjengelighet
- Forbedret nøyaktighet på STEM-målestender
- Støtter komplekse agentbaserte arbeidsflyter

DeepSeek R1
En åpen kildekode stor språkmodell som utmerker seg i resonnering, matematikk og kodeoppgaver, med MIT-lisens for fri bruk og modifisering.

DeepSeek R1 er en open‑source stor språkmodell som utmerker seg i resonnering, matematikk og programmeringsoppgaver. Den bruker en Mixture of Experts (MoE)-arkitektur med 37 milliarder aktive parametere og 671 milliarder totale parametere, og støtter en kontekstlengde på 128 K. Modellen integrerer avanserte reinforcement learning‑teknikker for å oppnå selv‑verifisering, flertrinns refleksjon og menneske‑justert resonnering. DeepSeek R1 har oppnådd state‑of‑the‑art‑resultater i ulike benchmarks, inkludert 97,3 % nøyaktighet på MATH‑500, 79,8 % bestått på AIME 2024, og overgår 96,3 % av Codeforces‑deltakerne. Modellen finnes i flere varianter, fra 1,5 B til 70 B parametere, og er lisensiert under MIT for fri bruk og modifisering. DeepSeek R1 kan brukes gratis på nett, og en WebGPU‑akselerert versjon kan kjøres lokalt i en nettleser. Modellen er designet for komplekse problemløsninger, flerspråklig forståelse og produksjonsklar kodegenerering. Dens styrker inkluderer eksepsjonell matematisk resonnering, kodegenerering og naturlig språkforståelse. Imidlertid, som en åpen kildekode-modell, kan den kreve teknisk ekspertise for å implementere og finjustere for spesifikke brukstilfeller. DeepSeek R1 er plassert blant de best presterende AI‑modellene globalt, med kapasiteter som er sammenlignbare med ledende proprietære løsninger. Den åpne kildekode‑naturen gjør det mulig for fellesskapsdrevet utvikling og kontinuerlige oppgraderinger, inkludert planlagt multimodal støtte, samtale‑forbedring og distribuert inferensoptimalisering. Modellen har en ren reinforcement learning-utvikling, som gjør at den kan oppnå GPT-4-nivå matematikkytelse til en betydelig lavere kostnad. Chain-of-thought-visualiseringskapasiteten adresserer AI "black box"-utfordringer, og gir innsikt i modellens resonneringsprosess. DeepSeek R1s API tilbyr et OpenAI-kompatibelt endepunkt for integrering, priset til $0.14 per million tokens. Modellens vekter er open-source, og tillater kommersiell bruk og modifisering.
Kriteriumfordeling
- Mixture of Experts (MoE)-arkitektur
- Avanserte forsterkningslærings‑teknikker
- Selv‑verifisering og flerstegs refleksjonsevner
- Menneske‑tilpasset resonnering
- Støtte for 128 K kontekstlengde
- OpenAI‑kompatibel API‑endpoint

DeepSeek V3
Åpen kildekode-blandingsmodell med eksperter som tilbyr GPT-4o-nivå- resonnement til en brøkdel av kostnaden.

DeepSeek V3 er en storskala blandingsmodell av eksperter (MoE) utviklet av DeepSeek AI. Den aktiverer kun en delmengde av sine totale parametere per token, noe som gjør det mulig å levere sterk ytelse innen resonnement, matematikk og kodingsoppgaver samtidig som slutningskostnadene holdes betydelig lavere enn sammenlignbare kompakte modeller. Lansert med åpne vekter, har DeepSeek V3 blitt et populært valg for utviklere og forskere som trenger en kapabel grunnmodell de kan selv-hosting, finjustere eller integrere via API. Benchmarks plasserer den konkurransedyktig mot ledende proprietære modeller som GPT-4o, spesielt på matematiske og logiske resonnement-evalueringer. Modellen er godt egnet for tekniske assistenter, kodegenereringsrørledninger, forskningsarbeidsflyter og alle applikasjoner hvor både resonnementkvalitet og budsjetteffektivitet betyr noe.
Kriteriumfordeling
- Blandingsarkitektur med eksperter
- Konkurransedyktige benchmarking-resultater for resonnement og matematikk
- Åpen kildekode-modellvektorer
- API-tilgang via DeepSeek-plattformen
- Langt kontekstvindusupport
- Finjusteringvennlig
Llama 3.3
Meta's flerspråklige open‑weight LLM, fininnstilt for effektiv, høykvalitets tekstgenerering.

Llama 3.3 er en stor språkmodell fra Meta som er designet for å levere sterke evner innen logikk, koding og flerspråklighet, samtidig som den er mer effektiv å kjøre enn tidligere flaggsjipsmodeller. Den støtter et bredt spekter av språk og er egnet for chatassistenter, innholdsgenerering, oppsummering og verktøy for utviklere. Utgitt med open weights, kan den deployes on‑premises eller gjennom ledende cloud- og inference‑providers, noe som gir team fleksibilitet i forhold til kostnad, latens og databehandling. Dens instruction‑tuned variant er optimalisert for å følge prompts nøyaktig og produsere hjelpsomme, konversasjonelle svar. Utviklere bruker ofte Llama 3.3 som grunnlag for finjustering av domenespesifikke applikasjoner, retrieval‑augmented generasjonssystemer, og agentiske arbeidsflyter.
Kriteriumfordeling
- Flerspråklig tekstgenerering
- Instruksjonsjustert chatvariant
- Støtte for lang kontekst
- Kodings- og resonnementsevner
- Open weights for finjustering
- Kompatibel med hovedinferansrammeverk
Pronoia
Arabisk‑først stor språkmodell finjustert for innfødt‑kvalitetsforståelse og generering.
Pronoia er en stor språkmodell som er spesifikt finjustert for arabisk, og har som mål å levere mer nøyaktig forståelse, generering og resonnering på språket enn generelle flerspråklige modeller. Den er posisjonert som en ledende arabiskfokusert LLM, med optimaliseringer for dialekter, klassiske former og moderne standardarabisk. Modellen kan brukes til oppgaver som innholdsskaping, oppsummering, oversettelse, kundestøtte og samtale-AI i arabisktalende markeder. Ved å fokusere treningen på arabiske data, retter Pronoia seg mot nyanser som morfologi, diakritikk og kulturell kontekst som bredere modeller ofte håndterer inkonsekvent.
Kriteriumfordeling
- Arabisk-optimert språkmodell
- Tekstgenerering og oppsummering
- Oversettelsesstøtte
- Konversasjons- og chatbot-funksjoner
- Egnet for bedrifts‑arabisk NLP
- Dekning av MSA og dialekter





