Tidligere kamp · 2025-08-08 UTC
LLM Oppgjør — 8. august 2025
Fra kategorien LLM. 28 merker plassert på tvers av 6 kjempere. DeepSeek V3 tok kronen.
Endelige plasseringer
Oppstillingen
Kjemperne
Profiler av hvert verktøy som konkurrerte i denne kampen, rangert etter sin endelige poengsum.

DeepSeek V3
Åpen kildekode-blandingsmodell med eksperter som tilbyr GPT-4o-nivå- resonnement til en brøkdel av kostnaden.

DeepSeek V3 er en storskala blandingsmodell av eksperter (MoE) utviklet av DeepSeek AI. Den aktiverer kun en delmengde av sine totale parametere per token, noe som gjør det mulig å levere sterk ytelse innen resonnement, matematikk og kodingsoppgaver samtidig som slutningskostnadene holdes betydelig lavere enn sammenlignbare kompakte modeller. Lansert med åpne vekter, har DeepSeek V3 blitt et populært valg for utviklere og forskere som trenger en kapabel grunnmodell de kan selv-hosting, finjustere eller integrere via API. Benchmarks plasserer den konkurransedyktig mot ledende proprietære modeller som GPT-4o, spesielt på matematiske og logiske resonnement-evalueringer. Modellen er godt egnet for tekniske assistenter, kodegenereringsrørledninger, forskningsarbeidsflyter og alle applikasjoner hvor både resonnementkvalitet og budsjetteffektivitet betyr noe.
Kriteriumfordeling
- Blandingsarkitektur med eksperter
- Konkurransedyktige benchmarking-resultater for resonnement og matematikk
- Åpen kildekode-modellvektorer
- API-tilgang via DeepSeek-plattformen
- Langt kontekstvindusupport
- Finjusteringvennlig

Janus pro
DeepSeek's åpne multimodale modell for bildegenerering og visuell forståelse i en samlet arkitektur.

Janus Pro er en åpen kildekode multimodal AI-modell fra DeepSeek, tilgjengelig i 1B- og 7B-parameterversjoner. Den forener visuell forståelse og bildegenerering i ett enkelt rammeverk ved å skille de visuelle kodingsveiene, slik at modellen både kan tolke bilder og skape dem fra tekstprompter. 7B-varianter leverer konkurransedyktige resultater på benchmark for tekst‑til‑bilde‑syntese og visuell spørsmål‑svar, og matcher eller overgår ofte større, spesialiserte modeller. Utgitt under en MIT‑lisens, kan Janus Pro selvhostes, finjusteres og integreres i forsknings- eller produksjonspipelines uten bruksbegrensninger. Det passer utviklere, forskere og hobbyister som trenger en fleksibel flermodal grunnmodell for eksperimentering, prototyping eller å bygge applikasjoner som kombinerer bildegenerering med bildeforståelse.
Kriteriumfordeling
- Tekst-til-bilde-generering
- Visuell spørsmål-og-svar og bildeanalyse
- Enhetlig transformer-arkitektur
- Alternativer med 1B og 7B parametere
- Åpne vekter under MIT-licens
- Støtte for multimodale innganger og utganger

DeepSeek R1
En åpen kildekode stor språkmodell som utmerker seg i resonnering, matematikk og kodeoppgaver, med MIT-lisens for fri bruk og modifisering.

DeepSeek R1 er en open‑source stor språkmodell som utmerker seg i resonnering, matematikk og programmeringsoppgaver. Den bruker en Mixture of Experts (MoE)-arkitektur med 37 milliarder aktive parametere og 671 milliarder totale parametere, og støtter en kontekstlengde på 128 K. Modellen integrerer avanserte reinforcement learning‑teknikker for å oppnå selv‑verifisering, flertrinns refleksjon og menneske‑justert resonnering. DeepSeek R1 har oppnådd state‑of‑the‑art‑resultater i ulike benchmarks, inkludert 97,3 % nøyaktighet på MATH‑500, 79,8 % bestått på AIME 2024, og overgår 96,3 % av Codeforces‑deltakerne. Modellen finnes i flere varianter, fra 1,5 B til 70 B parametere, og er lisensiert under MIT for fri bruk og modifisering. DeepSeek R1 kan brukes gratis på nett, og en WebGPU‑akselerert versjon kan kjøres lokalt i en nettleser. Modellen er designet for komplekse problemløsninger, flerspråklig forståelse og produksjonsklar kodegenerering. Dens styrker inkluderer eksepsjonell matematisk resonnering, kodegenerering og naturlig språkforståelse. Imidlertid, som en åpen kildekode-modell, kan den kreve teknisk ekspertise for å implementere og finjustere for spesifikke brukstilfeller. DeepSeek R1 er plassert blant de best presterende AI‑modellene globalt, med kapasiteter som er sammenlignbare med ledende proprietære løsninger. Den åpne kildekode‑naturen gjør det mulig for fellesskapsdrevet utvikling og kontinuerlige oppgraderinger, inkludert planlagt multimodal støtte, samtale‑forbedring og distribuert inferensoptimalisering. Modellen har en ren reinforcement learning-utvikling, som gjør at den kan oppnå GPT-4-nivå matematikkytelse til en betydelig lavere kostnad. Chain-of-thought-visualiseringskapasiteten adresserer AI "black box"-utfordringer, og gir innsikt i modellens resonneringsprosess. DeepSeek R1s API tilbyr et OpenAI-kompatibelt endepunkt for integrering, priset til $0.14 per million tokens. Modellens vekter er open-source, og tillater kommersiell bruk og modifisering.
Kriteriumfordeling
- Mixture of Experts (MoE)-arkitektur
- Avanserte forsterkningslærings‑teknikker
- Selv‑verifisering og flerstegs refleksjonsevner
- Menneske‑tilpasset resonnering
- Støtte for 128 K kontekstlengde
- OpenAI‑kompatibel API‑endpoint

ASI:One
Agentisk AI-assistent som koordinerer autonome agenter for å fullføre flertrinnsoppgaver.

ASI:One er en AI-assistent bygget rundt ideen om agentisk intelligens, der et samtalergrensesnitt kan dispatchere og koordinere spesialiserte autonome agenter for å håndtere komplekse forespørsler. I stedet for å returnere kun tekst, kan den planlegge, kalle verktøy og utføre arbeidsflyter på vegne av brukeren. Utviklet innenfor Artificial Superintelligence Alliance‑økosystemet, er den posisjonert som en personlig AI‑agent som integreres med desentraliserte agentnettverk. Brukere kan chatte med den for hverdagslige spørsmål eller delegere lengre oppgaver som forskning, sammenligninger, planlegging og dataoppslag på tvers av tilkoblede tjenester.
Kriteriumfordeling
- Samtale-basert chatgrensesnitt
- Orkestrering av autonome agenter
- Planlegging og utførelse av flertrinnsoppgaver
- Tilkobling til eksterne agenter og tjenester
- Minne og kontekst i personlig assistentstil
- Bygget på ASI Alliance-agentstakken


Latest DeepSeek R2 er etterfølgeren til DeepSeek R1‑s reasoning‑modell, designet for å levere sterkere steg‑for‑steg problemløsning på tvers av matematikk, koding og analytiske oppgaver. Den har som mål å utvide den åpne forskningstilnærmingen som gjorde tidligere DeepSeek‑utgivelser populære blant utviklere og forskere. Modellen fokuserer på forbedret nøyaktighet, lengre konteksthåndtering og mer effektiv inferens sammenlignet med sin forgjenger, noe som gjør den egnet for tekniske assistenter, agentiske arbeidsflyter og integrasjon i tilpassede applikasjoner. Tilgjengelighet og nøyaktige spesifikasjoner avhenger av DeepSeek’s offisielle utgivelseskanaler. Brukere kan vanligvis få tilgang til modellen via API, chat-grensesnitt eller ved å kjøre åpne vekter der det er tilgjengelig, noe som gir fleksibilitet for både individuell eksperimentering og produksjonsimplementering.
Kriteriumfordeling
- Avansert chain-of-thought-resonnement
- Utvidet kontekstvindu
- Støtte for kodedannelse og feilsøking
- Flerspråklig forståelse
- API- og chatbasert tilgang
- Egnede for agentiske applikasjoner
Pronoia
Arabisk‑først stor språkmodell finjustert for innfødt‑kvalitetsforståelse og generering.
Pronoia er en stor språkmodell som er spesifikt finjustert for arabisk, og har som mål å levere mer nøyaktig forståelse, generering og resonnering på språket enn generelle flerspråklige modeller. Den er posisjonert som en ledende arabiskfokusert LLM, med optimaliseringer for dialekter, klassiske former og moderne standardarabisk. Modellen kan brukes til oppgaver som innholdsskaping, oppsummering, oversettelse, kundestøtte og samtale-AI i arabisktalende markeder. Ved å fokusere treningen på arabiske data, retter Pronoia seg mot nyanser som morfologi, diakritikk og kulturell kontekst som bredere modeller ofte håndterer inkonsekvent.
Kriteriumfordeling
- Arabisk-optimert språkmodell
- Tekstgenerering og oppsummering
- Oversettelsesstøtte
- Konversasjons- og chatbot-funksjoner
- Egnet for bedrifts‑arabisk NLP
- Dekning av MSA og dialekter




