Tidigare batalj · 2025-08-08 UTC
LLM Uppgörelse — 8 augusti 2025
Från kategorin LLM. 28 markeringar placerade över 6 kämpar. DeepSeek V3 tog kronan.
Slutställning
Uppställningen
Kämparna
Profiler av varje verktyg som tävlade i den här bataljen, rankade efter sin slutpoäng.

DeepSeek V3
Open‑source mixture‑of‑experts‑modell som erbjuder resonemang på GPT‑4o‑nivå till en bråkdel av kostnaden.

DeepSeek V3 är en storskalig mixture-of-experts (MoE) språkmodell utvecklad av DeepSeek AI. Den aktiverar bara en delmängd av sina totala parametrar per token, vilket gör att den kan leverera stark prestanda i resonemang, matematik och kodningsuppgifter samtidigt som inferenskostnaderna hålls betydligt lägre än jämförbara täta modeller. Den har släppts med öppna vikter, DeepSeek V3 har blivit ett populärt val för utvecklare och forskare som behöver en kapabel grundmodell som de kan self-hosta, finjustera eller integrera via API. Benchmarkresultat placerar den konkurrenskraftigt mot ledande proprietära modeller som GPT-4o, särskilt i matematik‑ och logisk resonemangsutvärderingar. Modellen är väl lämpad för tekniska assistenter, kodgenereringspipelines, forskningsarbetsflöden och alla applikationer där både resonemangskvalitet och budgeteffektivitet är viktiga.
Radbrytning av kriterier
- Mixture-of-experts‑arkitektur
- Konkurrenskraftiga resonemangs- och matematikbenchmarks
- Open‑source modellvikter
- API‑åtkomst via DeepSeek‑plattformen
- Stöd för långt kontextfönster
- Lämplig för finjustering

Janus pro
DeepSeek's öppna multimodala modell för bildgenerering och visuell förståelse i en enhetlig arkitektur.

Janus Pro är en öppenkällkods-multimodal AI-modell från DeepSeek, tillgänglig i versioner med 1 miljard och 7 miljarder parametrar. Det förenar visuell förståelse och bildgenerering i ett enda ramverk genom att koppla loss de visuella kodningsvägarna, vilket gör att modellen både kan tolka bilder och skapa dem från textprompts. 7B-varianten levererar konkurrenskraftiga resultat på benchmarktester för text-till-bildsyntes och visuell frågesvar, och matchar ofta eller överträffar större specialiserade modeller. Utgiven under en MIT-licens kan Janus Pro vara självvärd, finjusteras och integreras i forsknings- eller produktionspipeliner utan användningsbegränsningar. Det passar utvecklare, forskare och hobbyister som behöver en flexibel multimodal grundmodell för experiment, prototyper eller byggnation av applikationer som kombinerar bildskapande med bildförståelse.
Radbrytning av kriterier
- Text-till-bildgenerering
- Visuell frågesvar och bildanalys
- Enhetlig transformerarkitektur
- 1B och 7B parametralternativ
- MIT-licenserade öppna vikter
- Multimodalt indatа och utdatastöd

DeepSeek R1
En öppen källkod stor språkmodell som utmärker sig i resonemang, matematik och kodningsuppgifter med MIT-licens för fri användning och modifiering.

DeepSeek R1 är en öppen källkod large language model som utmärker sig i resonemang, matematik och kodningsuppgifter. Den använder en Mixture of Experts (MoE)-arkitektur med 37 miljarder aktiva parametrar och totalt 671 miljarder parametrar, och stödjer en kontextlängd på 128 K. Modellen integrerar avancerade förstärkningsinlärningstekniker för att uppnå självverifiering, flerstegsreflektion och människoorienterat resonemang. DeepSeek R1 har uppnått state-of-the-art‑prestanda i olika benchmarktester, inklusive 97,3 % noggrannhet på MATH‑500, 79,8 % godkännandefrekvens på AIME 2024 och överträffar 96,3 % av Codeforces‑deltagarna. Modellen finns i flera varianter, från 1,5 B till 70 B parametrar, och är licensierad under MIT för fri användning och modifiering. DeepSeek R1 kan användas online gratis, och en WebGPU‑accelererad version kan köras lokalt i en webbläsare. Modellen är utformad för komplex problemlösning, flerspråkig förståelse och produktionsklar kodgenerering. Dess styrkor inkluderar exceptionellt matematiskt resonemang, kodgenerering och förmåga att förstå naturligt språk. Men eftersom den är en öppen källkodsmodell kan det krävas teknisk expertis för att distribuera och finjustera den för specifika användningsområden. DeepSeek R1 är placerad bland de högpresterande AI-modellerna globalt, med kapaciteter som kan jämföras med ledande proprietära lösningar. Dess öppen‑källkodskaraktär möjliggör gemenskapsdriven utveckling och kontinuerliga uppgraderingar, inklusive planerat multimodalt stöd, förbättrad konversation och optimering av distribuerad inferens. Modellen har en ren reinforcement learning-utveckling, vilket gör att den kan uppnå GPT-4-nivåns matematiska prestanda till en avsevärt lägre kostnad. Chain-of-thought-visualiseringskapaciteten tacklar AI:s "black box"-utmaningar och ger insikter i modellens resonemangsprocess. DeepSeek R1:s API erbjuder en OpenAI‑kompatibel slutpunkt för integration, med ett pris på $0,14 per miljon token. Modellens vikter är open‑source, vilket möjliggör kommersiell användning och modifiering.
Radbrytning av kriterier
- Mixture of Experts (MoE)-arkitektur
- Avancerade förstärkningsinlärningstekniker
- Självverifierings- och flerstegsreflektionsfunktioner
- Mänskligt anpassat resonemang
- Stöd för 128K kontextlängd
- OpenAI-kompatibel API-endpoint

ASI:One
Agentisk AI-assistent som koordinerar autonoma agenter för att slutföra flerstegsuppgifter.

ASI:One är en AI‑assistent byggd kring idén om agentisk intelligens, där ett konversationsgränssnitt kan skicka och samordna specialiserade autonoma agenter för att hantera komplexa förfrågningar. Istället för att bara återge text kan den planera, anropa verktyg och köra arbetsflöden för användaren. Utvecklad inom ekosystemet för Artificial Superintelligence Alliance positioneras det som en personlig AI-agent som integreras med decentraliserade agentnätverk. Användare kan chatta med den för vardagliga frågor eller delegera längre uppgifter såsom forskning, jämförelser, schemaläggning och datauppslag över anslutna tjänster.
Radbrytning av kriterier
- Konversationell chattgränssnitt
- Orkestrering av autonoma agenter
- Planering och utförande av flerstegsuppgifter
- Anslutning till externa agenter och tjänster
- Minne och kontext i stil med personlig assistent
- Byggd på ASI Alliance agentstack


Latest DeepSeek R2 är efterträdaren till DeepSeeks R1-resonemangsmodell, utformad för att leverera starkare steg-för-steg-problemlösning över matematik, kodning och analytiska uppgifter. Den syftar till att utöka den öppna forskningsansats som gjorde tidigare DeepSeek-utgåvor populära bland utvecklare och forskare. Modellen syftar till att förbättra noggrannheten, hantera längre sammanhang och mer effektiv inferens jämfört med sin föregångare, vilket gör den lämplig för tekniska assistenter, agenterade arbetsflöden och integration i anpassade applikationer. Tillgänglighet och exakta specifikationer beror på DeepSeek's officiella releasekanaler. Användare kan vanligtvis komma åt modellen via API, chat-gränssnitt eller genom att köra öppna vikter där dessa tillhandahålls, vilket möjliggör flexibilitet för såväl individuella experiment som produktionsdistribution.
Radbrytning av kriterier
- Avancerad kedje-till-tanke-resonemang
- Utökad kontextfönster
- Kodgenerering och felsökningstöd
- Flerspråkig förståelse
- API och chat-baserad åtkomst
- Lämplig för agentbaserade applikationer
Pronoia
Arabiske första stora språkmodellen fine-tunad för ursprångskvalitetsförståelse och generering.
Pronoia är en stor språkmodell specifikt justerad för arabiska, med syfte att leverera mer exakt förståelse, generation och resonemang i språket än generella mångspråkiga modeller. Den är positionerad som en ledande arabiska-fokuell LLM, med optimeringar för dialekter, klassiska former och modern standardarabiska. Modellen kan användas för uppgifter som innehållsskapande, sammanfattning, översättning, kundtjänst och konverserande AI på arabisktalade marknader. Genom att fokusera sin träning på data från arabiska når Pronoia upp till det finstämda, såsom morfologi, diakritiska tecken och kulturell kontext, som bredare modeller ofta hanterar inkonsekvent.
Radbrytning av kriterier
- Arabiske optimerad språkmodell
- Textgenerering och sammanfattning
- Översättningsstöd
- Konversationella och chattbot-kapaciteter
- Anpassad för arabiske företags NLP
- Täckning av MSA och dialekter




