Eerdere strijd · 2024-01-17 UTC
LLM Duel — 17 januari 2024
Uit de categorie LLM. 37 markeringen geplaatst over 8 strijders. ASI:One pakte de kroon.
Eindstand
De line-up
De strijders
Profielen van elke tool die in deze strijd meedeed, gerangschikt op eindscore.

ASI:One
Agentische AI‑assistant die autonome agenten coördineert om meerstaps‑taken uit te voeren.

ASI:One is een AI‑assistant die draait om het concept van agentische intelligentie, waarbij een conversatie‑interface speciale autonome agenten kan inzetten en coördineren om complexe verzoeken af te handelen. In plaats van alleen tekst te retourneren, kan het plannen, tools aanroepen en workflows uitvoeren namens de gebruiker. Ontwikkeld binnen het Artificial Superintelligence Alliance‑ecosysteem, is het gepositioneerd als een persoonlijke AI‑agent die integreert met gedecentraliseerde agentennetwerken. Gebruikers kunnen er met een chat vragen stellen voor dagelijks gebruik of langere taken delegeren, zoals onderzoek, vergelijkingen, planning en dataverzoeken via verbonden services.
Kritériumverdeling
- Conversatie‑chat interface
- Orkestratie van autonome agenten
- Planning en uitvoering van meervoudige taken
- Connectiviteit met externe agenten en services
- Persoonlijke assistent‑stijl geheugen en context
- Gebouwd op de ASI Alliance agent stack

Gemini 2.0 Flash
Google's snelle, multimodale AI-model ontworpen voor real-time agentische taken met een 1M-token contextvenster.

Gemini 2.0 Flash is het volgende generatie model van Google DeepMind, geoptimaliseerd voor snelheid, schaal en multimodale redenering. Het accepteert tekst, afbeeldingen, audio en video als invoer en kan tekst, afbeeldingen en audio als uitvoer genereren, waardoor het geschikt is voor rijke interactieve toepassingen. Met agentische workflows in gedachten ondersteunt het model native toolgebruik, functietoepassing en een 1M-token contextvenster om grote documenten, codebases of langdurige sessies te behandelen. De lage latentie maakt het een praktische keuze voor assistenten, real-time analyse en productie-implementaties. Ontwikkelaars kunnen Gemini 2.0 Flash benaderen via de Gemini API, Google AI Studio en Vertex AI, met SDK's beschikbaar in meerdere talen.
Kritériumverdeling
- 1M-token contextvenster
- Multimodale invoer: tekst, afbeelding, audio, video
- Native toolaanroep en code-uitvoering
- Real-time streaming reacties
- Afbeeldings- en audio‑generatie
- Beschikbaar via Gemini API en Vertex AI

Mistral Small 3
Compact open-source LLM met concurrerende prestaties en lagere rekentermijnen.

Mistral Small 3 is een lichtgewicht groot taalmodel van Mistral AI, ontworpen om sterke redeneer- en generatiecapaciteiten te bieden terwijl het efficiënt draait op bescheiden hardware. Het richt zich op ontwikkelaars en organisaties die capabele AI willen zonder de infrastructuurkosten van grensmodel-modelschaal. Uitgegeven onder een open licentie, kan het model zelf worden gehost, fijngestemd en geïntegreerd in commerciële toepassingen. De balans tussen snelheid, nauwkeurigheid en resource-efficiëntie maakt het geschikt voor chatassistenten, contentgeneratie, codetaken en on-premise-implementaties waar latentie of privacy belangrijk is.
Kritériumverdeling
- Open-weight modelrelease
- Geoptimaliseerd voor efficiënte inferentie
- Concurrerende benchmarkresultaten
- Ondersteunt fijnafstemming en maatwerk
- Geschikt voor on-premise-implementatie
- Meertalige tekstgeneratie

OpenAI o3
Geavanceerd redeneer-model van OpenAI voor complexe, meerstappige probleemoplossing

OpenAI o3 is een grensverkennend redeneer-model dat is ontworpen om problemen aan te pakken die zorgvuldige, stapsgewijze denkwerk vereisen. Het bouwt voort op de o-serie aanpak van het besteden van meer rekentijd tijdens de inferentie om antwoorden te plannen, te verifiëren en te verfijnen, waardoor het goed geschikt is voor taken in wiskunde, codering, wetenschap en logische analyse. In vergelijking met algemene chatmodellen legt o3 de nadruk op diepte in plaats van snelheid. Het kan dubbelzinnige prompts opsplitsen, meerdere benaderingen evalueren en betrouwbaardere uitvoer produceren bij benchmarks die redeneervermogen en gereedschapgebruik testen. Ontwikkelaars kunnen er toegang toe krijgen via de OpenAI API en ChatGPT, waar het integreert met tools zoals webbrowsen, Python en bestandsanalyse. Het model is gericht op onderzoekers, ingenieurs en krachtige gebruikers die een hogere nauwkeurigheid nodig hebben voor moeilijke problemen en bereid zijn enige latentie en kosten te accepteren voor resultaten van hogere kwaliteit.
Kritériumverdeling
- Uitgebreide chain-of-thought-redenering
- Gebruik van tools, waaronder code-, web- en bestandsinvoer
- Groot contextvenster voor lange documenten
- Beschikbaarheid via API en ChatGPT
- Verbeterde nauwkeurigheid op STEM-benchmarks
- Ondersteunt complexe agentic-workflows

DeepSeek R1
Een open-source groot taalmodel dat uitblinkt in redeneren, wiskunde en coderingstaken met MIT-licentie voor gratis gebruik en aanpassing.

DeepSeek R1 is een open-source groot taalmodel dat uitblinkt in redeneren, wiskunde en coderingstaken. Het maakt gebruik van een Mixture of Experts (MoE) architectuur met 37B actieve parameters en 671B totale parameters, en ondersteunt een contextlengte van 128K. Het model integreert geavanceerde reinforcement learning-technieken om zelf-verificatie, multi-step reflectie en mensgericht redeneren te realiseren. DeepSeek R1 heeft state-of-the-art prestaties behaald op diverse benchmarks, waaronder 97,3% nauwkeurigheid op MATH-500, een slagen van 79,8% op AIME 2024 en het overtreffen van 96,3% van de Codeforces-deelnemers. Het model is beschikbaar in verschillende varianten, variërend van 1,5B tot 70B parameters, en is gelicenseerd onder MIT voor gratis gebruik en aanpassing. DeepSeek R1 kan online gratis worden gebruikt, en een WebGPU-versnelling versie kan lokaal in een browser draaien. Het model is ontworpen voor complexe probleemoplossing, meertalige begrip en productie-waardige codegeneratie. De sterke punten zijn uitzonderlijke wiskundige redenering, codegeneratie en mogelijkheden voor natuurlijke taalbegrip. Als open-source model kan het echter technische expertise vereisen om te implementeren en af te stemmen op specifieke toepassingen. DeepSeek R1 staat op het niveau van de beste AI-modellen wereldwijd, met mogelijkheden die vergelijkbaar zijn met toonaangevende commerciële oplossingen. De open-source aard maakt communitygedreven ontwikkeling en continue upgrades mogelijk, waaronder geplande multimodale ondersteuning, conversatieverbetering en gedistribueerde inferentie-optimalisatie. Het model is ontwikkeld met puur reinforcement learning, waardoor het GPT‑4‑niveau wiskundeprestaties behaalt tegen een aanzienlijk lagere kostprijs. De chain-of-thought visualisatie‑mogelijkheid biedt inzichten in het redeneringsproces van het model, waardoor AI “black box” uitdagingen worden aangepakt. De API van DeepSeek R1 biedt een OpenAI‑compatibele endpoint voor integratie, met een prijs van 0,14 $ per miljoen tokens. De gewichten van het model zijn open-source, waardoor commercieel gebruik en aanpassing mogelijk zijn.
Kritériumverdeling
- Mixture of Experts (MoE) architectuur
- Geavanceerde reinforcement learning-technieken
- Zelf-verificatie en multi-step reflectiemogelijkheden
- Mensgericht redeneren
- Ondersteuning voor 128K contextlengte
- OpenAI-compatibele API-endpoint

DeepSeek V3
Open-source mixture-of-experts-model dat GPT-4o-achtige redenering levert tegen een fractie van de kosten.

DeepSeek V3 is een grootschalig Mixture-of-Experts (MoE) taalmodel ontwikkeld door DeepSeek AI. Het activeert slechts een subset van zijn totale parameters per token, waardoor het sterke prestaties levert bij redeneerstaken, wiskunde en programmeertaken, terwijl de inferentiekosten aanzienlijk lager blijven dan bij vergelijkbare dichte modellen. Uitgebracht met open weights, is DeepSeek V3 een populaire keuze geworden voor ontwikkelaars en onderzoekers die een capabel basismodel nodig hebben dat ze zelf kunnen hosten, fijn afstemmen of integreren via API. Benchmarks plaatsen het model concurrerend tegen toonaangevende propriëtaire modellen zoals GPT-4o, vooral op wiskundige en logische redeneertestevaluaties. Het model is zeer geschikt voor technische assistenten, code generatiepijplijnen, onderzoeks workflows en elke toepassing waarbij zowel de kwaliteit van het redeneren als de budget efficiëntie belangrijk zijn.
Kritériumverdeling
- Mixture-of-experts-architectuur
- Competitieve benchmarks op redeneervermogen en wiskunde
- Open-source modelgewichten
- API-toegang via DeepSeek-platform
- Ondersteuning voor lange contextvensters
- Geschikt voor fine-tuning
Llama 3.3
Meta's meertalige open-weight LLM, afgestemd voor efficiënte, hoogwaardige tekstgeneratie.

Llama 3.3 is een groot taalmodel van Meta dat is ontworpen om sterke redeneermogelijkheden, codeercapaciteiten en meertalige mogelijkheden te leveren, terwijl het efficiënter is om uit te voeren dan eerdere vlaggenschipmodellen. Het ondersteunt een breed scala aan talen en is geschikt voor chatassistenten, contentgeneratie, samenvatting en ontwikkelaarstools. Uitgegeven met open gewichten, kan het worden geïmplementeerd on-premises of via grote cloud- en inferentieproviders, waardoor teams flexibiliteit krijgen over kosten, latentie en gegevensbeheer. De instructie-afgestemde variant is geoptimaliseerd voor het nauwkeurig volgen van prompts en het produceren van behulpzame, gesprekskundige reacties. Ontwikkelaars gebruiken Llama 3.3 vaak als basis voor het afstemmen van domeinspecifieke toepassingen, retrieval-augmented generatiesystemen en agentic workflows.
Kritériumverdeling
- Meertalige tekstgeneratie
- Instructie-afgestemde chatvariant
- Ondersteuning voor lange context
- Codeer- en redeneermogelijkheden
- Open gewichten voor fijnafstemming
- Compatibel met grote inferentieframeworks
Pronoia
Arabisch-eerste grote taalmodel fine-tuned voor inheemse-kwaliteit begrijpen en genereren.
Pronoia is een groot taalmodel dat specifiek is afgestemd op het Arabisch, met als doel een nauwkeurigere tekstbegrip, -generatie en -redenering in de taal te leveren dan algemene meertalige modellen. Het wordt gepositioneerd als een toonaangevend Arabisch gericht LLM, met optimalisaties voor dialecten, klassieke vormen en modern standaard Arabisch. Het model kan worden gebruikt voor taken zoals contentcreatie, samenvatting, vertaling, klantenondersteuning en conversationele AI in Arabisch sprekende markten. Door de training te concentreren op Arabische gegevens, richt Pronoia zich op nuances zoals morfologie, diacritica en culturele context die bredere modellen vaak inconsistent hanteren.
Kritériumverdeling
- Arabisch geoptimaliseerd taalmodel
- Tekstgeneratie en samenvatting
- Vertaling ondersteuning
- Conversatie en chatbotcapabiliteiten
- Geïntegreerd in arabische NLP enterprise-toepassingen
- Omschrijving van MSA en dialecten





