Battaglia passata · 2025-08-08 UTC
LLM Sfida — 8 agosto 2025
Dalla categoria LLM. 28 segni piazzate tra 6 sfidanti. DeepSeek V3 ha conquistato la corona.
Classifica finale
La formazione
Gli sfidanti
Profili di ogni strumento che ha gareggiato in questa battaglia, ordinati per punteggio finale.

DeepSeek V3
Modello misto di esperti open-source offrendo ragionamento a livello GPT-4o a un costo infinitesimale.

DeepSeek V3 è un modello di linguaggio a grande scala, sviluppato con tecnologia mixture-of-experts (MoE) da DeepSeek AI. Attiva solo una sottoinsieme dei suoi parametri totali per token, permettendogli di offrire un buon rendimento nelle attività di ragionamento, matematica e programmazione, mantenendo i costi di inferenza significativamente inferiori rispetto ai modelli densi comparabili. Rilasciato con pesi aperti, DeepSeek V3 si è dimostrato una scelta popolare tra i sviluppatori e gli studiosi che necessitano di un modello di base capiente che possano ospitare da soli, finetuningarlo oppure integrarlo tramite API. I benchmark lo posizionano in linea di competitività con i modelli proprietari di punta come GPT-4o, in particolare nelle valutazioni di ragionamento logico e matematico. Il modello si presta particolarmente ai assistenti tecnici, alle pipeline di generazione di codice, ai flussi di lavoro di ricerca, e a qualsiasi applicazione in cui importanza e efficienza del budget per la qualità del ragionamento siano entrambe essenziali.
Suddivisione dei criteri
- Architettura a basso carico misto di esperti
- Benchmarks competitivi in ragionamento e matematica
- Pesi del modello open-source
- Accesso all'API tramite piattaforma di DeepSeek
- Supporto a finestre di contesto estese
- Fine-tunabile amichevole

Janus pro
Modello aperto multimodale di DeepSeek per la generazione d'immagini e la comprensione visiva in un'unica architettura unificata.

Janus Pro è uno schema AI multimodale open-source da DeepSeek, disponibile nelle versioni a 1B e 7B di parametri. Unifica la comprensione visiva e la generazione di immagini in un solo framework separando i percorsi di codifica visiva, il che consente al modello di interpretare le immagini e crearle a partire da input di testo. Il variant 7B fornisce risultati competitivi su benchmark per la sintesi testo-immagine e la risposta a domande visive, spesso eguagliando o superando modelli specializzati più grandi. Rilasciato sotto licenza MIT, Janus Pro può essere auto ospitato, finetuneato e integrato in pipeline di ricerca o produzione senza restrizioni di utilizzo. Sonoide per gli sviluppatori, i ricercatori e gli appassionati che hanno bisogno di un modello di base multimodale flessibile per sperimentare, prototipare o costruire applicazioni che combinano la creazione di immagini con la comprensione di immagini.
Suddivisione dei criteri
- Generazione di immagini dal testo
- Risposta alle domande visive e analisi delle immagini
- Architettura di transformer unificata
- Opzioni a 1B e 7B di parametri
- Pesocodi open mit licenza
- Supporto di input e output multimodale

DeepSeek R1
Un modello linguistico open-source eccellente nelle attività di ragionamento, matematica e codifica, con licenza MIT per utilizzo e modifica gratuito.

DeepSeek R1 è un modello linguistico open-source che excelle nelle attività di ragionamento, matematica e codifica. Utilizza una architettura Mixture of Experts (MoE) con 37B parametri attivi e 671B parametri totali, supporta una lunghezza di contesto di 128K. Il modello incorpora tecniche avanzate di apprendimento per raggiungere la verifica self, la riflessione multi-steps e le capacità di ragionamento allineate all'uomo. DeepSeek R1 ha raggiunto un risultato di stato dell'arte nelle varie benchmark, compreso l'accuratezza del 97,3% su MATH-500, lapercentuale di passo del 79,8% su AIME 2024 e la superiore prestazione al 96,3% degli utenti di Codeforces. Il modello è disponibile in diverse varianti, che spaziano da 1,5B a 70B parametri, e viene pubblicato sotto licenza MIT per utilizzo e modifica gratuito. DeepSeek R1 può essere utilizzato online gratuitamente, e la versione accelerata per il WebGPU può essere eseguita localmente in un browser. Il modello è progettato per la risoluzione dei problemi complessi, l'intelligenza multilingue e la produzione di codice di prodzione. Le sue caratteristiche includono un'eccellente capacità di ragionamento matematico, di generazione di codice e di comprensione linguistica naturale. Tuttavia, come modello open-source, potrebbe richiedere una tecnica approfondita di implementazione e calibrazione per casi d'uso specifici. DeepSeek R1 si colloca tra le migliori prestazioni dei modelli di AI a livello globale, con capacità comparabili alle soluzioni proprietarie di punta. La sua natura open-source consente il coinvolgimento comunitario e gli aggiornamenti continui, compresa la supporto multimodale, l'interfaccia conversazionale e l'ottimizzazione dell'inferenza distribuita. Il modello ha una pura crescita per apprendimento per raggiungere il livello di prestazione della matematica GPT-4 a un costo inferiore significativamente. La capacità di visualizzazione della catena di pensiero affronta i problemi dell'"atomo di black box" per i dati di AI, fornendo informazioni sulla procedura di ragionamento del modello. L'API di DeepSeek R1 offre un endpoint compatibile con OpenAI per l'integrazione, con un costo di $0,14 per milione di token. I pesi del modello sono open-source, permettendo l'utilizzo commerciale e la modifica.
Suddivisione dei criteri
- Architettura Mixture of Experts (MoE)
- Tecniche avanzate di apprendimento per forza
- Capacità di verifica self e riflessione multi-steps
- Capacità di ragionamento allineato all'uomo
- Sostegno per una lunghezza di contesto di 128K
- Endpoint API compatibile con OpenAI

ASI:One
Assistente AI agentivo che coordina gli agenti autonomi per completare compiti multistep.

ASI:One è un assistente di intelligenza artificiale costruito intorno alla idea di una intelligenza agente, dove un'interfaccia conversazionale può incaricare e coordinare agenti autonomi specializzati per gestire richieste complesse. Al contrario di ristornare solo testo, può pianificare, chiamare strumenti e eseguire workflow in nome del utente. Sviluppato all'interno dell'ecosistema dell'Artificial Superintelligence Alliance, è posizionato come un agente di intelligenza artificiale personale che integra con reti di agenti decentralized. Gli utenti possono chattare con esso per domande quotidiane o delegare compiti più lunghi come ricerche, comparazioni, programmi e ricerche dati su servizi collegati.
Suddivisione dei criteri
- Interfaccia di chat conversazionale
- Orchestrazione di agenti autonomi
- Pianificazione e esecuzione di compiti multistep
- Connettività con agenti esterni e servizi
- Memoria e contesto del tipo di assistente personale
- Sviluppato sullo stack di agenti dell'ASI Alliance


Il Latest DeepSeek R2 è il successore al modello logico R1 di DeepSeek, progettato per fornire una risoluzione dei problemi passo dopo passo ancora più robusta in materia di matematica, codifica e compiti analitici. Si propone di estendere l'approccio basato sull'introduzione di nuove ricerche che ha reso gli annunci precedenti di DeepSeek popolari tra sviluppatori ed esperti di ricerca. Il modello si concentra sull'ottenimento di un'accuratezza migliorata, su un trattamento del contesto più lungo e su un inferenza più efficiente rispetto al suo predecessore, rendendolo adatto per le assistenti tecnologiche, i flussi di lavoro agentivi e l'integrazione in applicazioni personalizzate. La disponibilità e le specifihe esatte dipendono dai canali di rilascio ufficiali del DeepSeek. I utenti possono di solito accedere al modello tramite l'API, interfaccia di chat o eseguendo pesi aperti qualora disponibili, consentendo flessibilità sia per l'esplorazione personale sia per l'integrazione di produzione.
Suddivisione dei criteri
- Ragionamento avanzato di catena-di-pensiero
- Estensione della finestra del contesto
- Supporto per la generazione e la debuggazione del codice
- Comprensione multilingua
- Accesso tramite API e chat
- Adatto per applicazioni agente
Pronoia
Modello di linguaggio arabo iniziale grande fine-tunato per una comprensione e generazione di alta qualità nativa.
Pronoia è un modello linguistico di grandi dimensioni specificamente ottimizzato per l'arabo, con l'obiettivo di fornire una comprensione, generazione e ragionamento più accurati nella lingua rispetto ai modelli multilingue generici. È posizionato come un LLM leader incentrato sull'arabo, con ottimizzazioni per dialetti, forme classiche e arabo standard moderno. Il modello può essere utilizzato per attività come la creazione di contenuti, la sintesi, la traduzione, il supporto ai clienti e l'AI conversazionale nei mercati di lingua araba. Concentrando l'addestramento sui dati arabi, Pronoia si concentra su sfumature come la morfologia, i segni diacritici e il contesto culturale che spesso nei modelli più ampi vengono gestiti in modo incoerente.
Suddivisione dei criteri
- Modello di linguaggio ottimizzato per l'arabo
- Generazione e sintesi di testo
- Sostegno della traduzione
- Capacità conversazionale e chatbot
- Idoneo per l'arabo NLP aziendale
- Copertura del MSA e dei dialetti




