Battaglia passata · 2024-01-17 UTC
LLM Sfida — 17 gennaio 2024
Dalla categoria LLM. 37 segni piazzate tra 8 sfidanti. ASI:One ha conquistato la corona.
Classifica finale
La formazione
Gli sfidanti
Profili di ogni strumento che ha gareggiato in questa battaglia, ordinati per punteggio finale.

ASI:One
Assistente AI agentivo che coordina gli agenti autonomi per completare compiti multistep.

ASI:One è un assistente di intelligenza artificiale costruito intorno alla idea di una intelligenza agente, dove un'interfaccia conversazionale può incaricare e coordinare agenti autonomi specializzati per gestire richieste complesse. Al contrario di ristornare solo testo, può pianificare, chiamare strumenti e eseguire workflow in nome del utente. Sviluppato all'interno dell'ecosistema dell'Artificial Superintelligence Alliance, è posizionato come un agente di intelligenza artificiale personale che integra con reti di agenti decentralized. Gli utenti possono chattare con esso per domande quotidiane o delegare compiti più lunghi come ricerche, comparazioni, programmi e ricerche dati su servizi collegati.
Suddivisione dei criteri
- Interfaccia di chat conversazionale
- Orchestrazione di agenti autonomi
- Pianificazione e esecuzione di compiti multistep
- Connettività con agenti esterni e servizi
- Memoria e contesto del tipo di assistente personale
- Sviluppato sullo stack di agenti dell'ASI Alliance

Gemini 2.0 Flash
Modello AI veloce di Google per compiti real-time con finestra di contesto da 1 milione di token.

Gemini 2.0 Flash è il modello di prossima generazione di Google DeepMind ottimizzato per la velocità, la scalabilità e la ragione multimediali. Accetta i testi, le immagini, i suoni e i video come input e può generare output di testi, immagini e suoni, rendendolo adatto per applicazioni interattive ricche e complesse. Progettato con flussi di lavoro agentivi in mente, il modello supporta l'utilizzo nativo strumenti, chiamata di funzione e una finestra di contesto da 1 milione di token per gestire documenti grandi, basi di codice o sessioni di lunga durata. Una bassa latenza lo rende una scelta pratica per assistenti, analisi in tempo reale e deployment di scala di produzione. I sviluppatori possono accedere a Gemini 2.0 Flash attraverso l'API di Gemini, Google AI Studio e Vertex AI, con librerie di sviluppo disponibili per le principali lingue.
Suddivisione dei criteri
- Finestra di contesto da 1 milione di token
- Input multimodale: testo, immagine, audio, video
- Chiamata nativa di attività strumentali e esecuzione del codice
- Risposte in tempo reale mediante streaming
- Generazione di immagini e audio
- Disponibile tramite Gemini API e Vertex AI

Mistral Small 3
Modello LLM open-source compatto con prestazioni competitive ed esigenze computazionali ridotte.

Mistral Small 3 è un modello linguistico di grandi dimensioni leggero di Mistral AI, progettato per offrire elevate capacità di ragionamento e generazione, mentre funziona in maniera efficiente su hardware modesto. Si rivolge ai sviluppatori ed alle organizzazioni che desiderano un'IA capace senza i costi di infrastruttura dei modelli a scala frontiera. Rilasciato sotto una licenza open source, il modello può essere autoospitato, finetizzato e integrato in applicazioni commerciali. La sua bilancia tra velocità, accuratezza ed efficienza di risorse lo rende adatto per gli assistenti di chat, la generazione del contenuto, il compito di codifica e i diployamenti sul posto con i quali conta la latenza o la privacy.
Suddivisione dei criteri
- Rilascio del modello open-weight
- Optimizzato per l'inferenza efficiente
- Risultati di benchmark competitivi
- Supporta la finetunifica e la personalizzazione
- Congruitabile per i diployamenti sul posto
- Generazione di testo multilingue

OpenAI o3
Modello di ragionamento avanzato di OpenAI per la risoluzione di problemi complessi a più passaggi

OpenAI o3 è un modello di ragionamento all'avanguardia progettato per affrontare problemi che richiedono un pensiero attento e passo dopo passo. Si basa sull'approccio della serie o di spendere più potenza computazionale al momento dell'inferenza per pianificare, verificare e perfezionare le risposte, rendendolo particolarmente adatto per attività in matematica, programmazione, scienza e analisi logica. Rispetto ai modelli di chat generici, o3 enfatizza la profondità rispetto alla velocità. Può scomporre i prompt ambigui, valutare più approcci e produrre output più affidabili sui benchmark che stressano la capacità di ragionamento e l'uso degli strumenti. Gli sviluppatori possono accedervi tramite l'OpenAI API e ChatGPT, dove si integra con strumenti come la navigazione web, Python e l'analisi di file. Il modello è rivolto a ricercatori, ingegneri e utenti esperti che necessitano di una maggiore accuratezza su problemi complessi e sono disposti a scambiare una certa latenza e un costo più elevato per risultati di qualità superiore.
Suddivisione dei criteri
- Ragionamento a catena di pensiero esteso
- Utilizzo di strumenti compreso codice, web e file
- Finestra di contesto ampia per documenti lunghi
- Disponibilità dell'API e di ChatGPT
- Accuratezza migliorata sui benchmark del dominio STEM
- Supporto per workflow agente complesso

DeepSeek R1
Un modello linguistico open-source eccellente nelle attività di ragionamento, matematica e codifica, con licenza MIT per utilizzo e modifica gratuito.

DeepSeek R1 è un modello linguistico open-source che excelle nelle attività di ragionamento, matematica e codifica. Utilizza una architettura Mixture of Experts (MoE) con 37B parametri attivi e 671B parametri totali, supporta una lunghezza di contesto di 128K. Il modello incorpora tecniche avanzate di apprendimento per raggiungere la verifica self, la riflessione multi-steps e le capacità di ragionamento allineate all'uomo. DeepSeek R1 ha raggiunto un risultato di stato dell'arte nelle varie benchmark, compreso l'accuratezza del 97,3% su MATH-500, lapercentuale di passo del 79,8% su AIME 2024 e la superiore prestazione al 96,3% degli utenti di Codeforces. Il modello è disponibile in diverse varianti, che spaziano da 1,5B a 70B parametri, e viene pubblicato sotto licenza MIT per utilizzo e modifica gratuito. DeepSeek R1 può essere utilizzato online gratuitamente, e la versione accelerata per il WebGPU può essere eseguita localmente in un browser. Il modello è progettato per la risoluzione dei problemi complessi, l'intelligenza multilingue e la produzione di codice di prodzione. Le sue caratteristiche includono un'eccellente capacità di ragionamento matematico, di generazione di codice e di comprensione linguistica naturale. Tuttavia, come modello open-source, potrebbe richiedere una tecnica approfondita di implementazione e calibrazione per casi d'uso specifici. DeepSeek R1 si colloca tra le migliori prestazioni dei modelli di AI a livello globale, con capacità comparabili alle soluzioni proprietarie di punta. La sua natura open-source consente il coinvolgimento comunitario e gli aggiornamenti continui, compresa la supporto multimodale, l'interfaccia conversazionale e l'ottimizzazione dell'inferenza distribuita. Il modello ha una pura crescita per apprendimento per raggiungere il livello di prestazione della matematica GPT-4 a un costo inferiore significativamente. La capacità di visualizzazione della catena di pensiero affronta i problemi dell'"atomo di black box" per i dati di AI, fornendo informazioni sulla procedura di ragionamento del modello. L'API di DeepSeek R1 offre un endpoint compatibile con OpenAI per l'integrazione, con un costo di $0,14 per milione di token. I pesi del modello sono open-source, permettendo l'utilizzo commerciale e la modifica.
Suddivisione dei criteri
- Architettura Mixture of Experts (MoE)
- Tecniche avanzate di apprendimento per forza
- Capacità di verifica self e riflessione multi-steps
- Capacità di ragionamento allineato all'uomo
- Sostegno per una lunghezza di contesto di 128K
- Endpoint API compatibile con OpenAI

DeepSeek V3
Modello misto di esperti open-source offrendo ragionamento a livello GPT-4o a un costo infinitesimale.

DeepSeek V3 è un modello di linguaggio a grande scala, sviluppato con tecnologia mixture-of-experts (MoE) da DeepSeek AI. Attiva solo una sottoinsieme dei suoi parametri totali per token, permettendogli di offrire un buon rendimento nelle attività di ragionamento, matematica e programmazione, mantenendo i costi di inferenza significativamente inferiori rispetto ai modelli densi comparabili. Rilasciato con pesi aperti, DeepSeek V3 si è dimostrato una scelta popolare tra i sviluppatori e gli studiosi che necessitano di un modello di base capiente che possano ospitare da soli, finetuningarlo oppure integrarlo tramite API. I benchmark lo posizionano in linea di competitività con i modelli proprietari di punta come GPT-4o, in particolare nelle valutazioni di ragionamento logico e matematico. Il modello si presta particolarmente ai assistenti tecnici, alle pipeline di generazione di codice, ai flussi di lavoro di ricerca, e a qualsiasi applicazione in cui importanza e efficienza del budget per la qualità del ragionamento siano entrambe essenziali.
Suddivisione dei criteri
- Architettura a basso carico misto di esperti
- Benchmarks competitivi in ragionamento e matematica
- Pesi del modello open-source
- Accesso all'API tramite piattaforma di DeepSeek
- Supporto a finestre di contesto estese
- Fine-tunabile amichevole
Llama 3.3
LLM aperto multilingue di Meta ottimizzato per la generazione di testo efficiente e di alta qualità.

Llama 3.3 è un modello linguistico di grandi dimensioni sviluppato da Meta, progettato per fornire capacità di ragionamento forte, codifica e multilingue, con un maggiore efficienza di esecuzione rispetto ai precedenti modelli flagship. Sostiene una vasta gamma di lingue e si adatta bene per assistenti di chat, generazione di contenuti, riassunti e strumenti per lo sviluppatore. Rilasciato con pesi aperti, può essere distribuito sul posto oppure attraverso principali provider cloud e di inference, concedendo alle squadre flessibilità sul costo, la latenza e il trattamento dei dati. La variante addestrata ai comandi è ottimizzata per seguire le istruzioni esattamente e produrre risposte conversazioni utili e di aiuto. I sviluppatori utilizzano comunemente Llama 3.3 come base per la calibrazione di applicazioni domain-specific, sistemi di generazione rilevamento-aumentata e flussi di lavoro agentivi.
Suddivisione dei criteri
- Generazione di testo multilingue
- Varianti di chat istruzioni ottimizzate
- Supporto a lungo contesto
- Capacità di codifica e ragionamento
- Pesi aperti per la fine-tuning
- Compatibilità con i maggiori framework di inferenza
Pronoia
Modello di linguaggio arabo iniziale grande fine-tunato per una comprensione e generazione di alta qualità nativa.
Pronoia è un modello linguistico di grandi dimensioni specificamente ottimizzato per l'arabo, con l'obiettivo di fornire una comprensione, generazione e ragionamento più accurati nella lingua rispetto ai modelli multilingue generici. È posizionato come un LLM leader incentrato sull'arabo, con ottimizzazioni per dialetti, forme classiche e arabo standard moderno. Il modello può essere utilizzato per attività come la creazione di contenuti, la sintesi, la traduzione, il supporto ai clienti e l'AI conversazionale nei mercati di lingua araba. Concentrando l'addestramento sui dati arabi, Pronoia si concentra su sfumature come la morfologia, i segni diacritici e il contesto culturale che spesso nei modelli più ampi vengono gestiti in modo incoerente.
Suddivisione dei criteri
- Modello di linguaggio ottimizzato per l'arabo
- Generazione e sintesi di testo
- Sostegno della traduzione
- Capacità conversazionale e chatbot
- Idoneo per l'arabo NLP aziendale
- Copertura del MSA e dei dialetti





