Battaglia passata · 2025-01-11 UTC
AI Agent Development Frameworks Sfida — 11 gennaio 2025
Dalla categoria AI Agent Development Frameworks. 38 segni piazzate tra 10 sfidanti. Mastra ha conquistato la corona.
Classifica finale
La formazione
Gli sfidanti
Profili di ogni strumento che ha gareggiato in questa battaglia, ordinati per punteggio finale.

Mastra
Frammento open-source TypeScript per la creazione di agenti AI, workflow, RAG, memoria e MCP, con studio cloud opzionale ed osservabilità.

Mastra è un framework open-source di TypeScript per la creazione di applicazioni e agenti alimentati dall'intelligenza artificiale. fornisce un insieme di strumenti per i sviluppatori che vanno dall'idea all'implementazione, compresi agenti, flussi di lavoro, memoria, spazi di lavoro, osservabilità e di integrarsi con vari framework frontend e backend e può essere distribuito come un server a stanze singole. consente ai sviluppatori di costruire una varietà di funzionalità, come agenti di automazione interne, agenti rivolti ai clienti e altro ancora. Mastra include funzionalità come osservabilità integrata, controlli ripetibili e stream di elaborazione ricaricabili con cache. è progettato per supportare i startup di dimensione industriale che crescono rapidamente e le grandi organizzazioni globali. L'architettura di Mastra è centrata su agenti, che possono essere definiti con istruzioni, modelli, strumenti e comportamento di esecuzione in tempo reale. Gli agenti possono interagire con gli utenti, completare compiti e passare il flusso di prodotto. Il framework include anche un sistema di eventi predefinito per eventi, nonché un sistema per pubblicare e sottoscrivere eventi con Redis Streams e Google Cloud Pub/Sub. Mastra dispone di un ricco ecosistema di risorse, compresi libri, blog e guide. Ha una vasta comunità di utenti e viene adottata ampiamente in diversi settori industriali.
Suddivisione dei criteri
- Agenti
- Flussi di lavoro
- Memoria
- Spazi di lavoro
- Osservabilità
- Sistema di eventi incorporato

AI Legion
Un'open-source platform per creare agenti informatici autonomi che collaborano per assolvere compiti.

La piattaforma AI Legion è un'infrastruttura open source per creare agenti di intelligenza artificiale autonomi che collaborano per compiere compiti. Utilizza modelli di linguaggio di grandi dimensioni, come GPT-3.5-turbo e GPT-4, per consentire agli agenti di lavorare insieme e raggiungere obiettivi complessi. La piattaforma fornisce un framework per configurare e gestire questi agenti, incluso file di configurazione, API e workflow. AI Legion è progettata per essere estensibile e personalizzabile, consentendo agli utenti di creare e integrare i propri modelli, azioni e caratteristiche. La piattaforma è adatta a un'ampia gamma di casi d'uso, incluso ricerca, sviluppo e deploy di sistemi di intelligenza artificiale autonomi . L'impostazione di un ambiente AI Legion prevede l'installazione delle dipendenze richieste, tra cui Node.js e le chiavi dell'API OpenAI. Gli agenti possono essere quindi avviati e interagiti tramite la console. La piattaforma comprende inoltre funzionalità per la gestione dello stato degli agenti, compresa la possibilità di cancellare i log degli eventi e riavviare gli agenti con configurazioni personalizzate. AI Legion è un potente strumento per la creazione e il deploy di sistemi di intelligenza artificiale autonomi, e la sua natura open-source ne fa un accessibile a una vasta gamma di utenti. Tuttavia, richiede anche una considerevole quantità di expertise tecnica e sforzo di configurazione per impostarlo e utilizzarlo in modo efficace. Un importante beneficio offerto da AI Legion consiste nella sua capacità di permettere agli agenti di imparare e adattarsi nel tempo, utilizzando una combinazione di tecniche di apprendimento automatico e grafi di conoscenza. Ciò consente agli agenti di migliorare le loro prestazioni e le loro capacità di decisione nel corso del tempo delle loro interazioni con l'ambiente. Tuttavia, AI Legion presenta anche alcune sfide e limitazioni, tra le quali l'ampia necessità di configurazione e di gestione, il rischio di errori e loop infiniti dell'agente, e la possibilità di elevati conteggi di token e costi di utilizzo API. Inoltre, l'utilizzo di grandi modelli di linguaggio può sollevare preoccupazioni attorno alla bias e accuratezza. In termini di funzionalità specifiche, AI Legion prevede il supporto per le ricerche web, gli motori di ricerca personalizzati e le APIC , nonché la possibilità di gestire lo stato degli agenti e di riavviarli con configurazioni personalizzate. La piattaforma è anche altamente estensibile, consentendo agli utenti di creare e integrare i propri modelli, le azioni e le funzionalità. Alcune delle possibili applicazioni dell'AI Legion includono la ricerca e lo sviluppo di sistemi di IA autonomi, il dispiegamento di workflow e processi potenziati da AI e la creazione di strumenti e applicazioni personalizzate potenziate da AI. In sintesi, AI Legion rappresenta una potente e scalabile piattaforma per la creazione e la distribuzione di sistemi di intelligenza artificiale autonomi, ma richiede un notevole livello di conoscenza tecnica e di sforzo di configurazione per essere utilizzato efficacemente.
Suddivisione dei criteri
- Ricerca web
- Motori di ricerca personalizzati
- API e webhook per l'integrazione
- Gestione dello stato degli agenti
- Creazione di modelli e azioni personalizzati
- Funzionalità di grafo di conoscenza e apprendimento automatico

AutoML-Agent
Frammento di codice aperto di orchestrazione multi-agente LLM che automa tutti i processi di apprendimento automatico.

AutoML-Agent è un framework open-source che utilizza agenti di linguaggio grande modellato in coordinamento per gestire l'intero ciclo di apprendimento automatico. Invece di affidarsi a un singolo modello o script, delega compiti come la comprensione dei dati, la preparazione dei dati, la selezione del modello, l'addestramento e l'evaluazione tra agenti specializzati che collaborano verso un obiettivo condiviso. Il framework è destinato a ricercatori e sviluppatori che vogliono automatizzare l'esecuzione di esperimenti senza dover scrivere codice di pipeline estensivo. Descrivendo un insieme di dati e un obiettivo nella lingua naturale, gli utenti possono avere agenti proporre, costruire e iterare sulle soluzioni candidate, mettendo in luce risultati e ragionamenti nel corso del cammino. A causa del fatto che è open source, AutoML-Agent può essere esteso con agenti personalizzati, strumenti o back-end dei modelli, rendendolo utile sia come sistema AutoML pratico che come laboratorio di prova per flussi di lavoro multi-agente.
Suddivisione dei criteri
- Orchestrazione multi-agente LLM
- Esecuzione automatizzata e gestione dei dati e delle funzionalità
- Selezione del modello e ricerca degli hyperparametri
- Generazione del pipeline da addestramento e valutazione
- Specificazione del compito del ML con descrizione di linguaggio naturale
- Architettura estensibile per agenti personalizzati

Cerebrum: AIOS SDK
Un SDK per lo sviluppo e la distribuzione di agenti di intelligenza artificiale basati su LLM all'interno del framework AIOS.

Cerebrum è un SDK per lo sviluppo e la distribuzione di agenti di intelligenza artificiale basati su LLM all'interno del framework AIOS (Sistema Operativo degli Agenti di Intelligenza Artificiale). AIOS affronta sfide come la programmazione del piano di esecuzione, la gestione di contesti, la memoria e la gestione degli strumenti per gli agenti basati su LLM. L'SDK Cerebrum consente ai developer di costruire e eseguire applicazioni di agente interagendo col kernel di AIOS. Supporta sia l'interfaccia utente web che l'interfaccia utente terminale. L'SDK include funzionalità per la lista degli LLM, degli agenti e degli strumenti disponibili, nonché il download, l'upload e l'esecuzione degli agenti e degli strumenti. Cerebrum è pensato per utenti ed enti sviluppatori di agenti, consentendo loro di creare e distribuire applicazioni di agenti di intelligenza artificiale.
Suddivisione dei criteri
- Sviluppo e distribuzione di agenti
- Gestione degli agenti basati su LLM
- Supporto per l'interfaccia utente web e l'interfaccia utente terminale
- Gestione di agenti ed estratte dagli strumenti
- Lista degli LLM, degli agenti e degli strumenti disponibili
- Download e upload degli agenti e degli strumenti

Gemma 3
Un modello di intelligenza artificiale open-source ottimizzato per le prestazioni da un GPU, che supporta l'ingresso multimodale e oltre 140 lingue.

Gemma 3 rappresenta una raccolta di modelli aperti leggeri, di ultima generazione e progettati per essere eseguiti su dispositivi, in particolare ottimizzati per il singolo processore grafico (GPU). Supporta input multimodali e oltre 140 lingue. Il modello è disponibile in varie dimensioni (1B, 4B, 12B e 27B), consentendo agli sviluppatori di scegliere la dimensione migliore in funzione delle loro esigenze hardware e di prestazioni. Gemma 3 offre abilità di ragionamento avanzato testuale e visiva, un contesto di finestra di 128k-token e chiamata di funzione per compiti complessi. Inoltre, include versioni quantizzate per un maggiore prestazioni e requisiti computazionali ridotti. Il modello fa parte del impegno di Google ad avere accesso tecnologia AI utile e si basa su ricerche e tecnologie che alimentano i loro modelli Gemini 2.0. Gemma 3 è stato progettato per consentire agli sviluppatori di creare applicazioni AI in grado di eseguirsi direttamente su dispositivi come telefoni, laptop e workstations. Gemma 3 fornisce prestazioni di ultima generazione per la sua taglia, superando altri modelli come Llama3-405B, DeepSeek-V3 e o3-mini in valutazioni preliminari di preferenza umana. Ciò consente l'applicazione globale con supporto off-the-shelf per oltre 35 lingue e supporto pretrained per oltre 140 lingue. Il modello consente la creazione di workflow guidati dall'IA utilizzando chiamate da funzione e output strutturati. Lo sviluppo di Gemma 3 ha comportato protocolli di sicurezza rigorosi, come l'amministrazione dei dati estensiva, l'allineamento alle politiche di sicurezza tramite la fine-tuning, e valutazioni di benchmark robuste. La famiglia di modelli Gemma ha registrato un'aduzione significativa, con più di 100 milioni di download ed una comunità vivace che ha creato più di 60.000 varianti di Gemma. Le capacità di Gemma 3 la rendono adatta per i programmatori che vogliono creare esperienze di user coinvolgenti che possono adattarsi su un solo host GPU o TPU.
Suddivisione dei criteri
- Sostegno AI multimodale
- sviluppo focalizzato sulla responsabilità
- fino-tuning estensivo
- supporto per 140 lingue
- performanza migliorata
- sostegno quantizzato

MiniMax‑M1
Modello di ragionamento grande scala open-source con contesto di 1 milione di token e architettura ibrida Mixture-of-Experts.

MiniMax-M1 è un modello di ragionamento ibrido di grandi dimensioni con peso aperto. È alimentato da un'architettura ibrida Mixture-of-Experts (MoE) combinata con un meccanismo di attenzione fulmineo, che consente una scalabilità efficiente del calcolo al momento del test. Il modello supporta nativamente una lunghezza del contesto di 1 milione di token ed è stato addestrato utilizzando l'apprendimento per rinforzo su larga scala (RL) su diversi problemi. Superperform altri modelli con peso aperto forti su compiti complessi di ingegneria del software, utilizzo di strumenti e contesto lungo. Gli esperimenti su benchmark standard mostrano che MiniMax-M1 supera altri modelli in compiti categoriali come matematica, programmazione, ingegneria del software, utilizzo di strumenti agentic e comprensione di contesti lunghi. Il modello è particolarmente adatto per compiti complessi che richiedono l'elaborazione di input lunghi e un'ampia riflessione. MiniMax-M1 rappresenta una solida base per gli agenti dei modelli linguistici di prossima generazione, che consentono di ragionare e affrontare le sfide del mondo reale. Il confronto delle prestazioni di benchmark dei principali modelli commerciali e open-weight in diverse categorie di attività evidenzia le prestazioni del modello. Il rapporto tecnico fornisce ulteriori informazioni sull'architettura del modello, sul protocollo di addestramento e sui risultati della valutazione.
Suddivisione dei criteri
- Architettura ibrida Mixture-of-Experts (MoE)
- Meccanismo di attenzione lampo
- Quadro di apprendimento per rinforzo in larga scala (RL)
- Lunghezza del contesto di 1 milione di token
- Scalabilità efficiente del computo al tempo del test

ScreenAgent
Agente open-source per il controllo delle interfacce utente tramite pianificazione ed esecuzione del mouse/tastiera.

ScreenAgent è un agente open-source basato sul Modello Linguistico Visivo (VLM) progettato per controllare interfacce utente di computer tramite operazioni sul mouse e tastiera. Abilita l'interazione con monitor reali osservando screenshot ed eseguendo azioni. Il progetto comprende un processo di pianificazione-esecuzione-riflessione che guida l'agente a completare compiti a più passaggi. È stato creato per affrontare il dilemma di insegnare agli agenti a utilizzare i computer, richiedendo capacità come la pianificazione dei compiti, la comprensione delle immagini e la posizionamento visivo. Il dataset ScreenAgent, che copre varie attività di computer quotidiano, è stato annotato a mano per supportare l'apprendimento del modello. Il progetto consiste in un client per il controllo del desktop, un dataset, operai di modello per l'inferenza e codice per l'allenamento. Supporta operazioni di base sul mouse e tastiera e può essere applicato a diversi sistemi operativi desktop e applicazioni. L'approccio di ScreenAgent è universale e non dipende da specifiche API, rendendolo versatile.
Suddivisione dei criteri
- Esecuzione di operazioni sul mouse e tastiera
- Processo di pianificazione-esecuzione-riflessione per la completazione dei compiti
- Supporto per vari sistemi operativi desktop e applicazioni
- Annotazione manuale del dataset ScreenAgent per una copertura di compiti varie
- Agente VLM per l'interazione con l'interfaccia utente

BabyBeeAGI
Una versione avanzata di BabyAGI con gestione migliorata delle attività e funzionalità.

BabyBeeAGI è un framework sperimentale per la creazione di agenti autonomi auto-costruttori. È stato creato come evoluzione dell'originale BabyAGI dal marzo 2023, che ha presentato la pianificazione di compiti per agenti autonomi. Il framework è costruito intorno a un nuovo framework di funzioni chiamato 'functionz' che memorizza, gestisce e esegue funzioni da una base di dati. Caratterizza una struttura basata su grafi per il tracciamento degli import, delle funzioni dipendenti e delle chiavi di autenticazione, insieme a caricamenti automatici ed elaborazioni dei log esaustive. Il framework comprende anche una dashboard per la gestione di funzioni, l'esecuzione di aggiornamenti e la visualizzazione dei log. È progettato per essere semplice e suscitare discussione tra i developer, non per utilizzi produttivi. L'idea di base è costruire la cosa più semplice capace di costruirsi stesso, rendendolo un approccio interessante per lo sviluppo di agenti autonomi.
Suddivisione dei criteri
- Registrazione delle funzioni e gestione dei dati di metadati
- Raccolta di dipendenze e dipendenze chiave
- Caricamento automatico e logging
- Dashboard per la gestione di funzioni e visualizzazione dei log

MCP‑Use
Piattaforma open-source per connettere i modelli linguistici con i server MCP e costruire agenti AI personalizzati con accesso ai strumenti.

mcp-use è una piattaforma open-source che facilita la connessione di Large Language Models (LLM) con server MCP e consente lo sviluppo di agenti AI personalizzati in grado di interagire con questi LLM. La piattaforma fornisce un framework MCP completo (mcp-use SDK) per creare app ChatGPT, connettori Claude e server MCP. Con mcp-use, gli sviluppatori possono sfruttare un singolo codebase per distribuire le loro applicazioni su varie piattaforme dove gli utenti e gli agenti già lavorano, tra cui ChatGPT, Claude e Gemini. La piattaforma offre una serie di strumenti e funzionalità, come la possibilità di creare applicazioni MCP con un singolo comando, distribuzione automatica su Manufact Cloud e analisi e osservabilità integrate. Gli sviluppatori possono utilizzare l' SDK mcp-use per creare e distribuire server e applicazioni MCP senza richiedere strumenti aggiuntivi. La piattaforma fornisce anche un Visual Inspector e funzionalità di test Sandbox, che consentono agli sviluppatori di testare le loro applicazioni senza la necessità di un LLM attivo. mcp-use mira a semplificare lo sviluppo e la distribuzione di applicazioni basate su MCP, rendendolo un'opzione attraente per gli sviluppatori che cercano di creare e distribuire agenti e applicazioni AI personalizzate.
Suddivisione dei criteri
- Gestione dei server MCP
- Connesione e integrazione dei LLM
- Sviluppo di agenti AI personalizzati
- Deploy automatico e scalabilità
- Ispezione visiva e test delsandbox
- Analisi e osservabilità integrate

Rasa
Fornisce un framework open-source per la creazione di assistenti di chat e vocale a livello di produzione

Rasa è una piattaforma di AI conversazionale che aiuta gli sviluppatori a creare assistenti chat e voce contestuali con pieno controllo su dati, modelli e distribuzione. Il suo nucleo open-source gestisce la comprensione del linguaggio naturale e la gestione del dialogo, mentre Rasa Pro aggiunge funzionalità aziendali come analytics, controlli di sicurezza e infrastrutture scalabili. Rasa Studio fornisce un'interfaccia a basso codice per designer e team di conversazione per collaborare sui dati di allenamento, flussi e testing senza scrivere codice. Insieme, gli strumenti supportano team ibridi che sviluppano assistenti su canali di messaggistica, sistemi IVR e applicazioni personalizzate. Viene comunemente utilizzato da aziende nel settore bancario, delle telecomunicazioni, sanitario e governativo dove sono richiesti deployment on-premise, conformità e personalizzazione.
Suddivisione dei criteri
- Motore di comprensione del linguaggio naturale
- Gestione del dialogo con azioni personalizzate
- Rasa Studio interfaccia di low-code
- Integrazioni vocale e multi-canale
- Strumenti di analisi e testing delle conversazioni
- Controlli di sicurezza e distribuzione aziendali









