Bataille passée · 2025-01-11 UTC
AI Agent Development Frameworks Duel — 11 janvier 2025
De la catégorie AI Agent Development Frameworks. 38 marques placées sur 10 combattants. Mastra a décroché la couronne.
Classement final
Le casting
Les combattants
Profils de chaque outil ayant concouru dans cette bataille, classés par leur score final.

Mastra
Framework open-source TypeScript pour construire des agents IA, des flux de travail, RAG, mémoire et MCP, avec studio cloud optionnel et observabilité.

Mastra est un framework open-source TypeScript pour la construction d'applications et d'agents alimentés par l'IA. Il fournit un ensemble d'outils permettant aux développeurs de passer de l'idée à la mise en œuvre, notamment des agents, des flux de travail, de la mémoire, des espaces de travail et de l'observabilité. Mastra s'intègre à divers frameworks frontend et backend et peut être déployé en tant que serveur autonome. Il permet aux développeurs de créer une gamme de fonctionnalités, telles que des agents d'automatisation internes, des agents orientés client, et plus encore. Mastra inclut des fonctionnalités telles que l'observabilité intégrée, des vérifications répétables et des flux résumables en cache. Il est conçu pour prendre en charge les startups à croissance rapide et les grandes organisations mondiales. L'architecture de Mastra est centrée autour d'agents, qui peuvent être définis avec des instructions, des modèles, des outils et un comportement d'exécution. Les agents peuvent interagir avec les utilisateurs, effectuer des tâches et passer à des flux de produits. Le framework comprend également un système d'événements intégré pour les événements, ainsi qu'un système pour publier et s'abonner à des événements avec Redis Streams et Google Cloud Pub/Sub. Mastra dispose d'un riche écosystème de ressources, notamment des livres, des blogs et des guides. Elle compte une large communauté d'utilisateurs et est largement adoptée dans divers secteurs.
Répartition des critères
- Agents
- Flux de travail
- Mémoire
- Espaces de travail
- Observabilité
- Système d'événements intégré

AI Legion
Une plateforme open-source pour créer des agents d'IA autonomes qui collaborent pour accomplir des tâches.

AI Legion est une plateforme open-source pour créer des agents d'IA autonomes qui collaborent pour accomplir des tâches. Elle utilise des grands modèles de langage, tels que GPT-3.5-turbo et GPT-4, pour permettre aux agents de travailler ensemble et atteindre des objectifs complexes. La plateforme fournit un cadre pour configurer et gérer ces agents, y compris des fichiers de configuration, des API et des workflows. AI Legion est conçue pour être extensible et personnalisable, permettant aux utilisateurs de créer et d'intégrer leurs propres modèles, actions et fonctionnalités. La plateforme convient à une variété de cas d'utilisation, notamment la recherche, le développement et le déploiement de systèmes d'IA autonomes. La configuration d'un environnement AI Legion implique l'installation des dépendances requises, notamment Node.js et les clés API OpenAI. Les agents peuvent alors être créés et interagis via la console. La plateforme comprend également des fonctionnalités pour gérer l'état des agents, notamment la possibilité de supprimer les journaux d'événements et de redémarrer les agents avec des configurations personnalisées. AI Legion est un outil puissant pour construire et déployer des systèmes d'IA autonomes, et sa nature open-source le rend accessible à un large éventail d'utilisateurs. Cependant, il nécessite également une quantité importante d'expertise technique et d'efforts de configuration pour être configuré et utilisé efficacement. Un des principaux avantages de AI Legion est sa capacité à permettre aux agents d'apprendre et de s'adapter au fil du temps, en utilisant une combinaison de techniques d'apprentissage automatique et de graphes de connaissances. Cela permet aux agents d'améliorer leurs performances et leurs capacités de prise de décision à mesure qu'ils interagissent avec l'environnement. Cependant, AI Legion présente également plusieurs défis et limites, notamment la nécessité d'un effort de configuration et de gestion important, le risque d'erreurs d'agent et de boucles infinies, ainsi que le potentiel de counts de tokens élevés et de coûts d'utilisation de l'API. De plus, l'utilisation de grands modèles de langage peut soulever des inquiétudes quant aux biais et à l'exactitude. En termes de fonctionnalités spécifiques, AI Legion inclut la prise en charge de la recherche Web, des moteurs de recherche personnalisés et des API, ainsi que la possibilité de gérer l'état des agents et de redémarrer les agents avec des configurations personnalisées. La plate-forme est également hautement extensible, permettant aux utilisateurs de créer et d'intégrer leurs propres modèles, actions et fonctionnalités. Parmi les cas d'utilisation potentiels d'AI Legion figurent la recherche et le développement de systèmes d'IA autonomes, le déploiement de flux de travail et de processus alimentés par l'IA, ainsi que la création d'outils et d'applications personnalisés alimentés par l'IA. Dans l'ensemble, AI Legion est une plateforme puissante et extensible pour construire et déployer des systèmes d'IA autonomes, mais elle nécessite une expertise technique et un effort de configuration importants pour être utilisée efficacement.
Répartition des critères
- Recherche web
- Moteurs de recherche personnalisés
- API et webhooks pour l'intégration
- Gestion de l'état des agents
- Création de modèles et d'actions personnalisés
- Capacités de graphes de connaissances et d'apprentissage automatique

AutoML-Agent
Cadre multi-agent LLM open-source qui automatise les pipelines de machine learning de bout en bout.

AutoML-Agent est un framework open-source qui utilise des agents de modèle de langage large coordonnés pour gérer l'ensemble du cycle de vie de l'apprentissage automatique. Au lieu de s'appuyer sur un seul modèle ou script, il délègue des tâches telles que la compréhension des données, le prétraitement, la sélection de modèles, l'entraînement et l'évaluation à des agents spécialisés qui collaborent vers un objectif commun. Le cadre est destiné aux chercheurs et aux développeurs qui souhaitent automatiser l'expérimentation sans écrire de code de pipeline étendu. En décrivant un jeu de données et un objectif en langage naturel, les utilisateurs peuvent avoir des agents qui proposent, construisent et itèrent sur des solutions candidates, en affichant les résultats et la logique tout au long du processus. Parce qu'il est open source, AutoML-Agent peut être étendu avec des agents personnalisés, des outils ou des backends de modèles, le rendant utile à la fois comme système AutoML pratique et comme terrain d'essai de recherche pour les flux de travail multi-agents.
Répartition des critères
- Orchestration multi-agent LLM
- Prétraitement automatisé des données et gestion des caractéristiques
- Sélection de modèles et recherche d'hyperparamètres
- Génération de pipeline d'entraînement et d'évaluation
- Spécification de tâche en langage naturel
- Architecture extensible pour agents personnalisés

Cerebrum: AIOS SDK
Un SDK pour développer et déployer des agents IA basés sur LLM dans le cadre AIOS.

Cerebrum est un SDK pour développer et déployer des agents IA basés sur LLM dans le cadre AIOS (AI Agent Operating System). AIOS résout des problèmes tels que la planification, le changement de contexte, la gestion de la mémoire et la gestion des outils pour les agents LLM. Le SDK Cerebrum permet aux développeurs de créer et d’exécuter des applications d’agents en interagissant avec le noyau AIOS. Il prend en charge les interfaces Web UI et Terminal UI. Le SDK inclut des fonctionnalités de répertoire des LLM, agents et outils disponibles, ainsi que le téléchargement, le téléversement et l’exécution d’agents et d’outils. Cerebrum est conçu pour les utilisateurs et les développeurs d’agents, leur permettant de créer et déployer des applications d’agents IA.
Répartition des critères
- Développement et déploiement d’agents
- Gestion d’agents IA basés sur LLM
- Prise en charge des interfaces Web UI et Terminal UI
- Gestion d’agents et d’outils
- Répertoire des LLM, agents et outils disponibles
- Téléchargement et téléversement d’agents et d’outils

Gemma 3
Un modèle AI open-source optimisé pour la performance d'un GPU unique, supportant les entrées multimodales et plus de 140 langues.

Gemma 3 est une collection de modèles ouverts légers et à l'état de l'art conçus pour fonctionner sur des appareils, particulièrement optimisés pour les performances sur GPU unique. Il prend en charge les entrées multimodales et plus de 140 langues. Le modèle est disponible en différentes tailles (1B, 4B, 12B et 27B), permettant aux développeurs de choisir celui qui convient le mieux à leurs besoins en matière de matériel et de performances. Gemma 3 offre des capacités de raisonnement textuel et visuel avancées, une fenêtre de contexte de 128k tokens et l'appel de fonctions pour des tâches complexes. Il comprend également des versions quantifiées pour des performances plus rapides et des exigences de calcul réduites. Le modèle fait partie de l'engagement de Google à rendre la technologie d'IA utile accessible et s'appuie sur la même recherche et la même technologie qui alimentent leurs modèles Gemini 2.0. Gemma 3 est conçu pour permettre aux développeurs de créer des applications d'IA qui peuvent fonctionner directement sur des appareils tels que des téléphones, des ordinateurs portables et des stations de travail. Gemma 3 offre des performances à l'état de l'art pour sa taille, surpassant d'autres modèles comme Llama3-405B, DeepSeek-V3 et o3-mini lors d'évaluations préliminaires de préférence humaine. Il permet des applications mondiales avec une prise en charge prête à l'emploi de plus de 35 langues et une prise en charge pré-entraînée de plus de 140 langues. Le modèle permet la création de flux de travail pilotés par l'IA à l'aide de l'appel de fonctions et de la sortie structurée. Le développement de Gemma 3 a inclus des protocoles de sécurité rigoureux, tels qu'une gouvernance des données exhaustive, un alignement avec les politiques de sécurité via un ajustement précis, et des évaluations de référence robustes. La famille de modèles Gemma a connu une adoption significative, avec plus de 100 millions de téléchargements et une communauté dynamique qui a créé plus de 60 000 variantes de Gemma. Les capacités de Gemma 3 la rendent adaptée aux développeurs souhaitant créer des expériences utilisateur engageantes pouvant tenir sur un seul hôte GPU ou TPU.
Répartition des critères
- Soutien AI multimodal
- Développement centré sur la responsabilité
- Réfinement étendu
- Support de 140 langues
- Performances améliorées

MiniMax‑M1
Modèle de raisonnement à grande échelle open-source avec un contexte de 1 million de tokens et une architecture hybride Mixture‑of‑Experts

MiniMax-M1 est un modèle de raisonnement hybride à grande échelle et à attention ouverte. Il est alimenté par une architecture hybride Mixture-of-Experts (MoE) combinée à un mécanisme d'attention éclair, permettant une mise à l'échelle efficace de l'informatique en temps de test. Le modèle prend nativement en charge une longueur de contexte d'un million de jetons et est formé à l'aide d'un apprentissage par renforcement (RL) à grande échelle sur divers problèmes. Il surpasse d'autres modèles ouverts robustes sur des tâches complexes d'ingénierie logicielle, d'utilisation d'outils et de contexte long. Des expériences sur des benchmarks standards montrent que MiniMax-M1 surpasse d'autres modèles dans des tâches catégorielles telles que les mathématiques, la programmation, l'ingénierie logiciel, l'utilisation d'outils agétiques et la compréhension de contexte long. Le modèle est particulièrement adapté aux tâches complexes qui nécessitent le traitement d'entrées longues et une réflexion approfondie. MiniMax-M1 sert de base solide aux agents de modèles de langage de nouvelle génération pour raisonner et relever les défis du monde réel. La comparaison des performances de référence des modèles commerciaux et ouverts leaders à travers différentes tâches de catégories met en évidence les performances du modèle. Le rapport technique fournit plus d'informations sur l'architecture du modèle, le protocole d'entraînement et les résultats de l'évaluation.
Répartition des critères
- Architecture hybride Mixture‑of‑Experts (MoE)
- Mécanisme d’attention lightning
- Framework d’apprentissage par renforcement (RL) à grande échelle
- Longueur de contexte de 1 million de tokens
- Mise à l’échelle efficace du calcul en temps réel

ScreenAgent
Agent de langage visuel ouvert-source pour contrôler les interfaces graphiques d'ordinateur via planification et exécution de souris/clavier.

Le ScreenAgent est un agent de langage visuel ouvert-source conçu pour contrôler les interfaces graphiques d'ordinateur via opérations de souris et de clavier. Cela permet une interaction avec des écrans de vrai ordinateur en observant des captures d'écran et en exécutant des actions. Le projet inclut un processus de planification-exécution-réflexion qui guide l'agent pour la réalisation d'activités multi-étapes. Il a été créé pour répondre au défi de l'enseignement des agents à utiliser les ordinateurs, nécessitant des capacités telles que la planification de tâches, la reconnaissance d'images et la positionnement visuel. Le dataset ScreenAgent, qui couvre diverses tâches informatiques quotidiennes, a été annoté de manière manuelle pour soutenir l'apprentissage de l'agent. Le projet consiste en un client pour contrôler le bureau, un dataset, des ouvriers de modèle pour des résultats d'inférence et un code de formation. Il soutient des opérations de souris et de clavier de base et peut être appliqué à différents systèmes d'exploitation et applications de bureau. L'approche du ScreenAgent est universelle et ne repose pas sur des APIs spécifiques, ce qui en fait versatile.
Répartition des critères
- Exécution d'opérations de souris et de clavier
- Processus de planification-exécution-réflexion pour la réalisation des tâches
- Support pour différents systèmes d'exploitation et applications de bureau
- Annotation manuelle du dataset ScreenAgent pour une couverture de tâche diverse
- Agent de langage visuel pour l'interaction GUI

BabyBeeAGI
Une version avancée de BabyAGI avec une gestion de tâches améliorée et des fonctionnalités renforcées.

BabyAGI est un cadre expérimental pour créer des agents autonomes auto-construction. Il a été créé comme une évolution du BabyAGI original de mars 2023, qui avait introduit la planification de tâches pour agents autonomes. Le cadre est construit autour d'un nouveau cadre de fonctions appelé 'functionz' qui stocke, gère et exécute des fonctions à partir d'une base de données. Il présente une structure basée sur un graphe pour suivre les imports, les fonctions dépendantes et les secrets d'authentification, ainsi que le chargement automatique et les capacités de journalisation complètes. Le cadre inclut également un tableau de bord pour gérer les fonctions, exécuter des mises à jour et afficher les journaux. Il est conçu pour être simple et susciter la discussion parmi les développeurs, et non destiné à un usage en production. L'idée centrale est de construire la chose la plus simple qui puisse se construire elle-même, ce qui en fait une approche intéressante pour le développement d'agents autonomes.
Répartition des critères
- Enregistrement des fonctions et gestion des métadonnées
- Suivi des dépendances et des dépendances clés
- Chargement automatique et journalisation
- Tableau de bord pour la gestion des fonctions et la visualisation des logs

MCP‑Use
Plateforme open‑source pour connecter les LLMs aux serveurs MCP et créer des agents IA personnalisés avec accès aux outils.

mcp-use est une plateforme open-source qui facilite la connexion de grands modèles de langage (LLM) avec les serveurs MCP et permet le développement d'agents d'IA personnalisés pouvant interagir avec ces LLM. La plateforme fournit un framework MCP complet (SDK mcp-use) pour créer des applications ChatGPT, des connecteurs Claude et des serveurs MCP. Avec mcp-use, les développeurs peuvent utiliser une seule base de code pour déployer leurs applications sur diverses surfaces où les utilisateurs et les agents travaillent déjà, notamment ChatGPT, Claude et Gemini. La plateforme propose une gamme d'outils et de fonctionnalités, tels que la possibilité de créer des applications MCP en une seule commande, un déploiement automatique sur Manufact Cloud, ainsi que des analyses et une observabilité intégrées. Les développeurs peuvent utiliser le SDK mcp-use pour créer et déployer des serveurs et des applications MCP sans nécessiter d'outils supplémentaires. La plateforme fournit également un Visual Inspector et des capacités de tests Sandbox, permettant aux développeurs de tester leurs applications sans avoir besoin d'un LLM en production. mcp-use vise à simplifier le développement et le déploiement d'applications basées sur MCP, en faisant une option attrayante pour les développeurs souhaitant créer et déployer des agents et applications d'IA personnalisés.
Répartition des critères
- Gestion des serveurs MCP
- Connexion et intégration des LLM
- Développement d'agents IA personnalisés
- Déploiement automatisé et évolutivité
- Inspection visuelle et tests sandbox
- Analytique et observabilité intégrées

Rasa
Plate-forme open-source pour la construction d'assistants de discours et voix de production

Rasa est une plateforme d'IA conversationnelle qui aide les développeurs à créer des assistants de chat et de voix contextuels avec un contrôle total sur les données, les modèles et le déploiement. Son cœur open-source gère la compréhension du langage naturel et la gestion du dialogue, tandis que Rasa Pro ajoute des fonctionnalités entreprises telles que l'analyse, les contrôles de sécurité et une infrastructure évolutive. Rasa Studio fournit une interface low-code permettant aux designers et aux équipes de conversation de collaborer sur les données d'entraînement, les flux et les tests sans écrire de code. Ensemble, les outils prennent en charge les équipes hybrides déployant des assistants sur les canaux de messagerie, les systèmes IVR et les applications personnalisées. Il est couramment utilisé par les entreprises dans les secteurs de la banque, des télécoms, de la santé et du gouvernement où déploiement sur site, la conformité et la personnalisation sont requis.
Répartition des critères
- Moteur de compréhension de langage naturel
- Gestion de dialogue avec actions personnalisées
- Interface de Rasa Studio avec code bas niveau
- Intégrations de voix et de multiples canaux
- Outils d'analytique et de test de conversation
- Contrôles de sécurité et de déploiement pour entreprises









