Bataille passée · 2025-11-18 UTC
Research AI Agents Duel — 18 novembre 2025
De la catégorie Research AI Agents. 13 marques placées sur 3 combattants. GLM-4.6V a décroché la couronne.
Classement final
Le casting
Les combattants
Profils de chaque outil ayant concouru dans cette bataille, classés par leur score final.

GLM-4.6V
Modèle de langage GLM unissant vision, texte et appels d'outils ouverts source par Z.ai pour la raison de longue durée, les recherches, la codification et UI-to-code.

GLM-4.6V est un modèle de langage multimodal à grande échelle qui étend sa fenêtre de contexte à 128k tokens et atteint des performances à l'état de l'art en compréhension visuelle. Il intègre des capacités d'appel de fonctions natives, permettant une base technique unifiée pour les agents multimodaux dans des scénarios commerciaux réels. GLM-4.6V peut accepter des entrées multimodales et générer automatiquement du contenu à haute qualité et structuré, avec des images et du texte entrelacés, effectuer une compréhension complexe de documents et effectuer une recherche et une récupération visuelles. Ce modèle offre plusieurs capacités et scénarios, notamment la création et la disposition de contenu intelligent image-texte, la recherche visuelle sur le web et la génération de rapports multimédias riches, ainsi que la compréhension de contexte long. Il peut accepter des entrées mixtes texte-image, générer du contenu de haute qualité et effectuer un audit visuel sur les images candidates. Le flux de travail de recherche et d'analyse multimodal de GLM-4.6V permet une transition fluide de la perception visuelle à la récupération en ligne et à la génération de rapports structurés. Il maintient une conscience contextuelle multimodale et effectue un raisonnement ancré à la fois dans des informations textuelles et visuelles. Ce modèle fournit plusieurs capacités et scénarios, notamment la reconnaissance d'intention et la planification de recherche, l'alignement des résultats multimodaux et le raisonnement avec génération de rapports à rich media.
Répartition des critères
- Support d'entrée multimodale (images, texte, fichiers)
- Appel d'outils multimodal natif
- Longueur de contexte de 128k
- Capacités d'appel d'outils natives
- Compréhension de longue durée
- Compréhension visuelle et récupération d'outils

AMIE
Un agent diagnostique multimodal IA qui conduit des conversations cliniques et interprète des images médicales pour des diagnostics précis.

AMIE (Articulate Medical Intelligence Explorer) est un agent diagnostique IA de recherche développé par Google DeepMind et Google Research. Il est conçu pour mener des conversations cliniques et interpréter des images médicales afin d'obtenir des diagnostics précis. Initialement, AMIE était un agent conversationnel diagnostique médical basé sur le texte, publié dans la revue Nature. La dernière avancée, AMIE multimodal, intègre la capacité de demander, d'interpréter et de raisonner intelligemment sur les informations médicales visuelles au cours de conversations cliniques. Ce développement vise à améliorer la précision diagnostique en incorporant des données multimodales, telles que images et documents, dans le processus diagnostique. AMIE utilise un cadre de raisonnement conscient de l'état et est construit sur les modèles Gemini multimodaux. Il a été évalué via des évaluations d'experts, y compris des Examens Structurés Cliniques Objectifs (OSCEs), comparant ses performances à celles des médecins de soins primaires (PCPs) dans divers scénarios de patients.
Répartition des critères
- Dialogue diagnostique multimodal
- Interprétation d'informations médicales visuelles
- Cadre de raisonnement conscient de l'état
- Intégration avec les modèles Gemini
- Environnement de simulation pour l'évaluation des dialogues

Table Agent
Assistant de recherche numérique augmenté U0001F44B AI pour la recherche tabulaire
Table Agent est un assistant basé sur l'apprentissage automatique conçu pour faciliter la recherche dans les données tabulaires. Il est destiné à automatiser la collecte de données sur n'importe quel sujet, rendant ainsi la recherche plus efficace. La plateforme permet des schémas de données personnalisables, ce qui permet aux utilisateurs de personnaliser leur collecte de données en fonction de leurs besoins spécifiques. Cette flexibilité est bénéfique pour une large gamme d'applications et d'industries où la structure des données peut varier considérablement. Au cœur de la fonctionnalité de Table Agent se trouve sa capacité de recherche de données basée sur un agent de l'intelligence artificielle. Cela signifie que l'outil utilise l'intelligence artificielle pour chercher activement et compiler les données pertinentes, ce qui pourrait potentiellement réduire le temps et les efforts nécessaires pour effectuer des recherches manuelles. Bien que les détails de son flux de travail et de ses intégrations ne soient pas précisés, le concept d'un assistant de données guidé par l'IA suggère qu'il pourrait s'intégrer de manière fluide à divers outils d'analyse de données, améliorant ainsi l'ensemble du processus de recherche. Les forces probablement de Table Agent incluent sa capacité à automatiser des tâches de collecte de données fastidieuses et sa flexibilité pour différents formats de données. Toutefois, sans plus d'informations spécifiques, il est difficile de déterminer ses limites ou comment il se compare à d'autres outils d'assistants de données.
Répartition des critères
- Collecte de données automatisée
- Schemas de données personnalisables
- Recherche de données pilotée par un agent IA
- Récupération de données rapide et précise


