Bataille passée · 2025-11-18 UTC

Research AI Agents Duel — 18 novembre 2025

De la catégorie Research AI Agents. 13 marques placées sur 3 combattants. GLM-4.6V a décroché la couronne.

Classement final

Le casting

Les combattants

Profils de chaque outil ayant concouru dans cette bataille, classés par leur score final.

1GLM-4.6V logo

GLM-4.6V

Modèle de langage GLM unissant vision, texte et appels d'outils ouverts source par Z.ai pour la raison de longue durée, les recherches, la codification et UI-to-code.

4.3 (6)
Gratuit
Capture d’écran de GLM-4.6V

GLM-4.6V est un modèle de langage multimodal à grande échelle qui étend sa fenêtre de contexte à 128k tokens et atteint des performances à l'état de l'art en compréhension visuelle. Il intègre des capacités d'appel de fonctions natives, permettant une base technique unifiée pour les agents multimodaux dans des scénarios commerciaux réels. GLM-4.6V peut accepter des entrées multimodales et générer automatiquement du contenu à haute qualité et structuré, avec des images et du texte entrelacés, effectuer une compréhension complexe de documents et effectuer une recherche et une récupération visuelles. Ce modèle offre plusieurs capacités et scénarios, notamment la création et la disposition de contenu intelligent image-texte, la recherche visuelle sur le web et la génération de rapports multimédias riches, ainsi que la compréhension de contexte long. Il peut accepter des entrées mixtes texte-image, générer du contenu de haute qualité et effectuer un audit visuel sur les images candidates. Le flux de travail de recherche et d'analyse multimodal de GLM-4.6V permet une transition fluide de la perception visuelle à la récupération en ligne et à la génération de rapports structurés. Il maintient une conscience contextuelle multimodale et effectue un raisonnement ancré à la fois dans des informations textuelles et visuelles. Ce modèle fournit plusieurs capacités et scénarios, notamment la reconnaissance d'intention et la planification de recherche, l'alignement des résultats multimodaux et le raisonnement avec génération de rapports à rich media.

Répartition des critères

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Support d'entrée multimodale (images, texte, fichiers)
  • Appel d'outils multimodal natif
  • Longueur de contexte de 128k
  • Capacités d'appel d'outils natives
  • Compréhension de longue durée
  • Compréhension visuelle et récupération d'outils
2AMIE logo

AMIE

Un agent diagnostique multimodal IA qui conduit des conversations cliniques et interprète des images médicales pour des diagnostics précis.

4.7 (6)
Gratuit
Capture d’écran de AMIE

AMIE (Articulate Medical Intelligence Explorer) est un agent diagnostique IA de recherche développé par Google DeepMind et Google Research. Il est conçu pour mener des conversations cliniques et interpréter des images médicales afin d'obtenir des diagnostics précis. Initialement, AMIE était un agent conversationnel diagnostique médical basé sur le texte, publié dans la revue Nature. La dernière avancée, AMIE multimodal, intègre la capacité de demander, d'interpréter et de raisonner intelligemment sur les informations médicales visuelles au cours de conversations cliniques. Ce développement vise à améliorer la précision diagnostique en incorporant des données multimodales, telles que images et documents, dans le processus diagnostique. AMIE utilise un cadre de raisonnement conscient de l'état et est construit sur les modèles Gemini multimodaux. Il a été évalué via des évaluations d'experts, y compris des Examens Structurés Cliniques Objectifs (OSCEs), comparant ses performances à celles des médecins de soins primaires (PCPs) dans divers scénarios de patients.

Répartition des critères

Ease of use1
Value for money1
Features & power0
Integrations1
Support & docs1
Reliability1
  • Dialogue diagnostique multimodal
  • Interprétation d'informations médicales visuelles
  • Cadre de raisonnement conscient de l'état
  • Intégration avec les modèles Gemini
  • Environnement de simulation pour l'évaluation des dialogues
3Table Agent logo

Table Agent

Assistant de recherche numérique augmenté U0001F44B AI pour la recherche tabulaire

4.5 (6)
Freemium

Table Agent est un assistant basé sur l'apprentissage automatique conçu pour faciliter la recherche dans les données tabulaires. Il est destiné à automatiser la collecte de données sur n'importe quel sujet, rendant ainsi la recherche plus efficace. La plateforme permet des schémas de données personnalisables, ce qui permet aux utilisateurs de personnaliser leur collecte de données en fonction de leurs besoins spécifiques. Cette flexibilité est bénéfique pour une large gamme d'applications et d'industries où la structure des données peut varier considérablement. Au cœur de la fonctionnalité de Table Agent se trouve sa capacité de recherche de données basée sur un agent de l'intelligence artificielle. Cela signifie que l'outil utilise l'intelligence artificielle pour chercher activement et compiler les données pertinentes, ce qui pourrait potentiellement réduire le temps et les efforts nécessaires pour effectuer des recherches manuelles. Bien que les détails de son flux de travail et de ses intégrations ne soient pas précisés, le concept d'un assistant de données guidé par l'IA suggère qu'il pourrait s'intégrer de manière fluide à divers outils d'analyse de données, améliorant ainsi l'ensemble du processus de recherche. Les forces probablement de Table Agent incluent sa capacité à automatiser des tâches de collecte de données fastidieuses et sa flexibilité pour différents formats de données. Toutefois, sans plus d'informations spécifiques, il est difficile de déterminer ses limites ou comment il se compare à d'autres outils d'assistants de données.

Répartition des critères

Ease of use0
Value for money0
Features & power1
Integrations1
Support & docs0
Reliability0
  • Collecte de données automatisée
  • Schemas de données personnalisables
  • Recherche de données pilotée par un agent IA
  • Récupération de données rapide et précise