Bataille passée · 2024-05-31 UTC
Research AI Agents Duel — 31 mai 2024
De la catégorie Research AI Agents. 34 marques placées sur 8 combattants. Google AI Co-Scientist a décroché la couronne.
Classement final
Le casting
Les combattants
Profils de chaque outil ayant concouru dans cette bataille, classés par leur score final.

Google AI Co-Scientist
Un système d'IA multiant agent collaborant avec des scientifiques pour générer des hypothèses et accélérer la recherche biomédicale.

Le Google AI Co-Scientist est un système d'intelligence artificielle multi-agents conçu pour collaborer avec les scientifiques et accélérer la recherche biomédicale. Il est construit avec Gemini 2.0 et fonctionne comme un collaborateur scientifique virtuel pour aider à générer des hypothèses et des propositions de recherche novatrices. Le système est conçu pour refléter le processus de raisonnement qui sous-tend la méthode scientifique et découvrir de nouvelles connaissances originales. Étant donné l'objectif de recherche d'un scientifique spécifié en langage naturel, l'AI Co-Scientist génère des hypothèses de recherche novatrices, un aperçu de recherche détaillé et des protocoles expérimentaux. Il utilise une coalition d'agents spécialisés, notamment la génération, la réflexion, le classement, l'évolution, la proximité et la méta-revue, qui utilisent des commentaires automatisés pour générer, évaluer et affiner de manière itérative les hypothèses. Le système permet aux scientifiques d'interagir avec lui de différentes manières, notamment en fournissant des idées de départ pour l'exploration ou des commentaires sur les résultats générés en langage naturel. L'AI Co-Scientist utilise également des outils tels que la recherche Web et des modèles d'IA spécialisés pour améliorer l'ancrage et la qualité des hypothèses générées. Le système est conçu pour évoluer de manière flexible et améliorer de manière itérative son raisonnement scientifique vers l'objectif de recherche spécifié. L'AI Co-Scientist est particulièrement utile pour les scientifiques qui ont du mal à naviguer dans la croissance rapide des publications scientifiques et à intégrer les connaissances de domaines qui leur sont inconnus. En tirant parti des récentes avancées de l'IA, notamment la capacité de synthétiser des sujets complexes et d'effectuer une planification et un raisonnement à long terme, l'AI Co-Scientist vise à accélérer la vitesse des découvertes scientifiques et biomédicales. Le système a été testé dans diverses applications, notamment la découverte du transfert de gènes et la re-découverte du transfert. Bien que l'AI Co-Scientist présente plusieurs avantages, son efficacité dépend de la qualité de l'objectif de recherche saisi et de la capacité du scientifique à fournir des commentaires pertinents. L'AI Co-Scientist est un nouvel outil qui a le potentiel d'avoir un impact significatif sur la communauté scientifique, mais ses limites et ses biais potentiels doivent être soigneusement évalués. Le développement de l'AI Co-Scientist est un effort continu, et ses futures applications et améliorations dépendront de recherches et de tests approfondis.
Répartition des critères
- Génération d'hypothèses
- Création d'une vue détaillée des recherches
- Développement de protocoles expérimentaux
- Agents spécialisés pour la raison scientifique
- Boucle de rétroaction automatique
- Intégration de la recherche web

Bright Data Web MCP
MCP serveur qui offre aux agents IA une recherche web fiable, scraping et automatisation de navigateur avec 5 000 requêtes gratuites par mois.

Bright Data Web MCP est un serveur qui permet aux agents IA d'effectuer des recherches web fiables, du scraping et l'automatisation de navigateurs. Il fournit 5 000 requêtes gratuites par mois. L'outil permet aux agents IA de rechercher efficacement sur le web, d'extraire des données et de naviguer sur les sites sans se faire bloquer. Il propose des fonctionnalités telles que des résultats de recherche en temps réel, l'extraction de données, le crawling de sites web et l'automatisation de navigateur. Le Web MCP est conçu pour contourner les blocages et restrictions, et fait confiance à plus de 20 000 clients dans le monde.
Répartition des critères
- Recherche web en temps réel
- Crawling de sites et extraction de données
- Automatisation de navigateur
- Contournement des geo-restrictions et CAPTCHAs
- Rendu JavaScript pour le contenu dynamique
- Mimétisme du comportement d'un utilisateur réel

Kosmos
Scientifique autonome IA pour des campagnes de recherche de longue durée qui analysent les données et la littérature pour produire des rapports scientifiques entièrement cités.

Kosmos est un scientifique autonome IA conçu pour les équipes de R&D biopharma et les chercheurs. Il analyse les données et la littérature pour produire des rapports scientifiques entièrement cités, accélérant le processus de développement de médicaments de l'hypothèse à l'enregistrement en quelques jours, et non en mois. Kosmos fonctionne de manière autonome, lisant la littérature, générant des hypothèses, dirigeant les enquêtes et exécutant les flux de travail scientifiques. Il prend en charge l'ensemble du cycle de vie du développement de médicaments, de l'identification des cibles à travers le développement clinique et le dépôt. L'outil IA collabore avec les scientifiques humains via Slack, Teams et e-mail, et apprend de la connaissance de l'organisation, en s'appuyant sur l'histoire expérimentale et les données scientifiques propriétaires.
Répartition des critères
- Génération autonome d'hypothèses
- Analyse de la littérature
- Analyse de données
- Exécution de flux de travail scientifiques
- Collaboration via Slack, Teams et e-mail
- Modèle agnostique pour les modèles de pointe futurs

THEUS (Aigora)
Système d'analyse d'intelligence artificielle d'entreprise pour mieux exploiter des données propres et faciliter le renforcement stratégique.

THEUS est un système de recherche en intelligence artificielle pour les entreprises qui transforme des études propriétaires en informations traçables avec des ID de faits, des citations et des avatars d'experts. Il est construit sur le Google Agent Development Kit (ADK) et utilise une modélisation bidirectionnelle pour des agents de connaissances ancrés dans les données. Les utilisateurs peuvent extraire, synthétiser et explorer leurs données de recherche, et chaque affirmation est étayée par un ID de fait spécifique avec des citations au niveau de la page. THEUS propose deux façons d'explorer : générer de nouvelles informations avec le Dr Reed ou analyser les connaissances existantes avec le Dr Sinclair. Cette plateforme est conçue pour les directeurs généraux de l'analyse, les responsables mondiaux de la perception sensorielle et les leaders de l'innovation qui évaluent le développement des capacités stratégiques. Elle utilise une méthodologie de recherche spécialement conçue, et non un AI générique pour entreprises, et crée des agents de connaissance fondés sur des données, entraînés sur les données institutionnelles réelles. Avec 85 % de nouveaux produits qui échouent dans les deux ans (Nielsen), l'exploration fondée sur des preuves améliore considérablement la qualité des décisions. THEUS propose un siège solo, qui comprend des fonctionnalités telles que jusqu'à 30 documents ingérés par mois, jusqu'à 1 500 pages analysées par mois et jusqu'à 500 questions à Dr. Sinclair par mois. L'un des principaux avantages de THEUS est sa capacité à transformer des décennies de données propriétaires en intelligence traçable et prête à être utilisée pour la prise de décision grâce à des agents de connaissances alimentés par l'IA.
Répartition des critères
- Intelligence Artificielle d'entreprise pour l'exploitation des données propres
- Expert avatar-propulsé analyse
- Référence traceable et démontable des études internes et des découvertes des chercheurs
- Genération de rapports entreprises pour la production de rapports de recherche audit-préparer
- Chaque vérité liée à une citation

AMIE
Un agent diagnostique multimodal IA qui conduit des conversations cliniques et interprète des images médicales pour des diagnostics précis.

AMIE (Articulate Medical Intelligence Explorer) est un agent diagnostique IA de recherche développé par Google DeepMind et Google Research. Il est conçu pour mener des conversations cliniques et interpréter des images médicales afin d'obtenir des diagnostics précis. Initialement, AMIE était un agent conversationnel diagnostique médical basé sur le texte, publié dans la revue Nature. La dernière avancée, AMIE multimodal, intègre la capacité de demander, d'interpréter et de raisonner intelligemment sur les informations médicales visuelles au cours de conversations cliniques. Ce développement vise à améliorer la précision diagnostique en incorporant des données multimodales, telles que images et documents, dans le processus diagnostique. AMIE utilise un cadre de raisonnement conscient de l'état et est construit sur les modèles Gemini multimodaux. Il a été évalué via des évaluations d'experts, y compris des Examens Structurés Cliniques Objectifs (OSCEs), comparant ses performances à celles des médecins de soins primaires (PCPs) dans divers scénarios de patients.
Répartition des critères
- Dialogue diagnostique multimodal
- Interprétation d'informations médicales visuelles
- Cadre de raisonnement conscient de l'état
- Intégration avec les modèles Gemini
- Environnement de simulation pour l'évaluation des dialogues

QualiaInterviews
Plateforme guidée par l'IA pour des entrevues de recherche et d'évaluation conversationnelles multilingues à grande échelle.

QualiaInterviews est une plateforme de recherche qui utilise l'intelligence artificielle pour mener des entretiens avec des participants à travers un dialogue naturel et conversationnel. Elle permet aux équipes de recueillir des informations qualitatives auprès d'échantillons plus larges que ceux que les entretiens traditionnels en tête-à-tête ne le permettent, tout en préservant la profondeur et les nuances de la conversation ouverte. L'outil prend en charge les entretiens dans plusieurs langues, ce qui le rend adapté aux études transfrontalières, à la recherche sur le marché mondial et à l'évaluation de programmes. Les chercheurs peuvent concevoir des guides d'entretien, les déployer auprès des participants et examiner les résultats structurés automatiquement sans modérer manuellement chaque session. QualiaInterviews est généralement utilisé par les chercheurs sociaux, les évaluateurs, les équipes UX et les organisations menant des évaluations d'impact qui ont besoin de données qualitatives évolutives sans sacrifier la profondeur conversationnelle.
Répartition des critères
- Entrevues conversationnelles modérées par l'IA
- Support d'entrevues multilingues
- Intrigues de renvoi et d'enquête automatiques
- Analyse structurée des réponses qualitatives
- Déploiement d'usagers évolutif
- Outils de workflow de recherche et d'évaluation

Table Agent
Assistant de recherche numérique augmenté U0001F44B AI pour la recherche tabulaire
Table Agent est un assistant basé sur l'apprentissage automatique conçu pour faciliter la recherche dans les données tabulaires. Il est destiné à automatiser la collecte de données sur n'importe quel sujet, rendant ainsi la recherche plus efficace. La plateforme permet des schémas de données personnalisables, ce qui permet aux utilisateurs de personnaliser leur collecte de données en fonction de leurs besoins spécifiques. Cette flexibilité est bénéfique pour une large gamme d'applications et d'industries où la structure des données peut varier considérablement. Au cœur de la fonctionnalité de Table Agent se trouve sa capacité de recherche de données basée sur un agent de l'intelligence artificielle. Cela signifie que l'outil utilise l'intelligence artificielle pour chercher activement et compiler les données pertinentes, ce qui pourrait potentiellement réduire le temps et les efforts nécessaires pour effectuer des recherches manuelles. Bien que les détails de son flux de travail et de ses intégrations ne soient pas précisés, le concept d'un assistant de données guidé par l'IA suggère qu'il pourrait s'intégrer de manière fluide à divers outils d'analyse de données, améliorant ainsi l'ensemble du processus de recherche. Les forces probablement de Table Agent incluent sa capacité à automatiser des tâches de collecte de données fastidieuses et sa flexibilité pour différents formats de données. Toutefois, sans plus d'informations spécifiques, il est difficile de déterminer ses limites ou comment il se compare à d'autres outils d'assistants de données.
Répartition des critères
- Collecte de données automatisée
- Schemas de données personnalisables
- Recherche de données pilotée par un agent IA
- Récupération de données rapide et précise

Autoresearch
Un projet open-source qui permet aux agents IA d'exécuter de façon autonome des expériences d'entraînement de LLM et de conserver les meilleures modifications de modèle.

Autoresearch est un projet open-source qui permet aux agents IA d'exécuter de façon autonome des expériences d'entraînement de LLM et de conserver les meilleures modifications de modèle. Le projet permet aux utilisateurs de mettre en place un environnement d'entraînement LLM simple mais réel et de laisser un agent IA l'expérimenter pendant la nuit, en modifiant le code, en entraînant pendant une courte période, et en vérifiant si les résultats s'améliorent. L'objectif est d'automatiser le processus de recherche, en laissant l'agent IA explorer différentes architectures de modèles, hyperparamètres et stratégies d'optimisation sans intervention humaine. Le projet inclut une implémentation simplifiée sur un seul GPU de nanochat et fournit une structure de base pour programmer le processus de recherche de l'agent IA à l'aide de fichiers Markdown. Le projet est conçu pour être extensible, permettant aux utilisateurs d'ajouter davantage d'agents et d'améliorer le processus de recherche au fil du temps.
Répartition des critères
- Expériences d'entraînement LLM autonomes
- Processus de recherche piloté par un agent IA
- Implémentation à un seul GPU de nanochat
- Programmation du processus de recherche basée sur Markdown
- Budget d'entraînement de 5 minutes avec métrique d'évaluation (val_bpb)







