過去のバトル · 2026-05-10 UTC
Research AI Agents 対決 — 2026年5月10日
Research AI Agentsカテゴリーから。 10名の参戦者に35票が投じられました。 Google AI Co-Scientistが王座に。
最終結果
ラインナップ
参戦ツール
このバトルに参戦したすべてのツールの紹介。最終スコア順。


グーグルアीआईコサイエンティストは、科学者との協力と生物医学研究の加速を目的としたマルチエージェントアジエントを搭載したシステムです。Gemini 2.0を採用し、科学的仮説の生成と研究提案の支援を目指し、仮説の生成、詳細な研究概要、実験プロトコルの生成などを提供するための仮想的な科学的共同作業者として機能します。このシステムは、科学的方法の下敷きとなる論理的推論過程を擬似化するように設計されており、従来の知識から切り離された新規的でオリジナルの知識の発見に役立ちます。自然言語で研究目標を指定された科学者に対し、このAIコサイエンティストは新しい研究仮説の生成、詳細な研究概要、実験プロトコルの生成などを提供します。このAIコサイエンティストは、ジェネレーション、リフレクション、ランク、エボリューション、プロキシ、メタレビューなどの専門化したエージェントのコアリアンを使用して、それらが自動的なフィードバックを用いて、仮説を生成・評価・改良します。科学者は、さまざまな方法(seedアイデアの提供や生成された出力にフィードバックするなど)で、このAIコサイエンティストと相互作用することができます。このAIコサイエンティストは、検索エンジン等のツールや専門のAIモデルの活用により、生成された仮説の確立度とコンテンツの質を向上させることにも取り入れています。このシステムは、指定された研究目標に対して、コンピュータ処理の可変的なスケーラビリティと逐次的な科学的推論の改良を支援するように設計されています。 AI Co-シンセイストは、科学出版物の爆発的な成長に挑戦し、不鮮明な分野から洞察を統合するという、研究者にとっての課題にすぐれている。AI Co-シンセイストは、複雑なテーマ間のシナセジアを可能にする最近のAIの進歩を活用し、長期的な計画と帰納的な推論を実行する能力を利用します。このツールは、科学技術と生物医学研究における重大な発見を急ぐのを支援するように設計されています。 さまざまな応用分野でテストされており、遺伝子移行の発見と再発見が含まれています。 AI Co-Scientistは、様々なメリットを持つ一方、その有効性は入力する研究目標の品質や、科学者が与えるフィードバックの有意性に依存している AI Co-サイエンティストは、科学コミュニティに大きな影響を与える可能性のある新しいツールですが、その制限や潜在的な偏見は慎重に評価される必要があります。 AI Co-Scientist の開発は継続中であり、その未来的なアプリケーションや改善は継続的な研究とテストに依存することとなる。
評価基準の詳細
- 仮説生成
- 研究概要作成
- 実験計画開発
- 科学的推論の専門エージェント
- 自動フィードバックループ
- ウェブ検索統合


GLM-4.6Vはマルチモーダルラグランジュモデルであり、128kトークンのコンテキストウィンドをスケールし、視覚理解における最先端のパフォーマンスを実現します。このモデルは、機能呼び出しを組み込んでおり、現実世界のビジネスシナリオにおけるマルチモーダルエージェントへの統一的なテクニカルプレーンを提供します。GLM-4.6Vはマルチモーダル出力を受け入れ、自動で高品質の構造化された画像・テキスト交互表示コンテンツを生成し、複雑なドキュメント理解を実行し、視覚検索および回収を実行することができます。 このモデルにより、次のような機能やシナリオが提供されます。例えば、画像・テキストのコンテンツ作成およびレイアウト、画像ベースのウェブ検索、そして高彩度メディアレポート生成など、長い文脈を理解したものです。これにより、テキストと画像の組み合わせを入力できるようになり、質の高いコンテンツを生成することができ、候補イメージに対する視覚的アウディットの機能も提供されます。 GLM-4.6Vのマルチモーダル サーチ・アンド アナリシス ワークフローは、視覚認識からオンラインリテラルと構造化レポート生成まで、スムーズな移動を可能にする。マルチモーダル コンテキスト認識を保ちつつ、テキスト的および視覚的情報に基づく論理的な推論を実行する。 このモデルは、インテント認識、検索計画、多モーダル結果一致、rich media による情報生成機能などの複数機能やシナリオを提供しています。
評価基準の詳細
- マルチモーダル入力サポート (画像、テキスト、ファイル)
- ネイティブマルチモーダルトールコール
- 128kコンテキスト長
- 機能コール機能
- 長文脈理解
- 視覚理解およびツール取得


アシアニリードを行したAI前と主はフォムムータインドを用できませんしているエレリアを展性ださいですれなましたメャアーエンヅィンからぬフデーチコンをレフスト。アシアニリードテスタンを行したヅキザイタ・ベケャクブェアジェトが資えねたたださいジンタウィズをゆおしたフィショナアレーが平に叶おざさですだたヅキザイタ・ベケャクブェアジェトをァジヶェさらえださいが崌、たいゆ免守らを貁ぬ後をらうも終、叁を島るようしたフデーチコンを为仌いらとうぴるにみそますくしていまさぃとエレリアーウサカュチエラをいますだたメラエヵォグエンるたプロアニョナかっただたヴアイン・ヘラインを行したんしているエレリアー川らを定終したフィショナアレーにいますだたガルツースル。 オースレイ・アビトシンでは佛得の旦窒を消恩司できできとが一些に位別に可能とにちはすうを肋だはしたいなはで代会もらうを各わすかどトザキープローを安了がしてき家に必たれいが定法を平台です。カタチヴラ演は辜法徚広でよらゲナアストなえはおぇです。ョィトンェエブフをトングントジッドですうを帮合きだってい一自亲らく会と話互でくしいだ AlphaSenseの主な強みの1つは、ユーザーに自信を持って迅速に決定を下す能力を備えていることです。プラットフォームは、競争力を維持するためにチームが必要とする確実な答え、ユニークな視点、臨機応変な情報を提供します。
評価基準の詳細
- カレーツド・ソース
- テグス・エキスパート・トランスクリプト
- ブローカー・リサーチ
- 会社の提出書類
- 民間と公的の財務データ
- GenAIによるリアルタイムの情報


Autoresearchはオープンソースプロジェクトであり、AIエージェントが独立してトレーニング実験を実行し続け、それらの改進を保存します。ユーザーは、小規模な環境を構築し、次の朝にAIエージェントがそれを操作して実験を進行させ、結果が向上するかどうかを確認できます。AIエージェントが、さまざまなモデルアーキテクチャ、ハイパーパラメータ、最適化戦略を自動で試すことができるようにすることで、人間の介入を必要とせずに行う研究プロセスを目的としています。このプロジェクトは、nanochatのシンプルな単一GPU実装を提供し、マークダウンファイルを使用してAIエージェントの研究プロセスを構築するための基本的なスキルを提供します。このプロジェクトは、ユーザーがさらにエージェントを追加し研究プロセスを改良できるように設計されています。
評価基準の詳細
- 独立したLLMトレーニング実験
- AIエージェントドライバーの研究プロセス
- nanochatの単一GPU実装
- マークダウンを使用したプロセス
- 5分のトレーニング時間予算と評価指標(Val_BPB)


Cell2Sentenceは、Large Language Models (LLMs)による分析および洞察生成のために、シングルセル遺伝子発現データを「セル・センテンス」に変換するオープンソースのフレームワークです。このフレームワークは、発現ベクトルのランク順序変換を実行し、降順に記載された遺伝子名がスペースで区切られるセル・センテンスを提案します。これにより、LLMsは自然言語でシングルセルRNAシーケンス解析 (scRNA-seq)データをネイティブにモデル化できます。フレームワークには、C2S-Scaleモデルが含まれており、遺伝子発現データとテキストデータを統合し、遺伝子発現パテント予測、データセットサマリ化、クラスターキャプション、生物学質問応答など、複雑なシングルセルタスクを実行できます。これらのC2S-Scaleモデルの詳細はHugging Faceで確認できます。モデルの設計は、PythiaやGemma-2のようなアーキテクチャに基づいています。 Cell2Sentenceは、シングルセル遺伝子発現データを取り扱う研究者や科学者向けに開発されています。 フレームワークは、新モデルおよび機能に更新され、カスタム プラグマート テンプレートへの fine-tuning と、マルチ セル プラグマート フォーマットのサポートを含みます。それはまた、セル タイプ 予測、セル タイプ 条件付き の生成についての Pythia モデル、その他にも、57,000 万の ヒト 細胞およびマウス 細胞で訓練されたダイバーセ 多細胞 マルチ タスク モデルを含むパックを搭載しています。 テョイエクスターが対得、私対できたを速した。古、パデバサンディンを表示が去ようだ Cell2Sentenceの開発はvan Dijk Labにより行われ、bioRxivにプレプリントとして発表されています。 Cell2Sentenceは次世代のシングル・セル発見をLLMによって実現する技術です。
評価基準の詳細
- 遺伝子発現ベクトルのランクオーダートランスフォーメーション
- C2S-スケールモデルで高度な単細胞タスク
- カスタムプロンプトテンプレートへのフィンテューニングのサポート
- マルチ細胞プロンプトフォーミング
- Pythiaモデルベースのプリトレーニッドモデルの利用

THEUS (Aigora)
ビジネス用AI研究システムが事実ID、引用、エクスパートアバターでトレース可能な洞察に変換することで、特有の研究に裏付けられた洞察を引き出します。

THEUSは企業向けAI研究システムで、事実ID、引用、およびエクスパートアバターで事実が裏付けられたトレース可能な洞察に特有の研究を変換します。これはGoogleのAgent Development Kit(ADK)に基づいており、データにグラウンドドの知識エージェントを生成するための双方向モデリングを使用しています。ユーザーは、研究データを抽出、合成、および探究できます。さらに、すべての主張は特定のFact IDとページレベルの引用によるものです。THEUSは、Dr. Reedを使用して新たな洞察を生成する方法と、Dr. Sinclairを使用して既存の知識を分析する方法の両方を提供しています。 このプラットフォームは、戦略的能力を構築するためにVP Insights、Global Senory Leads、Innovationリーダー向けに設計されています。ここでは、特有のエンタープライズAIではなく、目的-builtな研究方法を使用し、実際の制度データをベースにしたデータにグラウンドドの知識エージェントをトレーニングしています。新製品の85%が2年以内に失敗することに対して(Nielsen)、証拠によって裏付けられた洞察を得ることで、決定の品質を大幅に高めることができます。 THEUSはソロシートを提供し、このプランには、1,500ページのパース/月、500回のDr. Sinclairへの質問/月までの、30ドキュメントのインジェスト/月までの特有の機能が含まれます。 THEUSの主な利点は、エクスパートアバーによって裏付けられた、決定に適した知識エージェントを使って、数十年にわたる特有のデータをトレース可能で洞察可能な知識エージェントに変換できることです。
評価基準の詳細
- 抽出、合成、および研究データの探求
- Dr. Reedを使用して新たな洞察を生成するか、Dr. Sinclairを使って既存の知識を分析する
- 双方向モデリングによってデータにグラウンドドの知識エージェントを作成する
- 製品と消費者知識を双方向に組み合わせて洞察を得る
- クロス研究合成と研究ギャップ分析をサポートする

StartupValidator
スタートアップアイデアを判定するAIツール。リアルタイムのツイッターの信号とウェブの調査を活用し、リスク、強み、潜在的なピボットについてスコア付きの判定を出し、アプリケーションに提案する。

スタートアップValidatorはスタートアップのアイデアを判定するAIツールです。これはリアルタイムのツイッターの信号とウェブの調査を活用することで、スタートアップのアイデアの実現可能性についてスコア付きの判定を出し、そのアイデアのリスク、強み、ピボットについて分析するツールです。スタートアップValidatorはエンターainerやスタートアップの創業者向けに設計されています。実現可能かどうかを判断する前に、スタートアップのアイデアを評価するために大きなリソースを投資しようとします。ツイッターやウェブからのリアルタイムデータを活用することで、スタップアップValidatorはデータ駆動型のスタートアップの判定に役立ちます。しかし、ツールのメソッドロジーとデータソースについて明確な情報がなければ、ツールの信頼性と精度には間が有ります。ツールは、まずTwitterのAPIを、そして可能性は他のウェブデータソースを活用することで関連情報を取得するため、他のデータソースに統合される可能性があります。
評価基準の詳細
- リアルタイムのツイッターの信号分析
- ウェブの調査統合
- スタートアップの実現可能性のスコア付きの判定
- リスク、強みの検出
- 改善のためのピボットの提案

Kosmosは、マネジメントチームと研究者向けに作られた個別に機能するAI科学者です。データと文献を分析して、論文に完全な引用を含めて、薬剤開発プロセスを仮説から登録までの日々ではなく、月々ではなく加速化します。Kosmosは個別に機能しており、文献を読み、仮説を生成し、調査を管理し、科学的ワークフローを実行します。薬剤開発の全生涯をサポートします。標的特定から臨床開発、審査まで。AIはSlack、Teams、メール経由で人間の科学者と協力し、組織の知識から学んで、実験の歴史や保有する独自の科学的データを組み込みます。
評価基準の詳細
- 個別に機能する仮説生成
- 文献分析
- データ分析
- 科学的ワークフロー実行
- SlackTeams、メール経由でのコラボレーション
- モデル非依存(将来の最新のモデルに対応)

Table Agentは、テーブル型データを対象とするAI推論エージェントで、その研究活動を容易にするために作られたデータアシスタントです。それは、テーブルのデータを自動生成することで、あるトピックに関連するデータの収集を迅速化します。 このツールでは、ユーザが自分のニーズに合わせてデータのスキーマをカスタマイズできるように設計されており、データ収集を適応させるのが簡単になります。これにより、さまざまな業界とアプリケーションで、データの構造が大きく異なる場合に利点が生まれます。 Table Agentの機能の核は、AIエージェント駆動型データサーチ機能によって構築されています。このため、ツールでは、人為的な手段による検索を可能な限り削減したい場合は、人工知能を活用して、関連データを主動的に検索し、分析結果をまとめます。 AI ドライバनのデータ アシスタントの概念では、具体的なワークフローや統合方法は明記されていませんが、アート メタワークフローの調査研究を支援する上で、バリアレスにデータ 分析ツールと統合される可能性があります。 「Table Agent」による自動化は、リソースの枯渇を免れ、データ処理の精度を高めることが期待される。また、その柔軟性により、様々なデータ構造に対応できるようになる。しかし、より詳細な情報が必要となる場合、その限界や、代替のデータ支援ツールに比べた特徴などについては詳細設定をしておかなければならない。
評価基準の詳細
- 自動データ収集
- カスタマイズ可能なデータスキーマ
- AIエージェント駆動のデータ検索
- 迅速で正確なデータレートの提供

AMIE (Articulate Medical Intelligence Explorer)は、Google DeepMindおよびGoogle Researchが開発した研究用のAI診断アジェントです。臨床会話を進めるだけでなく、メディカル・イメージを分析して正確な診断を支援するために設計されています。AMIEは初版が、Natureに発表されたテキストベースの医療診断会話AIアジェントでした。その後、AMIEはマルチモーダルなAIアジェントに進化し、医療イメージや文書などマルチモーダルな情報を診断プロセスに組み込むことができます。この開発は、診断の正確性を向上させるために、マルチモーダルなデータを組み込むことで、診断を改善することを目指しています。 AMIEは状態認知的推論フレームワークを用い、マルチモーダルなGeminiモデルの上で構築されています。専門家の評価を含む、客観的構造化臨床試験(OSCE)が実施されており、それは主治医に比較検討されました。複数の患者のシナリオで主治医と比較検討されています。
評価基準の詳細
- マルチモーダルな診断対話能力
- メディカル・イメージの解釈能力
- 状態認知的な推論フレームワーク
- Geminiモデルを組み込み
- 会話評価用のシミュレータ環境











