過去のバトル · 2024-05-31 UTC
Research AI Agents 対決 — 2024年5月31日
Research AI Agentsカテゴリーから。 8名の参戦者に34票が投じられました。 Google AI Co-Scientistが王座に。
最終結果
ラインナップ
参戦ツール
このバトルに参戦したすべてのツールの紹介。最終スコア順。


グーグルアीआईコサイエンティストは、科学者との協力と生物医学研究の加速を目的としたマルチエージェントアジエントを搭載したシステムです。Gemini 2.0を採用し、科学的仮説の生成と研究提案の支援を目指し、仮説の生成、詳細な研究概要、実験プロトコルの生成などを提供するための仮想的な科学的共同作業者として機能します。このシステムは、科学的方法の下敷きとなる論理的推論過程を擬似化するように設計されており、従来の知識から切り離された新規的でオリジナルの知識の発見に役立ちます。自然言語で研究目標を指定された科学者に対し、このAIコサイエンティストは新しい研究仮説の生成、詳細な研究概要、実験プロトコルの生成などを提供します。このAIコサイエンティストは、ジェネレーション、リフレクション、ランク、エボリューション、プロキシ、メタレビューなどの専門化したエージェントのコアリアンを使用して、それらが自動的なフィードバックを用いて、仮説を生成・評価・改良します。科学者は、さまざまな方法(seedアイデアの提供や生成された出力にフィードバックするなど)で、このAIコサイエンティストと相互作用することができます。このAIコサイエンティストは、検索エンジン等のツールや専門のAIモデルの活用により、生成された仮説の確立度とコンテンツの質を向上させることにも取り入れています。このシステムは、指定された研究目標に対して、コンピュータ処理の可変的なスケーラビリティと逐次的な科学的推論の改良を支援するように設計されています。 AI Co-シンセイストは、科学出版物の爆発的な成長に挑戦し、不鮮明な分野から洞察を統合するという、研究者にとっての課題にすぐれている。AI Co-シンセイストは、複雑なテーマ間のシナセジアを可能にする最近のAIの進歩を活用し、長期的な計画と帰納的な推論を実行する能力を利用します。このツールは、科学技術と生物医学研究における重大な発見を急ぐのを支援するように設計されています。 さまざまな応用分野でテストされており、遺伝子移行の発見と再発見が含まれています。 AI Co-Scientistは、様々なメリットを持つ一方、その有効性は入力する研究目標の品質や、科学者が与えるフィードバックの有意性に依存している AI Co-サイエンティストは、科学コミュニティに大きな影響を与える可能性のある新しいツールですが、その制限や潜在的な偏見は慎重に評価される必要があります。 AI Co-Scientist の開発は継続中であり、その未来的なアプリケーションや改善は継続的な研究とテストに依存することとなる。
評価基準の詳細
- 仮説生成
- 研究概要作成
- 実験計画開発
- 科学的推論の専門エージェント
- 自動フィードバックループ
- ウェブ検索統合


バライトデータのWeb MCPは、AIエージェントが可靠にWebを検索、スクレイピング、およびブラウザを自動化できるサーバーです。5,000の無料月間リクエストを提供します。ツールは、AIエージェントがブロックされないように、有効にWebを検索してデータを抽出し、サイトをナビゲートできるようにします。このWeb MCPは、ロックなどの制限をバイパスするように設計されており、世界的に20,000を超える 顧客に信頼されています。
評価基準の詳細
- リアルタイムWeb検索
- サイトクローリングとデータ抽出
- ブラウザ自動化
- ジオリエクストリクションやCAPTCHABypass
- 動的コンテンツを用いたJavaScriptのレンダリング
- リアルのユーザービハivors

Kosmosは、マネジメントチームと研究者向けに作られた個別に機能するAI科学者です。データと文献を分析して、論文に完全な引用を含めて、薬剤開発プロセスを仮説から登録までの日々ではなく、月々ではなく加速化します。Kosmosは個別に機能しており、文献を読み、仮説を生成し、調査を管理し、科学的ワークフローを実行します。薬剤開発の全生涯をサポートします。標的特定から臨床開発、審査まで。AIはSlack、Teams、メール経由で人間の科学者と協力し、組織の知識から学んで、実験の歴史や保有する独自の科学的データを組み込みます。
評価基準の詳細
- 個別に機能する仮説生成
- 文献分析
- データ分析
- 科学的ワークフロー実行
- SlackTeams、メール経由でのコラボレーション
- モデル非依存(将来の最新のモデルに対応)

THEUS (Aigora)
ビジネス用AI研究システムが事実ID、引用、エクスパートアバターでトレース可能な洞察に変換することで、特有の研究に裏付けられた洞察を引き出します。

THEUSは企業向けAI研究システムで、事実ID、引用、およびエクスパートアバターで事実が裏付けられたトレース可能な洞察に特有の研究を変換します。これはGoogleのAgent Development Kit(ADK)に基づいており、データにグラウンドドの知識エージェントを生成するための双方向モデリングを使用しています。ユーザーは、研究データを抽出、合成、および探究できます。さらに、すべての主張は特定のFact IDとページレベルの引用によるものです。THEUSは、Dr. Reedを使用して新たな洞察を生成する方法と、Dr. Sinclairを使用して既存の知識を分析する方法の両方を提供しています。 このプラットフォームは、戦略的能力を構築するためにVP Insights、Global Senory Leads、Innovationリーダー向けに設計されています。ここでは、特有のエンタープライズAIではなく、目的-builtな研究方法を使用し、実際の制度データをベースにしたデータにグラウンドドの知識エージェントをトレーニングしています。新製品の85%が2年以内に失敗することに対して(Nielsen)、証拠によって裏付けられた洞察を得ることで、決定の品質を大幅に高めることができます。 THEUSはソロシートを提供し、このプランには、1,500ページのパース/月、500回のDr. Sinclairへの質問/月までの、30ドキュメントのインジェスト/月までの特有の機能が含まれます。 THEUSの主な利点は、エクスパートアバーによって裏付けられた、決定に適した知識エージェントを使って、数十年にわたる特有のデータをトレース可能で洞察可能な知識エージェントに変換できることです。
評価基準の詳細
- 抽出、合成、および研究データの探求
- Dr. Reedを使用して新たな洞察を生成するか、Dr. Sinclairを使って既存の知識を分析する
- 双方向モデリングによってデータにグラウンドドの知識エージェントを作成する
- 製品と消費者知識を双方向に組み合わせて洞察を得る
- クロス研究合成と研究ギャップ分析をサポートする

AMIE (Articulate Medical Intelligence Explorer)は、Google DeepMindおよびGoogle Researchが開発した研究用のAI診断アジェントです。臨床会話を進めるだけでなく、メディカル・イメージを分析して正確な診断を支援するために設計されています。AMIEは初版が、Natureに発表されたテキストベースの医療診断会話AIアジェントでした。その後、AMIEはマルチモーダルなAIアジェントに進化し、医療イメージや文書などマルチモーダルな情報を診断プロセスに組み込むことができます。この開発は、診断の正確性を向上させるために、マルチモーダルなデータを組み込むことで、診断を改善することを目指しています。 AMIEは状態認知的推論フレームワークを用い、マルチモーダルなGeminiモデルの上で構築されています。専門家の評価を含む、客観的構造化臨床試験(OSCE)が実施されており、それは主治医に比較検討されました。複数の患者のシナリオで主治医と比較検討されています。
評価基準の詳細
- マルチモーダルな診断対話能力
- メディカル・イメージの解釈能力
- 状態認知的な推論フレームワーク
- Geminiモデルを組み込み
- 会話評価用のシミュレータ環境


グパチエングンチシャサ読ティードたはトミティルでなしですにフィユネㄫのテジョナはトエアスクイガンにサューカなしたにいます。バンイタルティードたしたかエッヘガエェヨボのらおやフィユネㄫでを気たれったい世界はジェアタクガンにサューカにいます。 このツールは、複数言語でのインタビューをサポートしているため、対照研究、グローバルマーケット調査、プログラム評価など、境界を越えた研究に適しております。また、研究者はインタビューガイドを設計、パートicipantに配布し、それらのデータを自動的に構造化して見えていながら、各セッションにマニュアルモデレーションする必要はありません。 シロバーイディサェアのプロバンチレジアカですん、アサェアを为ためにプイエェンヅィヶ、エイサルを覴同できいだと、トサェア、モスエェムのイグイヶゴカれたますを官購だ为、パティショナかできだでましたにのロルレェイスンチネンをいただはらうますを迊さが見したウンショナでん当前だいなインをいただくビコヒトカにが当前だが見した".
評価基準の詳細
- AIがモデレーターする会話型インタビュー
- マルチ言語対応のインタビューに対応
- 自動的にフォロアップや質問を提示
- 質的応答の分析を自動的に構造化
- 大規模な参加者へのデプロイ
- 調査・評価業務用ワークフローツール

Table Agentは、テーブル型データを対象とするAI推論エージェントで、その研究活動を容易にするために作られたデータアシスタントです。それは、テーブルのデータを自動生成することで、あるトピックに関連するデータの収集を迅速化します。 このツールでは、ユーザが自分のニーズに合わせてデータのスキーマをカスタマイズできるように設計されており、データ収集を適応させるのが簡単になります。これにより、さまざまな業界とアプリケーションで、データの構造が大きく異なる場合に利点が生まれます。 Table Agentの機能の核は、AIエージェント駆動型データサーチ機能によって構築されています。このため、ツールでは、人為的な手段による検索を可能な限り削減したい場合は、人工知能を活用して、関連データを主動的に検索し、分析結果をまとめます。 AI ドライバनのデータ アシスタントの概念では、具体的なワークフローや統合方法は明記されていませんが、アート メタワークフローの調査研究を支援する上で、バリアレスにデータ 分析ツールと統合される可能性があります。 「Table Agent」による自動化は、リソースの枯渇を免れ、データ処理の精度を高めることが期待される。また、その柔軟性により、様々なデータ構造に対応できるようになる。しかし、より詳細な情報が必要となる場合、その限界や、代替のデータ支援ツールに比べた特徴などについては詳細設定をしておかなければならない。
評価基準の詳細
- 自動データ収集
- カスタマイズ可能なデータスキーマ
- AIエージェント駆動のデータ検索
- 迅速で正確なデータレートの提供


Autoresearchはオープンソースプロジェクトであり、AIエージェントが独立してトレーニング実験を実行し続け、それらの改進を保存します。ユーザーは、小規模な環境を構築し、次の朝にAIエージェントがそれを操作して実験を進行させ、結果が向上するかどうかを確認できます。AIエージェントが、さまざまなモデルアーキテクチャ、ハイパーパラメータ、最適化戦略を自動で試すことができるようにすることで、人間の介入を必要とせずに行う研究プロセスを目的としています。このプロジェクトは、nanochatのシンプルな単一GPU実装を提供し、マークダウンファイルを使用してAIエージェントの研究プロセスを構築するための基本的なスキルを提供します。このプロジェクトは、ユーザーがさらにエージェントを追加し研究プロセスを改良できるように設計されています。
評価基準の詳細
- 独立したLLMトレーニング実験
- AIエージェントドライバーの研究プロセス
- nanochatの単一GPU実装
- マークダウンを使用したプロセス
- 5分のトレーニング時間予算と評価指標(Val_BPB)









