历史对决 · 2024-05-31 UTC
Research AI Agents 对决 — 2024年5月31日
来自Research AI Agents类别。 34个标记分布在8个参赛者中。 Google AI Co-Scientist夺得桂冠。
最终排名
阵容
参赛工具
参加这场对决的每个工具的简介,按最终得分排序。


Google AI Co-Scientist 是一个多智能体 AI 系统,旨在与科学家协作,推动生物医学研究的加速。它基于 Gemini 2.0 构建,扮演虚拟科研伙伴的角色,帮助生成新颖的假设和研究方案。该系统意在模拟支撑科学方法的推理过程,发掘全新且原创的知识。给定科学家以自然语言描述的研究目标,AI Co-Scientist 会生成创新的研究假设、详细的研究概览及实验方案。系统采用包含生成、反思、排名、演化、邻近、元评审等专门代理的协同体系,利用自动化反馈迭代生成、评估并完善假设。科学家可以通过多种方式与其互动,包括提供探索种子想法或对生成结果提供自然语言反馈。AI Co-Scientist 还运用网页搜索和专用 AI 模型等工具,提升生成假设的根基与质量。该系统设计能灵活扩展计算资源,并迭代改进其针对指定研究目标的科学推理能力。 Google AI Co-Scientist 对那些在快速增长的科学出版物中导航并整合陌生领域洞察的科学家尤为有用。借助最新的 AI 进展,包括跨复杂学科的综合能力以及长期规划和推理的能力,Google AI Co-Scientist 旨在加速科学与生物医学发现的进程。 该系统已在多种应用中进行了测试,包括基因转移发现和转移再发现。 虽然 AI Co-Scientist 具有多项优势,但其有效性取决于输入研究目标的质量以及科学家提供有意义反馈的能力。 AI Co-Scientist 是一款新的工具,具有对科学界产生重大影响的潜力,但它的局限性和潜在偏见需要被仔细评估。 AI Co-Scientist 的开发是一个持续进行的工作,其未来的应用和改进将取决于持续的研究和测试。
标准细分
- 假设生成
- 研究概述创建
- 实验方案开发
- 科学推理专用代理
- 自动反馈循环
- 网络搜索集成


Bright Data 的 Web MCP 是一款服务器,能够让 AI 代理可靠地进行网页搜索、抓取和浏览器自动化。它提供每月 5,000 次免费请求。该工具帮助 AI 代理有效地搜索网络、提取数据并在不被拦截的情况下浏览网站。功能包括实时搜索结果、数据提取、网站爬取和浏览器自动化。Web MCP 旨在绕过封锁和限制,已获得全球超过 20,000 家客户的信赖。
标准细分
- 实时网页搜索
- 网站爬取与数据提取
- 浏览器自动化
- 绕过地区限制和验证码
- 渲染 JavaScript 以获取动态内容
- 模拟真实用户行为

科莫斯是一款面向生物医药研发团队与科研人员的自动化 AI 科学家。它分析数据和文献来生成有源注证的科学报告,减短从假设到注册药物开发整个过程,从天到几天,不再是需要几个月。
标准细分
- 自主性猜想生成
- 文献分析
- 数据分析
- 科学工作流执行
- 通过 Slack、Teams 和电子邮件合作
- 对未来最先进模型无关


THEUS 是一款企业级 AI 研究系统,能够将专有研究转化为可追溯的洞察,配有 Fact ID、引用以及专家化身。系统基于 Google 的 Agent Development Kit (ADK) 构建,采用双向建模实现数据驱动的知识代理。用户可以提取、合成并探索自己的研究数据,每一条主张都有对应的 Fact ID 并附有页级引用。THEUS 提供两种探索方式:通过 Dr. Reed 生成新洞察,或通过 Dr. Sinclair 分析已有知识。 该平台面向洞察副总裁、全球感官负责人以及评估战略能力建设的创新领袖而设计。它采用专门构建的研究方法论,而非通用企业 AI,并创建基于数据的知识代理,使用真实机构数据进行训练。根据尼尔森的数据,85% 的新产品在两年内失败,基于证据的探索显著提升决策质量。 THEUS 提供单用户席位,包含每月最多可上传 30 份文档、解析最多 1,500 页,以及向 Dr. Sinclair 提出最多 500 次问题的功能。 THEUS 的关键优势之一是能够将数十年的专有数据转化为可追溯、可直接用于决策的情报,借助 AI 驱动的知识代理。
标准细分
- 提取、综合和探索研究数据
- 使用Dr. Reed生成新的见解或使用Dr.Sinclair分析现有知识
- 双向建模,为数据驱动的知识代理
- 连接产品和消费者知识进行双向见解
- 支持跨研究综合和研究差距分析

AMIE(Articulate Medical Intelligence Explorer)是由Google DeepMind和Google Research开发的研究型AI诊断代理。它旨在通过临床对话和医疗图像解读实现精准诊断。最初,AMIE是一种基于文本的医疗诊断对话AI代理,发表在《自然》杂志上。最新的多模态AMIE发展,通过在临床对话中智能地请求、解读和推理视觉医疗信息。这一发展旨在通过将图像和文档等多模态数据纳入诊断过程来提高诊断准确性。AMIE使用状态感知推理框架,基于多模态Gemini模型构建。通过专家评估,包括客观结构化临床考试(OSCEs),比较其在各种患者场景中的表现与初级医疗医生(PCPs)。
标准细分
- 多模态诊断对话
- 视觉医疗信息解读
- 状态感知推理框架
- 与Gemini模型的集成
- 用于对话评估的模拟环境


QualiaInterviews 是一个研究平台,利用 AI 通过自然、对话式的交流方式与参与者进行访谈。它使团队能够从比传统一对一访谈更大样本规模获取定性洞察,同时保留开放式对话的深度与细致度。 该工具支持多语言访谈,适用于跨境研究、全球市场调研和项目评估。研究人员可设计访谈指南,部署给受访者,并自动结构化结果,省去手动主持每一次访谈的过程。 QualiaInterviews 通常被社会研究人员、评估者、UX团队以及开展影响评估的组织使用,这些组织需要可扩展的定性数据,但又不想牺牲对话深度。
标准细分
- 人工智能主持的对话式访谈
- 多语种访谈支持
- 自动跟进和询问问题
- 对于定性反应的结构分析
- 可扩展参与者部署
- 硏究和评估工作流工具

Table Agent 是一款 AI 驱动的数据助理,专为表格化研究而设计。它旨在自动化收集任意主题数据的过程,使研究更加高效。 该工具支持可定制的数据模式,使用户能够根据特定需求定制数据收集方式。这种灵活性对数据结构差异显著的各种应用和行业都非常有益。 Table Agent 的核心功能是其基于 AI 代理的数据搜索能力。这意味着该工具利用人工智能主动寻找并汇总相关数据,有望减少手动搜索所需的时间和精力。 虽然没有详细说明其工作流程和集成方式,但AI驱动的数据助理的概念表明,它可以与各种数据分析工具无缝对接,提升整体研究过程。 Table Agent 的优势可能在于它能够自动化繁琐的数据收集任务,并且能够适应不同的数据结构。然而,由于缺乏更具体的信息,要确定它的局限性或与其他数据助理工具的比较仍然比较困难。
标准细分
- 自动化数据采集
- 可定制的数据模式
- AI 代理驱动的数据检索
- 快速准确的数据检索


Autoresearch 是一个开源项目,允许 AI 代理自主运行 LLM 训练实验并保留最佳模型变更。该项目允许用户建立一个小型但真实的 LLM 训练环境,并让 AI 代理在夜间进行实验,修改代码,训练一短段时间,并检查结果是否有所改善。目标是自动化研究过程,让 AI 代理在无需人类干预的情况下探索不同的模型架构、超参数和优化策略。该项目包括 nanochat 的简化单 GPU 实现,并为使用 Markdown 文件编程 AI 代理的研究过程提供基本结构。该项目设计为可扩展的,允许用户添加更多代理并随着时间的推移改进研究过程。
标准细分
- 自主 LLM 训练实验
- AI 代理驱动的研究过程
- nanochat 的单 GPU 实现
- 基于 Markdown 的研究过程编程
- 5 分钟训练时间预算,附带评估指标(val_bpb)









