历史对决 · 2024-11-29 UTC
Research AI Agents 对决 — 2024年11月29日
来自Research AI Agents类别。 2个标记分布在2个参赛者中。 Autoresearch夺得桂冠。
最终排名
THEUS (Aigora)
Autoresearch阵容
参赛工具
参加这场对决的每个工具的简介,按最终得分排序。


Autoresearch 是一个开源项目,允许 AI 代理自主运行 LLM 训练实验并保留最佳模型变更。该项目允许用户建立一个小型但真实的 LLM 训练环境,并让 AI 代理在夜间进行实验,修改代码,训练一短段时间,并检查结果是否有所改善。目标是自动化研究过程,让 AI 代理在无需人类干预的情况下探索不同的模型架构、超参数和优化策略。该项目包括 nanochat 的简化单 GPU 实现,并为使用 Markdown 文件编程 AI 代理的研究过程提供基本结构。该项目设计为可扩展的,允许用户添加更多代理并随着时间的推移改进研究过程。
标准细分
- 自主 LLM 训练实验
- AI 代理驱动的研究过程
- nanochat 的单 GPU 实现
- 基于 Markdown 的研究过程编程
- 5 分钟训练时间预算,附带评估指标(val_bpb)


THEUS 是一款企业级 AI 研究系统,能够将专有研究转化为可追溯的洞察,配有 Fact ID、引用以及专家化身。系统基于 Google 的 Agent Development Kit (ADK) 构建,采用双向建模实现数据驱动的知识代理。用户可以提取、合成并探索自己的研究数据,每一条主张都有对应的 Fact ID 并附有页级引用。THEUS 提供两种探索方式:通过 Dr. Reed 生成新洞察,或通过 Dr. Sinclair 分析已有知识。 该平台面向洞察副总裁、全球感官负责人以及评估战略能力建设的创新领袖而设计。它采用专门构建的研究方法论,而非通用企业 AI,并创建基于数据的知识代理,使用真实机构数据进行训练。根据尼尔森的数据,85% 的新产品在两年内失败,基于证据的探索显著提升决策质量。 THEUS 提供单用户席位,包含每月最多可上传 30 份文档、解析最多 1,500 页,以及向 Dr. Sinclair 提出最多 500 次问题的功能。 THEUS 的关键优势之一是能够将数十年的专有数据转化为可追溯、可直接用于决策的情报,借助 AI 驱动的知识代理。
标准细分
- 提取、综合和探索研究数据
- 使用Dr. Reed生成新的见解或使用Dr.Sinclair分析现有知识
- 双向建模,为数据驱动的知识代理
- 连接产品和消费者知识进行双向见解
- 支持跨研究综合和研究差距分析