历史对决 · 2025-12-18 UTC
AI Data Analysts 对决 — 2025年12月18日
来自AI Data Analysts类别。 17个标记分布在4个参赛者中。 Together Open Data Scientist夺得桂冠。
最终排名
阵容
参赛工具
参加这场对决的每个工具的简介,按最终得分排序。


Together Open Data Scientist 是由 Together AI 在 GitHub 上发布的开源、AI 驱动的数据分析代理。它遵循 ReAct(Reasoning + Acting)框架,在语言模型推理步骤和具体的 Python 代码执行之间交替,以完成端到端的数据科学任务,例如探索数据集、计算摘要统计、构建模型以及生成详细的书面分析报告。 该代理可以以两种模式执行 Python。 “internal” 模式在本地的 Docker 容器中运行代码,适合单用户本地开发;而 “tci” 模式则将执行任务卸载到 Together Code Interpreter(TCI),通过 Together AI API 访问的云沙箱。用户可以上传数据目录以实现自动摄取,设置最大推理迭代次数,并选择驱动代理的底层模型——默认使用 DeepSeek‑V3,也可以指定 Together 平台上提供的 Llama 系列模型及其他模型。 它以 pip 可安装的包(open-data-scientist)形式发布,并同时提供命令行界面(CLI)和 Python API。CLI 支持诸如 --write-report 用于生成 Markdown 分析报告、--save-trace 用于记录完整的查询和执行跟踪,以及通过会话 ID 进行会话复用等选项。Python API 以 ReActDataScienceAgent 类为核心,该类接受自然语言任务并返回结果。 Together Open Data Scientist 项目明确标注为实验性软件。由于所有代码和分析均由 AI 生成,输出可能包含错误或次优方案,最好将其视为探索和学习的起点,而非用于生产决策。维护者强调,尤其在关键业务或研究应用中,仍需人工监督和验证。 相较于商业 AI 数据分析助手(如 ChatGPT 的 Advanced Data Analysis 或 notebook copilots),Together Open Data Scientist 的差异在于它完全开源、可自行托管、在 Together 生态系统内模型无关,并且能够自主串联多个代码执行步骤,生成完整报告,而不是仅提供一次性答案。
标准细分
- ReAct 行为推理代理循环
- 本地 Docker 或 Together Code Interpreter 云执行两种模式
- 自动数据目录上传分析
- Markdown 报告生成选项 --write-report
- 可配置模型和最大推理迭代数
- 命令行界面和可编程 Python API


Shortcut 是一款专为电子表格工作设计的 AI 代理,能够根据自然语言指令规划、构建和编辑 Excel 模型、分析与报告。它面向金融专业人士——如对冲基金、资产管理公司等机构的分析师——在这些场景中,准确性和可审计性比原始速度更为重要。公司宣称该工具已被部署于大型多策略对冲基金,并在数千个每日活跃席位上使用。 该工具可通过两种方式使用:一个独立的Web应用程序和一个本地Excel插件。网页应用被描述为大约95%与Excel功能相当,而插件则通过直接在用户现有的Excel环境中工作,提供完全相当的功能,包括宏、键盘快捷键和大型文件。文件可以以Excel格式打开和导出,且不会丢失格式、公式或功能,从而降低了将其整合到既定工作流程中的摩擦。还有一个以终端为主的CLI(ShortcutXL),针对想在桌面Excel中并行构建和编辑多个模型的高阶用户。 核心设计重点是准确性。Shortcut 声称其输出是基于公式而非硬编码的,因此结果会随底层数据动态更新,而不是在输入更改时失效。它采用专业级排版,并专门设计在精准放置编辑的位置,避免覆盖已有数据——这正是通用 AI 电子表格工具常见的失效模式。公司引用 SpreadsheetBench 结果以及与一年级分析师进行头对头挑战时 90% 的胜率,来证明其准确性主张。 可审计性与信任被视为首要关注点。Shortcut 会展示每个被修改的单元格,指出哪些值是硬编码的并解释原因,同时允许用户在操作序列中恢复、还原或撤销任一步骤。关于安全,Shortcut 宣称符合 SOC 2 Type II 合规,存储时使用 AES-256 加密,传输时使用 TLS 1.3,实施基于角色的访问控制,并与 AI 供应商签订零保留协议,且付费方案的数据永不用于模型训练。 相较于通用助手如 ChatGPT、Claude 或 Microsoft Copilot 在 Excel 中的功能,Shortcut 主要针对电子表格构建进行深度专业化,并声称在基准任务上的准确率显著更高。其差异化体现在 Excel 原生操作、公式驱动的输出以及满足机构金融用户需求的审计功能。专注于 Excel 的金融与数据工作意味着它不适用于广泛的办公生产力,而许多性能主张来自供应商报告,潜在客户需要在自己的工作流程中进行验证。
标准细分
- 本机Excel插件及独立的Web应用
- 高级别的CLI ShortcutXL(Terminal-first)用于满足专业用户
- 基于公式的输出,能够保持动态更新
- 在每个单元格级别记录更改,并支持撤销、恢复和单步操作
- 专业的工业标准格式
- 无格式丢失的Excel文件导入和导出

Trinka AI 是一款专为研究人员、学生和技术专业人士设计的写作助手。它不仅提供常规的语法和拼写检查,还聚焦学术写作的规范,标记出诸如术语不统一、句子结构不清晰以及学术稿件中常见的语气问题等错误。 该工具在数百个学科领域提供针对学科的建议,可帮助完成改写、连贯性检查以及确保符合出版风格指南等任务。它可与 Microsoft Word、浏览器以及云编辑器集成,可在典型的研究工作流中使用。 Trinka 还提供了面向稿件准备的专门功能,例如期刊就绪检查、抄袭检测和引用核对,使其不仅仅是一个通用的语法检查工具。
标准细分
- 高级语法和风格检查
- 学术风格和清晰度提升
- 重新表述和一致性工具
- 剽窃和引用核查
- 期刊提交准备报告
- 浏览器、Word和云编辑集成

Edexia是一款专为中学英语评估打造的AI驱动评分与反馈助手,主要聚焦国际文凭(IB)英语课程以及澳大利亚的高级框架(VCE、HSC、QCE和WACE)。它不提供通用的作文评分,而是预先加载相关评分标准、等级描述符和学习设计要求,并由一支经验丰富的教育团队不断对其进行训练和验证,以符合真实的评分标准。 该工具的核心理念是:AI 评分应与各个教师和部门的实际打分方式进行校准。教师对试卷进行盲审评分,在校准会议中统一判分,系统通过这一过程学习,使其初步评分和反馈越来越符合学校的标准。根据公司公布的数据显示,在圣伯纳德学院对 579 篇论文进行试用时,Edexia 与教师评分完全一致的比例为 81.2%,而落在一分范围内的比例为 98.3%。 核心设计原则是让教师保持主导地位。每条 AI 生成的评论在传递给学生之前都可被编辑、重写或删除;教师可以将个人语音笔记添加到反馈中;并且教师审核模式会在人工审核并发布之前保留所有输出。这样,Edexia 被定位为一个 AI 笔录员和助手,草拟详细反馈供教师进一步完善,而不是一个自治评分者。 除了评分功能外,该平台还集成了一系列课堂工作流工具:AI 检测并重现学生的写作过程(展示粘贴、换行和 AI 可能性得分),交叉提交报告概括每位学生的优势与后续步骤,搜索式提示与激励库,盲评分及调阅功能并可视化成绩分布,以及扫描响应的手写转录。它还为 IB 学习清单上的作品构建了主题、作者意图和关键引用的文本知识库。 对学生而言,Edexia 使他们能够快速完成写作–反馈–重写循环,能在同一晚内起草论文、即时获得反馈并进行修改。对于教师和部门,重点在于节省批改时间,并通过审核与校准提升评判的一致性。 公司强调隐私与数据治理:训练数据被隔离在个人或机构账户中,仍属于账户持有者的知识产权,且不用于训练 Edexia 的模型。数据经过去标识化后存储在澳大利亚的服务器上,公司已获得 SOC 2 Type II 认证、ISO 27001 及 ST4S 认可。根据目前的官网信息,Edexia 对教师和学生免费开放,并设置了等待名单,其功能定位相对狭窄——在 IB 与澳大利亚英语方面表现最为突出,而不是面向所有学科的通用评分工具。
标准细分
- 与 IB 对齐的评分标准和等级描述,经过教育者验证
- 教师审阅模式,支持完整编辑和语音备注
- AI 写作过程回放与 AI 可能性检测
- 盲评、调节与校准分析
- 可按文本、主题和指令词搜索的提示与素材库
- 扫描答卷的手写转录





