最终排名
阵容
参赛工具
参加这场对决的每个工具的简介,按最终得分排序。

ASI:One 是一款围绕代理智能概念构建的 AI 助手,其对话界面可以派遣并协调专用的自主代理,以处理复杂请求。它不仅仅返回文本,还能进行计划、调用工具并代表用户执行工作流。 该产品在 Artificial Superintelligence Alliance 生态体系中开发,定位为个人 AI 代理,能够与去中心化的代理网络集成。用户既可以通过聊天获取日常问题的答案,也可以委托更长的任务,如调研、对比、排程以及跨连接服务的数据查询。
标准细分
- 对话聊天界面
- 自主代理编排
- 多步骤任务规划与执行
- 与外部代理和服务的连接
- 个人助理式记忆与上下文
- 基于 ASI Alliance 代理栈构建


Gemini 2.0 Flash 是 Google DeepMind 的下一代模型,专为速度、规模和多模态推理而优化。它支持文本、图像、音频和视频输入,并能生成文本、图像和音频输出,适用于丰富的交互式应用。 为支持代理式工作流程而设计,该模型支持原生工具使用、函数调用,并提供 1M-token 上下文窗口,可处理大型文档、代码库或长时间运行的会话。低延迟使其成为助手、实时分析和生产规模部署的实用选择。 开发者可以通过 Gemini API、Google AI Studio 和 Vertex AI 访问 Gemini 2.0 Flash,并且在主要语言中提供 SDK。
标准细分
- 1M令牌上下文窗口
- 多模态输入:文本、图像、音频、视频
- 原生工具调用和代码执行
- 实时流式响应
- 图像和音频生成
- 通过Gemini API和Vertex AI提供


Mistral Small 3 是 Mistral AI 的一个轻量级大型语言模型,旨在提供强大的推理和生成能力,同时能够在资源较为有限的硬件上高效运行。它面向那些希望拥有强大 AI 能力但不想承担前沿规模模型基础设施成本的开发者和组织。 在开放许可证下发布,该模型可自行托管、微调,并集成到商业应用中。它在速度、精度与资源效率之间实现了平衡,适用于聊天助手、内容生成、代码任务以及需要低延迟或注重隐私的本地部署。
标准细分
- 開源模型發佈
- 效率優化的推論
- 競爭性的基準結果
- 支持微調和個性化
- 適合免費部署
- 支援多語文字生成

OpenAI o3 是一款前沿的推理模型,旨在处理需要细致、逐步思考的问题。它基于 o-series 方法,在推理时投入更多计算资源,用于规划、验证和精炼答案,使其非常适合数学、编程、科学与逻辑分析等任务。 与通用聊天模型相比,o3 更注重深度而非速度。它能够拆解模糊的提示,评估多种方法,并在强调推理与工具使用的基准测试中生成更可靠的结果。开发者可通过 OpenAI API 和 ChatGPT 访问它,并可在其上集成网页浏览、Python 以及文件分析等工具。 该模型面向需要在复杂问题上获得更高精度的研究人员、工程师以及高阶用户,他们愿意牺牲一定的延迟和成本,以获得更高质量的结果。
标准细分
- 链式推理深度扩展
- 工具使用包括代码、浏览器和文件输入
- 支持较长的文档
- API 和 ChatGPT 可访问性
- STEM 板块的准确率提高
- 支持复杂的机器人流程


DeepSeek R1 是一款开源大型语言模型,擅长推理、数学和编码任务。它采用 Mixture of Experts(MoE)架构,拥有 37 B 激活参数和 671 B 总参数,支持 128 K 上下文长度。模型融合了先进的强化学习技术,实现了自我验证、多步反思和人类对齐的推理能力。DeepSeek R1 在多项基准测试中取得了领先成绩,包括在 MATH‑500 上达到 97.3% 的准确率、在 AIME 2024 上获得 79.8% 的及格率,并超越了 96.3% 的 Codeforces 参赛者。模型提供从 1.5 B 到 70 B 参数的多个变体,采用 MIT 许可证,可免费使用和修改。DeepSeek R1 可在线免费使用,亦提供 WebGPU 加速版,可在本地浏览器中运行。 该模型面向复杂问题求解、多语言理解以及生产级代码生成。其优势在于卓越的数学推理、代码生成和自然语言理解能力。然而,作为开源模型,部署和针对特定场景的微调可能需要一定的技术专业度。 DeepSeek R1 在全球 AI 模型中位居前列,能力可与领先的专有解决方案相媲美。开源属性促成社区驱动的持续迭代,包括计划中的多模态支持、对话增强以及分布式推理优化。 模型采用纯强化学习开发,使其在显著降低成本的同时实现 GPT‑4 级别的数学性能。链式思考可视化能力解决了 AI “黑箱”难题,提供对模型推理过程的洞察。 DeepSeek R1 的 API 提供兼容 OpenAI 的端点,价格为每百万 token $0.14。模型权重开源,允许商业使用和修改。
标准细分
- Mixture of Experts(MoE)架构
- 先进的强化学习技术
- 自我验证和多步反思能力
- 人类对齐的推理
- 支持 128 K 上下文长度
- 兼容 OpenAI 的 API 端点


DeepSeek V3 是由 DeepSeek AI 开发的大规模 Mixture-of-Experts (MoE) 语言模型。它在每个 token 只激活全部参数的一小部分,使其在推理、数学和代码任务上表现出色,同时推理成本远低于同等的 dense 模型。 DeepSeek V3 以开源权重发布,已成为开发者和研究者的热门选择,能够自托管、微调或通过 API 集成。基准测试显示,它在数学和逻辑推理评估上与领先的专有模型如 GPT-4o 竞争力强。 该模型非常适合技术助理、代码生成流水线、研究工作流,以及任何对推理质量和预算效率都有要求的应用场景。
标准细分
- Mixture-of-Experts 架构
- 在推理和数学基准上具竞争力
- 开源模型权重
- 通过 DeepSeek 平台提供 API 访问
- 支持长上下文窗口
- 易于微调

Llama 3.3 是 Meta 推出的大型语言模型,旨在提供强大的推理、编码和多语言能力,同时在运行效率上比以往旗舰模型更高。它支持多种语言,适用于聊天助手、内容生成、摘要和开发者工具等场景。 该模型以开放权重发布,可在本地部署或通过主要云服务商和推理提供商部署,赋予团队在成本、延迟和数据处理上的灵活性。其指令微调版本专为准确遵循提示并生成有用、对话式回答而优化。 开发者通常将 Llama 3.3 用作微调领域特定应用、检索增强生成系统和代理工作流的基础。
标准细分
- 多语言文本生成
- 指令训练后的聊天变体
- 长文本支持
- 编码和推理能力
- 开放权重可进行微调
- 兼容主流推断框架
Pronoia 是一款专为阿拉伯语精细调优的大型语言模型,旨在提供比通用多语言模型更精准的理解、生成和推理能力。它定位为领先的阿拉伯语专用 LLM,针对方言、古典形式和现代标准阿拉伯语进行优化。 该模型可用于内容创作、摘要、翻译、客户支持以及阿拉伯语市场的对话式 AI。通过将训练重点放在阿拉伯语数据上,Pronoia 关注形态学、点符号和文化语境等细微差异,而更通用的模型往往对此处理不一致。
标准细分
- 针对阿拉伯语优化的语言模型
- 文本生成与摘要
- 翻译支持
- 会话与聊天机器人功能
- 适用于企业级阿拉伯语 NLP
- 覆盖现代标准阿拉伯语与方言







