最终排名
阵容
参赛工具
参加这场对决的每个工具的简介,按最终得分排序。


DeepSeek R1 是一款开源大型语言模型,擅长推理、数学和编码任务。它采用 Mixture of Experts(MoE)架构,拥有 37 B 激活参数和 671 B 总参数,支持 128 K 上下文长度。模型融合了先进的强化学习技术,实现了自我验证、多步反思和人类对齐的推理能力。DeepSeek R1 在多项基准测试中取得了领先成绩,包括在 MATH‑500 上达到 97.3% 的准确率、在 AIME 2024 上获得 79.8% 的及格率,并超越了 96.3% 的 Codeforces 参赛者。模型提供从 1.5 B 到 70 B 参数的多个变体,采用 MIT 许可证,可免费使用和修改。DeepSeek R1 可在线免费使用,亦提供 WebGPU 加速版,可在本地浏览器中运行。 该模型面向复杂问题求解、多语言理解以及生产级代码生成。其优势在于卓越的数学推理、代码生成和自然语言理解能力。然而,作为开源模型,部署和针对特定场景的微调可能需要一定的技术专业度。 DeepSeek R1 在全球 AI 模型中位居前列,能力可与领先的专有解决方案相媲美。开源属性促成社区驱动的持续迭代,包括计划中的多模态支持、对话增强以及分布式推理优化。 模型采用纯强化学习开发,使其在显著降低成本的同时实现 GPT‑4 级别的数学性能。链式思考可视化能力解决了 AI “黑箱”难题,提供对模型推理过程的洞察。 DeepSeek R1 的 API 提供兼容 OpenAI 的端点,价格为每百万 token $0.14。模型权重开源,允许商业使用和修改。
标准细分
- Mixture of Experts(MoE)架构
- 先进的强化学习技术
- 自我验证和多步反思能力
- 人类对齐的推理
- 支持 128 K 上下文长度
- 兼容 OpenAI 的 API 端点


Pixtral 12B 24.09 是 Mistral AI 的一个多模态模型,能够在同一序列中同时处理图像和文本,并支持可变图像尺寸和纵横比。它使用 12 亿参数的语言解码器配合视觉编码器,支持视觉问答、文档理解、图表解析和图像字幕等任务。 该模型支持高达128K token 的上下文,允许在单个提示中将多张图像与长文本交替。以开放许可发布,它可以本地部署或通过推理提供商使用,适合构建视觉-语言应用、研究工作流和多模态代理的开发者。
标准细分
- 12万亲流得应六应
- 园片和文期五应手机
- 気中应服务。
- 发得列索彞五应的L
- 号凬应线路度服务
- 关附得线約应窄应的L


DeepSeek V3 是由 DeepSeek AI 开发的大规模 Mixture-of-Experts (MoE) 语言模型。它在每个 token 只激活全部参数的一小部分,使其在推理、数学和代码任务上表现出色,同时推理成本远低于同等的 dense 模型。 DeepSeek V3 以开源权重发布,已成为开发者和研究者的热门选择,能够自托管、微调或通过 API 集成。基准测试显示,它在数学和逻辑推理评估上与领先的专有模型如 GPT-4o 竞争力强。 该模型非常适合技术助理、代码生成流水线、研究工作流,以及任何对推理质量和预算效率都有要求的应用场景。
标准细分
- Mixture-of-Experts 架构
- 在推理和数学基准上具竞争力
- 开源模型权重
- 通过 DeepSeek 平台提供 API 访问
- 支持长上下文窗口
- 易于微调


