历史对决 · 2025-08-08 UTC

LLM 对决 — 2025年8月8日

来自LLM类别。 28个标记分布在6个参赛者中。 DeepSeek V3夺得桂冠。

最终排名

阵容

参赛工具

参加这场对决的每个工具的简介,按最终得分排序。

1DeepSeek V3 logo

DeepSeek V3

开源的 Mixture-of-Experts 模型,提供相当于 GPT-4o 水平的推理能力,且成本仅为其一小部分。

4.8 (6)
免费
DeepSeek V3的截图

DeepSeek V3 是由 DeepSeek AI 开发的大规模 Mixture-of-Experts (MoE) 语言模型。它在每个 token 只激活全部参数的一小部分,使其在推理、数学和代码任务上表现出色,同时推理成本远低于同等的 dense 模型。 DeepSeek V3 以开源权重发布,已成为开发者和研究者的热门选择,能够自托管、微调或通过 API 集成。基准测试显示,它在数学和逻辑推理评估上与领先的专有模型如 GPT-4o 竞争力强。 该模型非常适合技术助理、代码生成流水线、研究工作流,以及任何对推理质量和预算效率都有要求的应用场景。

标准细分

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Mixture-of-Experts 架构
  • 在推理和数学基准上具竞争力
  • 开源模型权重
  • 通过 DeepSeek 平台提供 API 访问
  • 支持长上下文窗口
  • 易于微调
2Janus pro logo

Janus pro

深度寻找者开源多模态模型,集成图像生成和视觉理解在一个统一的架构。

4.8 (4)
免费
Janus pro的截图

Janus Pro 是 DeepSeek 开源的多模态 AI 模型,提供 1B 和 7B 参数版本。它通过解耦视觉编码路径,在同一框架内统一视觉理解与图像生成,使模型既能解析图像,又能根据文字提示生成图像。 7B 变体在文本到图像合成和视觉问答基准测试中表现具有竞争力,往往可与更大、更专业的模型相匹配或超越。以 MIT 许可证发布的 Janus Pro 可自托管、微调,并在研究或生产流水线中无使用限制地集成。 它适用于开发者、研究人员和爱好者,满足他们在实验、原型设计或构建结合图像生成与图像理解的应用时对灵活多模态基础模型的需求。

标准细分

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • 图像生成
  • 视觉问答和图像分析
  • 统一转换器架构
  • 1 亿和 7 亿参数选项
  • MIT 许可证公开权重
  • 多模态输入和输出支持
3DeepSeek R1 logo

DeepSeek R1

一款开源大型语言模型,擅长推理、数学和编码任务,采用 MIT 许可证,可免费使用和修改。

4.8 (4)
免费
DeepSeek R1的截图

DeepSeek R1 是一款开源大型语言模型,擅长推理、数学和编码任务。它采用 Mixture of Experts(MoE)架构,拥有 37 B 激活参数和 671 B 总参数,支持 128 K 上下文长度。模型融合了先进的强化学习技术,实现了自我验证、多步反思和人类对齐的推理能力。DeepSeek R1 在多项基准测试中取得了领先成绩,包括在 MATH‑500 上达到 97.3% 的准确率、在 AIME 2024 上获得 79.8% 的及格率,并超越了 96.3% 的 Codeforces 参赛者。模型提供从 1.5 B 到 70 B 参数的多个变体,采用 MIT 许可证,可免费使用和修改。DeepSeek R1 可在线免费使用,亦提供 WebGPU 加速版,可在本地浏览器中运行。 该模型面向复杂问题求解、多语言理解以及生产级代码生成。其优势在于卓越的数学推理、代码生成和自然语言理解能力。然而,作为开源模型,部署和针对特定场景的微调可能需要一定的技术专业度。 DeepSeek R1 在全球 AI 模型中位居前列,能力可与领先的专有解决方案相媲美。开源属性促成社区驱动的持续迭代,包括计划中的多模态支持、对话增强以及分布式推理优化。 模型采用纯强化学习开发,使其在显著降低成本的同时实现 GPT‑4 级别的数学性能。链式思考可视化能力解决了 AI “黑箱”难题,提供对模型推理过程的洞察。 DeepSeek R1 的 API 提供兼容 OpenAI 的端点,价格为每百万 token $0.14。模型权重开源,允许商业使用和修改。

标准细分

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability0
  • Mixture of Experts(MoE)架构
  • 先进的强化学习技术
  • 自我验证和多步反思能力
  • 人类对齐的推理
  • 支持 128 K 上下文长度
  • 兼容 OpenAI 的 API 端点
4ASI:One logo

ASI:One

具备代理智能的 AI 助手,能够协同自主代理完成多步骤任务。

4.5 (4)
免费
ASI:One的截图

ASI:One 是一款围绕代理智能概念构建的 AI 助手,其对话界面可以派遣并协调专用的自主代理,以处理复杂请求。它不仅仅返回文本,还能进行计划、调用工具并代表用户执行工作流。 该产品在 Artificial Superintelligence Alliance 生态体系中开发,定位为个人 AI 代理,能够与去中心化的代理网络集成。用户既可以通过聊天获取日常问题的答案,也可以委托更长的任务,如调研、对比、排程以及跨连接服务的数据查询。

标准细分

Ease of use0
Value for money0
Features & power1
Integrations1
Support & docs1
Reliability1
  • 对话聊天界面
  • 自主代理编排
  • 多步骤任务规划与执行
  • 与外部代理和服务的连接
  • 个人助理式记忆与上下文
  • 基于 ASI Alliance 代理栈构建
5Latest DeepSeek R2 logo

Latest DeepSeek R2

下一代深度寻求的推理聚焦的 AI 模型

4.8 (6)
免费
Latest DeepSeek R2的截图

最新的 DeepSeek R2 是 DeepSeek R1 推理模型的继任者,旨在为数学、编码和分析任务提供更强大的逐步问题解决能力。它旨在延续以往 DeepSeek 发布的开放研究方式,继续受到开发者和研究人员的欢迎。 该模型相较前代,旨在提高准确率、支持更长的上下文处理以及更高效的推理,使其适用于技术助手、代理工作流及集成到自定义应用中。其可用性及具体规格取决于 DeepSeek 官方发布渠道。 用户通常可以通过 API、聊天界面或在可用时运行开源权重来访问该模型,从而为个人实验和生产部署提供灵活性。

标准细分

Ease of use1
Value for money1
Features & power1
Integrations0
Support & docs0
Reliability1
  • 进化式推理链
  • 扩展上下文窗口
  • 代码生成和调试支持
  • 多语种理解
  • API 和聊天式访问
  • 适用于主体应用
6Pronoia logo

Pronoia

专为阿拉伯语优化的大规模语言模型,打造原生语感和生成质量。

4.7 (6)
免费

Pronoia 是一款专为阿拉伯语精细调优的大型语言模型,旨在提供比通用多语言模型更精准的理解、生成和推理能力。它定位为领先的阿拉伯语专用 LLM,针对方言、古典形式和现代标准阿拉伯语进行优化。 该模型可用于内容创作、摘要、翻译、客户支持以及阿拉伯语市场的对话式 AI。通过将训练重点放在阿拉伯语数据上,Pronoia 关注形态学、点符号和文化语境等细微差异,而更通用的模型往往对此处理不一致。

标准细分

Ease of use1
Value for money0
Features & power1
Integrations1
Support & docs0
Reliability0
  • 针对阿拉伯语优化的语言模型
  • 文本生成与摘要
  • 翻译支持
  • 会话与聊天机器人功能
  • 适用于企业级阿拉伯语 NLP
  • 覆盖现代标准阿拉伯语与方言