历史对决 · 2025-01-11 UTC
AI Agent Development Frameworks 对决 — 2025年1月11日
来自AI Agent Development Frameworks类别。 38个标记分布在10个参赛者中。 Mastra夺得桂冠。
最终排名
阵容
参赛工具
参加这场对决的每个工具的简介,按最终得分排序。

Mastra 是一个开源 TypeScript 框架,专门用于构建 AI 驱动的应用和智能体。它为开发者提供了一整套从概念到实现的工具,包括智能体、工作流、记忆、工作空间和可观测性。Mastra 与多种前后端框架无缝集成,并可作为独立服务器部署。它让开发者能够打造多种能力,例如内部自动化智能体、面向客户的智能体等。Mastra 还内置可观测性、可重复检查以及可缓存的可恢复流等功能,专为快速扩张的初创公司和大型全球组织而设计。 Mastra 的架构以代理(agents)为中心,代理可通过指令、模型、工具和运行时行为进行定义。代理能够与用户交互、完成任务,并将工作交付给产品流程。该框架还包含一个内置的事件系统,用于事件管理,并支持通过 Redis Streams 与 Google Cloud Pub/Sub 进行事件的发布与订阅。 Mastra 拥有丰富的资源生态系统,包括书籍、博客和指南。它拥有庞大的用户社区,并被各个行业广泛采用。
标准细分
- 代理
- 工作流
- 内存
- 工作区
- 可观测性
- 内置事件系统

AI Legion 是一个开源平台,用于创建协作完成任务的自治 AI 代理。它使用大语言模型(如 GPT-3.5-turbo 和 GPT-4),使代理能够协同工作并实现复杂目标。该平台提供了设置和管理这些代理的框架,包括配置文件、API 和工作流。AI Legion 设计为可扩展且可自定义,允许用户创建并集成自己的模型、动作和功能。该平台适用于多种用例,包括研究、开发和自治 AI 系统的部署。 设置 AI Legion 环境需要安装必要的依赖,包括 Node.js 和 OpenAI API keys。之后可以通过控制台启动并与代理交互。该平台还提供了代理状态管理功能,例如删除事件日志以及用自定义配置重启代理。 AI Legion 是一个强大的构建和部署自主 AI 系统的工具,其开源特性使其对广大用户更易获取。然而,使用它也需要相当高的技术专长和配置工作才能有效地搭建和使用。 AI Legion的一个主要优势是它能够让代理随时间学习和适应,采用机器学习与知识图谱技术的组合。这使得代理在与环境交互的过程中提升其表现和决策能力。 然而,AI Legion 也存在若干挑战与局限性,包括需要大量的配置和管理工作、代理错误与无限循环的风险,以及高 token 数量和 API 使用成本的潜在问题。此外,使用大型语言模型可能会引发关于偏见和准确性的担忧。 在具体功能方面,AI Legion 支持网页搜索、定制搜索引擎和 API,并具备管理代理状态以及使用自定义配置重启代理的能力。该平台高度可扩展,允许用户创建并集成自己的模型、动作和功能。 AI Legion 的一些潜在用例包括自主 AI 系统的研发、AI 驱动的工作流与流程部署,以及定制 AI 驱动工具与应用的创建。 总体而言,AI Legion 是一个强大且可扩展的平台,用于构建和部署自主 AI 系统,但它需要相当的技术专业知识和配置工作才能有效使用。
标准细分
- 网页搜索
- 自定义搜索引擎
- 用于集成的 API 和 webhook
- 代理状态管理
- 自定义模型与动作创建
- 知识图谱与机器学习能力


AutoML-Agent 是一个开源框架,利用协同工作的大语言模型(LLM)代理来处理完整的机器学习生命周期。它不依赖单一模型或脚本,而是将数据理解、预处理、模型选择、训练和评估等任务分配给专门的代理,协作完成共同目标。 该框架面向希望在无需编写大量流水线代码的情况下实现实验自动化的研究者和开发者。只需用自然语言描述数据集和目标,用户即可让代理提出、构建并迭代候选方案,并在整个过程中展示结果和推理过程。 由于是开源项目,AutoML-Agent 可以通过自定义代理、工具或模型后端进行扩展,既可作为实用的 AutoML 系统,也可作为多代理工作流的研究测试平台。
标准细分
- 多代理 LLM 协调
- 自动化数据预处理与特征处理
- 模型选择与超参数搜索
- 训练与评估流水线生成
- 自然语言任务规范
- 可扩展的自定义代理架构


Cerebrum 是一个用于在 AIOS(AI Agent Operating System)框架中开发和部署基于 LLM 的 AI 代理的 SDK。AIOS 解决了 LLM 代理的调度、上下文切换、内存管理和工具管理等挑战。Cerebrum SDK 通过与 AIOS 内核交互,使开发者能够构建并运行代理应用。它支持 Web UI 和 Terminal UI。SDK 包含列出可用 LLM、代理和工具,以及下载、上传和运行代理和工具的功能。Cerebrum 面向代理用户和开发者,帮助他们创建和部署 AI 代理应用。
标准细分
- 代理开发与部署
- 基于 LLM 的 AI 代理管理
- 支持 Web UI 和 Terminal UI
- 代理和工具管理
- 列出可用的 LLM、代理和工具
- 下载和上传代理及工具

Gemma 3 是一系列轻量级、最前沿的开源模型,专为在设备上运行而设计,尤其针对单 GPU 性能进行了优化。它支持多模态输入,并覆盖 140 多种语言。该模型提供多种尺寸(1B、4B、12B 和 27B),开发者可根据硬件与性能需求选择最合适的版本。Gemma 3 拥有先进的文本与视觉推理能力、128k‑token 的上下文窗口,以及用于复杂任务的 function calling。它还提供量化版本,可提升运行速度并降低计算资源需求。此模型是 Google 致力于普及有用 AI 技术的一部分,并基于与 Gemini 2.0 相同的研究与技术。Gemma 3 旨在帮助开发者构建可直接在手机、笔记本电脑和工作站等设备上运行的 AI 应用。 Gemma 3 以其体积实现了最先进的性能,在初步的人类偏好评估中超越了 Llama3-405B、DeepSeek-V3 和 o3-mini 等其他模型。它支持全球化应用,开箱即用支持超过35种语言,并且预训练支持超过140种语言。该模型支持使用函数调用和结构化输出,帮助创建 AI 驱动的工作流。 Gemma 3 的开发采用了严格的安全协议,例如广泛的数据治理、通过微调与安全政策的对齐以及稳健的基准评估。 Gemma 系列开放模型已获得显著采纳,下载量超过1亿次,活跃社区已创建超过60,000个 Gemma 变体。 Gemma 3 的能力使其适用于希望在单一 GPU 或 TPU 主机上打造引人入胜的用户体验的开发者。
标准细分
- 多模态AI支持
- 关注责任的开发
- 广泛的微调
- 支持140种语言
- 提高性能


MiniMax-M1 是一个开源加权、大规模的混合注意力推理模型。它采用混合 Mixture-of-Experts(MoE)架构与闪电级注意力机制相结合,支持高效扩展推理时计算量。该模型原生支持 100 万 token 的上下文长度,并使用大规模强化学习(RL)在多样化任务上进行训练。它在复杂软件工程、工具使用以及长上下文任务上表现优于其他强大的开源加权模型。 在标准基准测试中,MiniMax-M1 在数学、编码、软件工程、代理工具使用以及长文本理解等领域的任务上,表现优于其他模型。 该模型特别适合需要处理长输入并进行深入思考的复杂任务。 MiniMax-M1 作为下一代语言模型代理的坚实基础,支持其推理并应对现实世界的挑战。 领先商业模型与开源加权模型在不同类别任务中的基准性能比较凸显了该模型的表现。 技术报告提供了关于模型架构、训练协议和评估结果的更多信息。
标准细分
- Hybrid Mixture-of-Experts (MoE)架构
- 闪电式注意力机制
- 强化学习(RL)尺寸框架
- 1,000,000 个令牌的上下文长度
- 测试时间计算的有效扩展


ScreenAgent 是一个开源的视觉语言模型(VLM)代理,旨在通过鼠标和键盘操作控制计算机GUI。它启用了与实时计算机屏幕的交互,通过观察截图并执行操作。该项目包括了规划-执行-反思的流程,指导代理完成多步任务。它是为了解决教会代理使用计算机的挑战而创建的,需要能力如任务规划、图像理解和可视定位。 ScreenAgent 数据集,这个涵盖了各种每日计算机任务的数据集,是手动注释的,以支持代理的学习。 项目由用于控制桌面、数据集、模型工人进行推理、以及培训代码组成。 它支持基础鼠标和键盘操作,并且可以应用于不同的桌面操作系统和应用。 ScreenAgent 的方法是通用的,并且不依赖具体的 API,使其具有多样性。
标准细分
- 鼠标和键盘操作执行
- 规划-执行-反思流程完成任务
- 支持多种桌面操作系统和应用
- 手动注释ScreenAgent数据集支持多种任务
- VLM代理用于GUI交互


BabyBeeAGI 是一个用于构建自我构建的自主代理的实验性框架。它是 2023 年 3 月原始 BabyAGI 的演进版本,引入了自主代理的任务规划。该框架围绕一个新的函数框架 'functionz' 构建,该框架存储、管理和执行数据库中的函数。它具有基于图的导入、依赖函数和身份验证机密跟踪结构,以及自动加载和全面的日志记录功能。该框架还包括一个用于管理功能、运行更新和查看日志的仪表板。它的设计简单,旨在激发开发人员的讨论,而不是用于生产环境。核心思想是构建可以自我构建的最简单事物,使其成为开发自主代理的一个有趣的方法。
标准细分
- 功能注册和元数据管理
- 依赖跟踪和关键依赖
- 自动加载和日志记录
- 用于功能管理和日志查看的仪表板

mcp-use 是一个开源平台,方便将大型语言模型(LLM)与 MCP 服务器连接,并支持开发能够与这些 LLM 交互的自定义 AI 代理。该平台提供完整的 MCP 框架(mcp-use SDK),用于构建 ChatGPT Apps、Claude Connectors 和 MCP Servers。 借助mcp-use,开发者可以使用单一代码基准在用户和代理已经使用的多种平台上部署应用程序,包括ChatGPT、Claude和Gemini。该平台提供一系列工具和功能,例如在一次命令下生成MCP应用、自动部署到Manufact Cloud,以及内置的分析与可观测性。 开发者可以使用 mcp-use SDK 构建和部署 MCP 服务器和应用程序,而无需额外工具。该平台还提供 Visual Inspector 和 Sandbox 测试功能,允许开发者在不需要真实 LLM 的情况下测试其应用程序。 mcp-use 旨在简化基于 MCP 的应用程序的开发与部署,使其成为寻求构建和部署自定义 AI 代理和应用程序的开发者的一个有吸引力的选择。
标准细分
- "MCP服务器管理"
- "LLM连接和集成"
- "自定义AI代理开发"
- "自动部署和伸缩性"
- "可视化调试工具和Sandbox测试"
- "内置分析和可观察性"

Rasa 是一个对话式 AI 平台,帮助开发者构建具备上下文感知的聊天和语音助手,并完全掌控数据、模型与部署。其开源核心负责自然语言理解与对话管理,而 Rasa Pro 则提供企业级功能,如分析、权限控制与可扩展基础设施。 Rasa Studio 提供一个低代码界面,供设计师和对话团队在不编写代码的情况下协作处理训练数据、流程和测试。通过这些工具,混合团队能够在消息渠道、IVR 系统和自定义应用中部署助手。 它在银行、通信、医疗和政府等行业的企业中被广泛使用,因为这些企业需要本地部署、合规和定制化。
标准细分
- 自然语言理解引擎
- 自定义动作的对话管理
- Rasa Studio 低代码接口
- 语音和多渠道集成
- 会话分析和测试工具
- 企业级安全和部署控制














