历史对决 · 2024-07-19 UTC
AI Agent Development Frameworks 对决 — 2024年7月19日
来自AI Agent Development Frameworks类别。 22个标记分布在7个参赛者中。 kagent夺得桂冠。
最终排名
阵容
参赛工具
参加这场对决的每个工具的简介,按最终得分排序。

Kagent 使 AI 代理能够自动化 Kubernetes 操作。它支持使用熟悉的 Kubernetes 工具来部署、观察和治理代理。 kagent 将代理(agents)提升为 Kubernetes 的一等工作负载,支持将其作为 Kubernetes 自定义资源定义(CRDs)进行版本管理,并可在拉取请求(pull request)中进行审阅。这种方式使得可以利用现有的 Kubernetes 工具来管理代理。 该框架为开源项目,由 Istio 的创始人构建。它支持多种语言和框架组合,包括 Go 和 Python,并允许使用任何大型语言模型(LLM)提供商。 kagent 提供了强大的安全与可观察性功能,包括 OpenTelemetry tracing、Prometheus metrics 以及 structured logs。它还支持多运行时、agent-to-agent 通信,以及从 Git repositories 加载知识的能力。 总体而言,kagent 为利用 AI 代理自动化 Kubernetes 操作提供了一个强大且灵活的框架。
标准细分
- 快速启动并高效资源使用的代理基础
- 零信任准备,mTLS 和细粒度 RBAC
- 长期内存的矢量背后的持久内存
- 人机循环工具批准门槛和代理触发问题
- 代理代理 (A2A) 委派,组合多代理工作流程
- 支持多时态运行环境


BabyCatAGI 是 BabyAGI 的简化、修改版,旨在通过自主 AI 代理处理复杂任务。它将高层目标拆解为可管理的子任务,顺序执行,并根据中间结果调整计划,适用于研究、内容生成和多步骤问题求解。 该框架强调最小化代码量和可读性,使想要在无需大型编排库负担的情况下尝试代理式 AI 的开发者易于上手。它可与语言模型和网页搜索工具集成,以获取上下文、推理问题并生成结构化输出。 作为一个开放的实验性项目,BabyCatAGI 最适合用于原型化代理工作流、学习任务驱动的自主系统如何运作,以及为特定自动化需求定制流水线。
标准细分
- 任务列表创建与优先级排序
- 自主子任务执行
- 网页搜索集成以获取上下文
- 顺序推理工作流
- 轻量级 Python 实现
- 可自定义目标和提示词

mcp-use 是一个开源平台,方便将大型语言模型(LLM)与 MCP 服务器连接,并支持开发能够与这些 LLM 交互的自定义 AI 代理。该平台提供完整的 MCP 框架(mcp-use SDK),用于构建 ChatGPT Apps、Claude Connectors 和 MCP Servers。 借助mcp-use,开发者可以使用单一代码基准在用户和代理已经使用的多种平台上部署应用程序,包括ChatGPT、Claude和Gemini。该平台提供一系列工具和功能,例如在一次命令下生成MCP应用、自动部署到Manufact Cloud,以及内置的分析与可观测性。 开发者可以使用 mcp-use SDK 构建和部署 MCP 服务器和应用程序,而无需额外工具。该平台还提供 Visual Inspector 和 Sandbox 测试功能,允许开发者在不需要真实 LLM 的情况下测试其应用程序。 mcp-use 旨在简化基于 MCP 的应用程序的开发与部署,使其成为寻求构建和部署自定义 AI 代理和应用程序的开发者的一个有吸引力的选择。
标准细分
- "MCP服务器管理"
- "LLM连接和集成"
- "自定义AI代理开发"
- "自动部署和伸缩性"
- "可视化调试工具和Sandbox测试"
- "内置分析和可观察性"


Claude MCP Agents 是利用 Anthropic 的 Model Context Protocol(MCP)与各种外部数据源、API 和开发者工具连接的 AI 代理。通过标准化 Claude 与外部系统之间的上下文流,这些代理能够读取文件、查询数据库、调用服务,并在实时信息上执行操作,而无需为每个来源单独进行定制集成。 该方案面向构建自动化、研究助理和工作流代理的开发者和团队,这些代理需要可靠访问企业或个人数据。MCP 的开放规范意味着同一代理可以随新工具的连接器出现而即插即用,降低锁定风险和集成开销。
标准细分
- Model Context Protocol 集成
- 可连接文件、API 和数据库
- 可通过自定义 MCP 服务器扩展
- 支持代理式多步骤工作流
- 兼容 Claude 系列模型
- 开放标准,确保互操作性

Gemma 3 是一系列轻量级、最前沿的开源模型,专为在设备上运行而设计,尤其针对单 GPU 性能进行了优化。它支持多模态输入,并覆盖 140 多种语言。该模型提供多种尺寸(1B、4B、12B 和 27B),开发者可根据硬件与性能需求选择最合适的版本。Gemma 3 拥有先进的文本与视觉推理能力、128k‑token 的上下文窗口,以及用于复杂任务的 function calling。它还提供量化版本,可提升运行速度并降低计算资源需求。此模型是 Google 致力于普及有用 AI 技术的一部分,并基于与 Gemini 2.0 相同的研究与技术。Gemma 3 旨在帮助开发者构建可直接在手机、笔记本电脑和工作站等设备上运行的 AI 应用。 Gemma 3 以其体积实现了最先进的性能,在初步的人类偏好评估中超越了 Llama3-405B、DeepSeek-V3 和 o3-mini 等其他模型。它支持全球化应用,开箱即用支持超过35种语言,并且预训练支持超过140种语言。该模型支持使用函数调用和结构化输出,帮助创建 AI 驱动的工作流。 Gemma 3 的开发采用了严格的安全协议,例如广泛的数据治理、通过微调与安全政策的对齐以及稳健的基准评估。 Gemma 系列开放模型已获得显著采纳,下载量超过1亿次,活跃社区已创建超过60,000个 Gemma 变体。 Gemma 3 的能力使其适用于希望在单一 GPU 或 TPU 主机上打造引人入胜的用户体验的开发者。
标准细分
- 多模态AI支持
- 关注责任的开发
- 广泛的微调
- 支持140种语言
- 提高性能


Agency Swarm 是一个基于 OpenAI Agents SDK 和 Responses API 的开源框架。它提供了结构化且可用于生产的环境,用于构建多代理应用。主要特性包括可定制的代理角色、能够支持不同的模型后端(例如 OpenAI 的 GPT 系列模型、Anthropic、Google 的 Gemini、Azure 的 OpenRouter,以及自行构建的 LiteLLM 工具),这些后端可通过 @function_tool 装饰器(推荐)或继承 BaseTool 对象来启用。Agency Swarm 架构的一大优势是它在 Python 和 Linux 环境下的稳定性。使用标准的 pip install agency-swarm 命令即可轻松安装。 该描述应阐明 Agency Swarm 是一个基于 OpenAI Agents SDK 和 Responses API 构建的开源工具。 Agency Swarm 是一个开源 AI 工具包,帮助开发者创建用于真实场景 AI 开发的多代理应用。 关键特性: - 自动生成的 CLI 工具:发现您应用的 REST API,轻松访问核心服务,提高生产力。 - 可定制的代理角色:您可以轻松为每个代理角色确定特定功能和权限级别,提升应用的可定制性。 - 全栈实现:Agency Swarm 是仅面向 Python 的全栈实现。如果您使用 Linux,可将其视为不受 Python 标准库限制的全栈实现。 优势: 1. 在 Python / Linux 环境中的稳定性 2. 与您的应用程序轻松集成 3. 可组合且易用的 CLI 工具 4. 自定义代理角色 缺点: 1. 语言模型兼容性限制(个人聊天机器人:GPT-3 等) N/A 2. 开发环境要求 N/A 3. 模型后端支持有限 N/A 4. 基础用户界面 N/A 5. 学习能力 N/A 6. 功能集成 N/A 7. 文档编写过程 N/A 8. 机器学习 AI 能力:N/A 9. 高级对话流管理 N/A 10. 多层应用 N/A 11. 同时执行 N/A 12. 访问应用状态 N/A 13. 自动部署 N/A 14. 高级任务执行 N/A 15. 自定义代理类型 N/A 16. 大型语言模型支持 N/A 17. 支持 Python ↻ N/A 18. 完全控制 N/A 19. 性能测量 N/A 20. 提供本地工作空间 N/A 21. 与 OpenALink 集成:用于 Python 应用的 Web 开发框架 22. 在项目中与 AI 代理协作 23. 可解释性 24. 监控 N/A 25. 完整源代码集成 N/A 26. 可扩展性 N/A 27. 性能低下 N/A 缺点:
标准细分
- 可定制的代理角色
- 对提示/指令的完全控制
- 开发用的类型安全工具
- 编排的代理通信
- 灵活的状态持久化
- 多代理编排


Databricks 代理框架 (AAF) 由 Databricks 提供,用于构建、部署和治理 AI 代理。这些代理可以通过单一受管协议 (模型上下文协议,MCP) 与任何工具、数据库或 SaaS 应用程序连接。框架包括在 Databricks 应用中无需管理基础设施的情况下,集成 AI 开发、实验和部署到服务器less 计算的功能。Agent Bricks 和 Unity Catalog 在治理和安全中至关重要,它们在模型、工具和连接上应用预定义的 정책,同时实施速率限制、失效、 fallbacks 和其他预防突发性数据注入、敏感数据检测和内容过滤所需的其他安全措施。
标准细分
- Agent Bricks
- Unity Catalog
- Databricks Apps
- Model Context Protocol (MCP)
- 集中化治理
- 用户级别控制









