历史对决 · 2025-04-24 UTC
Agent Development 对决 — 2025年4月24日
来自Agent Development类别。 32个标记分布在7个参赛者中。 DeepOpinion夺得桂冠。
最终排名
阵容
参赛工具
参加这场对决的每个工具的简介,按最终得分排序。


DeepOpinion 是一款面向企业的自动化平台,专为处理传统 RPA 工具难以应对的复杂且文档量大的知识工作而设计。它将大型语言模型与工作流工具结合,能够大规模处理电子邮件、合同、发票及支持工单等非结构化输入。 该平台面向需要可靠、可审计 AI 处理业务流程的金融、保险、客户服务和运营团队。它允许组织构建并部署能够读取、分类、提取并据此行动的 AI 代理,无需大量定制开发。 DeepOpinion 提供云端或本地部署选项,旨在适配受监管的企业环境,同时减少对重复认知任务的手工处理时间。
标准细分
- 用于文档和文本处理的 AI 代理
- 面向知识任务的工作流自动化
- 从非结构化来源提取数据
- 企业级安全性和部署选项
- 与现有业务系统的集成
- 人机协同审查控制

Letta AI 是一个开源平台,用于创建有状态的 AI 代理。这些代理配备了长期记忆和先进推理能力。该平台允许开发者构建 AI 代理,这些代理可以维护过去交互的记忆,从而支持更加复杂和上下文相关的决策过程。这对于需要代理根据经验而进行学习并根据此调整回应的问题特别有用。 Leta AI 目标开发者和研究人员,感兴趣在各种应用中创建复杂的人工智能代理,从客户服务到更加复杂的问题解决任务。通过提供长期记忆和先进推理,Leta AI 允许开发具有更高程度自主性和智力的有状态人工智能代理。
标准细分
- 有状态的人工智能代理
- 长期记忆
- 先进推理

Botpress 是一个用于创建由大型语言模型驱动的对话式 AI 代理的开发平台。它提供可视化流程构建器、SDK,以及与流行消息渠道的集成,让团队设计能够进行自然对话、调用 API、执行多步骤任务的代理。 该平台将低代码工具与更深度的自定义选项相结合,使非技术用户和开发者能够在同一项目中协作。知识库、分析以及人工转接等功能,使其适用于客户支持、潜在客户获取和内部自动化等生产环境使用场景。 Botpress 提供免费层供实验使用,付费计划随使用量扩展,并有开源社区版供自行托管部署。
标准细分
- 拖拽式对话流程编辑器
- 具备工具使用能力的 LLM 驱动代理
- 从文档和 URL 导入知识库
- 多渠道部署(网页、WhatsApp、Slack 等)
- 分析与对话监控
- 人工转接与团队协作

Gretel AI 是一个面向开发者的平台,能够生成与真实数据集在统计上相似的合成数据,同时不暴露敏感信息。团队在生产数据受隐私、合规或可用性限制时使用它,以解锁 AI 和分析项目。 该平台提供 APIs、SDKs 以及预构建模型,支持生成表格、文本和时序数据,并配备评估质量和隐私风险的工具。它可用于常见场景,如训练机器学习模型、增强欠代表类数据、跨团队共享数据以及使用逼真但人工合成记录进行软件测试。
标准细分
- 生成统计与真实数据一致的合成表格和文本数据的生成模型
- 对区分信息和 PII 的遮蔽和脱敏控制
- 质量、准确性和隐私评分报告
- Python SDK 和 REST API 集成
- 预训练模型和可自定义模板
- 基于云和自托管的部署选项
NetX 是一个模块化的经济网络,旨在将区块链与 AI 技术整合在统一框架中。其架构支持开发者和组织插入去中心化交易、数据交换和 AI 驱动服务等组件,覆盖数字经济的多种使用场景。 该平台旨在将传统区块链功能与机器学习工作流相结合,使代币化激励、智能合约自动化和 AI 驱动的分析能够在同一生态系统中运行。这使其适用于需要智能处理或数据驱动决策的 Web3 开发团队。 通过强调模块化,NetX 旨在为开发者提供灵活性,让他们在组装技术栈时能够根据项目需求自由选择区块链、AI 和经济原语。
标准细分
- 模組化网络组件
- 区块链对接层
- 人工智能服务兼容
- 智能合约支持
- tokenized经济基本原理
- 开发者重点工具


Snorkel Flow 是一个企业级的数据开发平台,支持团队使用标注函数来标注、整理和改进训练数据,而不必完全依赖人工标注。通过将领域专业知识编码为可重用的启发式规则,它加速了从原始数据到生产级 AI 模型的路径。 该平台将弱监督、模型训练和错误分析集成在同一工作流中,帮助数据科学家和领域专家协同迭代数据集与模型。它支持多种用例,包括文档分类、信息抽取,以及为企业应用微调基础模型。
标准细分
- 程序化标注
- 弱监督和标签聚合
- 内置模型训练和评估
- 错误分析和数据切片工具
- 基础模型微调支持
- SME 与数据科学家之间的协作工具

LangSmith 是由 LangChain 团队打造的开发者平台,帮助团队追踪、测试、评估和监控由大型语言模型驱动的应用。虽然它与 LangChain 和 LangGraph 框架紧密集成,但它是框架无关的,可通过 SDK 和 API 为任何 LLM 应用提供监控。其核心目标是解决 LLM 系统固有的不确定性,输出非确定性且故障细微,通过让开发者能在运行时可视化其链、代理和提示的实际行为。 该平台以追踪为核心:每次应用运行都会产生一份详细的嵌套追踪,展示每一步骤,包括发送的提示、模型响应、token 使用量、延迟、工具调用以及中间输出。这样更容易调试复杂的多步骤代理和检索增强生成管道,因为错误答案的根源可能被埋藏在多层深处。开发者可以检查单个追踪、过滤和搜索不同运行,并深入到每个节点的确切输入和输出。 LangSmith 还提供评估工具,用于衡量应用程序质量。团队可以从生产跟踪或精选示例中构建数据集,使用这些数据集运行他们的应用程序,并通过内置评估器、基于自定义代码的检查或 LLM-as-judge 方法对输出进行评分。这支持在提示或模型更改时进行回归测试,并帮助量化更改是否真正提升结果,而不只是依赖直觉。 在生产使用中,它提供监控仪表盘,跟踪诸如延迟、成本、错误率及随时间变化的反馈等指标,并具备收集人工反馈和用户注释的能力。提示管理和 Playground 组件让团队可以对提示进行迭代和版本化,并能并排比较模型输出。 LangSmith 主要面向正在开发和交付 LLM 功能的开发者和团队,他们需要从临时的打印语句调试转向系统化的可观测性和评估。其主要优势在于与 LangChain 生态系统的深度集成以及将追踪、数据集和评估统一在工作流中的能力。真实的权衡包括:最丰富的体验假设你熟悉 LangChain/LangGraph 世界;LLM 基础的评估本身并不完美,需要精心设计;以及它是一个托管的商业产品,按使用量计费,虽然部分方案也提供自托管选项。它与其他 LLM 可观测性工具竞争,如 Langfuse、Helicone、Arize Phoenix 和 Weights & Biases Weave。
标准细分
- 逐步追踪输入、输出和 token 使用
- 创建数据集和自动化评估
- 内置、基于代码以及 LLM 作为评判者的评估
- 生产监控仪表板
- 人工反馈和注释收集
- 提示管理、版本管理和 playground











