历史对决 · 2025-12-12 UTC
Agent Development 对决 — 2025年12月12日
来自Agent Development类别。 39个标记分布在9个参赛者中。 Flowwise AI夺得桂冠。
最终排名
阵容
参赛工具
参加这场对决的每个工具的简介,按最终得分排序。


Flowise AI 是一个开源低代码平台,允许开发者和团队通过可视化节点式界面设计 LLM 驱动的应用程序。用户无需编写大量样板代码,只需在画布上将模型、提示、记忆、向量存储和工具等组件连接起来,即可组装聊天机器人、代理和检索管道。 基于流行的框架如 LangChain 与 LlamaIndex 构建,Flowise 支持多种 LLM 提供商、嵌入式模型及数据源。完成的流程可部署为 API 或嵌入式小部件,既适合内部工具的快速原型开发,也能用于生产级功能的交付。 因为项目支持自托管并且由社区驱动,它吸引那些希望在不受专有服务束缚的情况下,对其 AI 栈拥有灵活性、透明度和控制权的团队。
标准细分
- 基于节点的可视化编辑器,用于 LLM 工作流
- 支持 LangChain 和 LlamaIndex 组件
- 内置代理、记忆和工具集成
- 向量数据库和嵌入的连接器
- API 端点和聊天小部件部署
- 自定义凭证和多模型支持


Pdf Redaction 是一款 AI 辅助工具,旨在帮助用户识别并永久删除 PDF 文件中的机密或敏感数据。它自动检测需要在外部共享文档前隐藏的个人信息、财务细节及其他私人内容。 通过将机器学习与传统的脱敏工作流相结合,该工具旨在减少在审核冗长文件时所需的人工投入。它适用于法律专业人士、医疗保健提供者、政府机构以及经常处理敏感文件并需要遵守隐私法规的企业。 用户可以上传 PDF,让 AI 扫描敏感内容,审核建议的删除项,并导出已清理的文档,准备分发。
标准细分
- 基于 AI 的敏感数据检测
- 文字内容永久的纠改
- PDF 文件批量处理
- 审阅和准许流程
- 支持个人和财务数据模式
- 安全的文档管理


IsMyStoreReady 是一款为 Shopify 与 WooCommerce 店主设计的自动化审核工具,帮助他们快速检查线上商店的健康状况。通过扫描店铺公开页面,它会发现可能影响转化率、SEO、信任度及整体流量准备度的常见问题。 该工具生成一份结构化报告,涵盖产品页面质量、店铺政策、性能信号以及信任要素等必备信息。它为创始人和小型电子商务团队提供了一个清晰、优先级明确的起点,无需雇佣顾问或执行多次单独审核。 它面向独立卖家、直运商以及正在成长的 DTC 品牌,帮助他们在投放广告或扩大营销投入之前快速获得第二意见。
标准细分
- 一键店铺审计
- Shopify 和 WooCommerce 支持
- 转化和信任检查
- SEO 和性能信号检视
- 优先排序问题报告
- 可执行的改善建议


LangChain Agent 是更广泛的 LangChain 框架的一部分,旨在帮助开发者构建语言模型可以推理、做出决策并与外部工具交互的应用程序。Agent 使用 LLM 作为推理引擎来确定要采取的动作、执行顺序,以及如何利用结果来指导后续步骤。 该框架提供了模块化组件,用于链式提示、集成数据源、管理记忆以及连接 API、数据库和搜索工具。这使其非常适合构建聊天机器人、研究助手、工作流自动化以及其他动态 LLM 驱动的系统。 LangChain 支持多种模型提供商和编程语言(Python 与 JavaScript/TypeScript),因此它是原型与生产部署的灵活基础。
标准细分
- 使用LLM建构代理
- 提示和链式组合
- 内存和状态管理
- 支持矢量存储和API的集成
- 支持多个LLM供应商
- 支持流式和异步执行

LangSmith 是由 LangChain 团队打造的开发者平台,帮助团队追踪、测试、评估和监控由大型语言模型驱动的应用。虽然它与 LangChain 和 LangGraph 框架紧密集成,但它是框架无关的,可通过 SDK 和 API 为任何 LLM 应用提供监控。其核心目标是解决 LLM 系统固有的不确定性,输出非确定性且故障细微,通过让开发者能在运行时可视化其链、代理和提示的实际行为。 该平台以追踪为核心:每次应用运行都会产生一份详细的嵌套追踪,展示每一步骤,包括发送的提示、模型响应、token 使用量、延迟、工具调用以及中间输出。这样更容易调试复杂的多步骤代理和检索增强生成管道,因为错误答案的根源可能被埋藏在多层深处。开发者可以检查单个追踪、过滤和搜索不同运行,并深入到每个节点的确切输入和输出。 LangSmith 还提供评估工具,用于衡量应用程序质量。团队可以从生产跟踪或精选示例中构建数据集,使用这些数据集运行他们的应用程序,并通过内置评估器、基于自定义代码的检查或 LLM-as-judge 方法对输出进行评分。这支持在提示或模型更改时进行回归测试,并帮助量化更改是否真正提升结果,而不只是依赖直觉。 在生产使用中,它提供监控仪表盘,跟踪诸如延迟、成本、错误率及随时间变化的反馈等指标,并具备收集人工反馈和用户注释的能力。提示管理和 Playground 组件让团队可以对提示进行迭代和版本化,并能并排比较模型输出。 LangSmith 主要面向正在开发和交付 LLM 功能的开发者和团队,他们需要从临时的打印语句调试转向系统化的可观测性和评估。其主要优势在于与 LangChain 生态系统的深度集成以及将追踪、数据集和评估统一在工作流中的能力。真实的权衡包括:最丰富的体验假设你熟悉 LangChain/LangGraph 世界;LLM 基础的评估本身并不完美,需要精心设计;以及它是一个托管的商业产品,按使用量计费,虽然部分方案也提供自托管选项。它与其他 LLM 可观测性工具竞争,如 Langfuse、Helicone、Arize Phoenix 和 Weights & Biases Weave。
标准细分
- 逐步追踪输入、输出和 token 使用
- 创建数据集和自动化评估
- 内置、基于代码以及 LLM 作为评判者的评估
- 生产监控仪表板
- 人工反馈和注释收集
- 提示管理、版本管理和 playground

Coval 是一个面向构建对话式 AI 代理的团队的测试与评估平台,尤其适用于同时支持语音和聊天的场景。它解决了代理开发中的一个常见难题:传统的单元测试和人工抽查难以捕捉代理系统的非确定性、多轮交互特性,导致难以判断一次改动是提升还是退化了真实环境中的行为。 平台核心理念是仿真。Coval 不仅依赖静态测试用例,而是生成模拟用户交互,覆盖大量情景和对话路径。这些仿真运行可依据预定义的指标和期望进行打分,使团队能够在发布前衡量可靠性,并在代理和提示词演进时捕捉回归。 Coval 同时支持语音和文本代理,这一点尤为重要,因为语音引入了语音转文本、延迟、轮次控制等额外层面,影响代理质量超出底层语言模型本身。公司常被拿来与自动驾驶团队利用大规模仿真验证行为的方式类比,将相似的测试哲学应用于 AI 代理。 典型工作流是:团队接入自己的代理,定义情景和评估标准,运行仿真,并在多次运行中审阅结果,追踪性能随时间的变化。这既适用于开发阶段,也适用于作为 CI 式流程的一部分进行持续监控和回归测试。 作为一个仍在快速演进的年轻产品,价格、集成方式和具体指标覆盖范围需直接向供应商确认,团队还需评估其仿真情景与实际生产流量的匹配度。相较于通用的 LLM 评估工具,Coval 的核心差异在于强调多轮、多模态的代理仿真,而非单一提示的打分。
标准细分
- 用于测试代理的模拟用户交互
- 跨运行的评估指标与评分
- 支持语音和文本代理
- 跨代理版本的回归检测
- 基于情景的对话路径测试

Stagehand 是一个网页浏览框架,帮助开发者构建能够在网站上导航、交互并提取数据的 AI 代理。它将确定性的 Playwright 样式代码与自然语言指令相结合,既能在需要时提供细粒度控制,也能在不需要时提供高级抽象。 框架围绕一个小型、可预测的 API 设计,专注于观察页面、操作元素以及提取结构化数据等动作。其可扩展架构支持自定义模型、缓存以及集成到更广泛的 agent stacks,使其既适用于快速爬取脚本,也适用于生产级浏览 workflows。
标准细分
- 自然语言动作、观察和提取方法
- 带有模式的结构化数据提取
- 低级控制兼容Playwright
- 支持多个 LLM 提供商
- 缓存,适用于可重复的浏览器行动
- 可组合的代理框架


Vertex AI Agent Builder 现已成为 Google Cloud 中 Gemini Enterprise Agent Platform 的一部分,是面向开发者的综合平台,用于构建、扩展、治理和优化企业级生成式 AI 代理。它帮助技术团队将企业应用和工作流转化为强大的代理系统。该平台提供数据与 AI 的统一环境,借助 Gemini 等工具能够快速开发生成式 AI 应用。用户还能在同一平台上对机器学习模型进行训练、测试和调优。 该平台提供开放且完整的环境,使企业能够基于自身数据快速构建、扩展、治理和优化企业级代理。平台提供全栈基础设施和丰富的开发者选择,将应用和工作流转化为全球规模的强大代理系统。 关键特性包括:能够从 200 多种 Google 及第三方 AI 模型和工具中进行选择、为特定用例定制模型,并使用模型评估服务对生成式 AI 模型进行客观评估。平台还支持通过如 Google Antigravity 等工具进行 agent 驱动的开发和工作流,该工具可实现对 agent 的集中管理与编排。 Gemini Enterprise Agent Platform 面向数据科学家和机器学习工程师设计,提供用于模型训练、调优和部署的工具,并提供 MLOps 功能,以实现机器学习项目的自动化、标准化和管理。平台提供一系列模块化工具,支持跨团队协作,并在整个开发生命周期中持续提升模型。 总体而言,Gemini Enterprise Agent Platform 中的 Vertex AI Agent Builder 能够为企业应用创建和部署复杂的 AI 代理,提供一系列工具和功能,以支持这些代理的开发、扩展、治理和优化。
标准细分
- 构建、扩展、管理和优化企业级 AI 代理
- 统一的数据和 AI 以加速代理开发
- Gemina Training 用于构建生成式 AI 应用
- Gemini 企业应用程序用于安全的注册、管理和对代理的管治
- Google Antigravity 用于代理驱动的开发和工作流
- 200+ 个 Google 第三方 AI 模型和工具

Botpress 是一个用于创建由大型语言模型驱动的对话式 AI 代理的开发平台。它提供可视化流程构建器、SDK,以及与流行消息渠道的集成,让团队设计能够进行自然对话、调用 API、执行多步骤任务的代理。 该平台将低代码工具与更深度的自定义选项相结合,使非技术用户和开发者能够在同一项目中协作。知识库、分析以及人工转接等功能,使其适用于客户支持、潜在客户获取和内部自动化等生产环境使用场景。 Botpress 提供免费层供实验使用,付费计划随使用量扩展,并有开源社区版供自行托管部署。
标准细分
- 拖拽式对话流程编辑器
- 具备工具使用能力的 LLM 驱动代理
- 从文档和 URL 导入知识库
- 多渠道部署(网页、WhatsApp、Slack 等)
- 分析与对话监控
- 人工转接与团队协作












