历史对决 · 2024-01-11 UTC
Observability 对决 — 2024年1月11日
来自Observability类别。 40个标记分布在10个参赛者中。 Quotient AI夺得桂冠。
最终排名
阵容
参赛工具
参加这场对决的每个工具的简介,按最终得分排序。

Quotient AI 是一个面向部署 AI 功能团队的可观测性与评估平台。它持续监控生产中的 AI 系统,包括搜索、检索增强生成(RAG)以及自治代理,以在最终用户遇到之前揭示幻觉、检索错误和其他质量问题。 该平台将自动化评估与实时警报相结合,帮助工程和机器学习团队诊断根本原因,跟踪模型或提示更改导致的回归,并在大规模运维中保持可靠性。通过对 AI 流水线进行监控,Quotient 让开发者能够直观了解其应用在真实环境中的实际表现,而不只是依赖离线基准。
标准细分
- 实时 AI 监控和 alerting
- 幻觉和检索错误检测
- RAG 管道评估工具
- 代理行为跟踪和诊断
- 模型或提示更改下的回归分析
- AI 应用程序的生产观察性

W&B Weave 是一个可观察性和评估平台,帮助跟踪和改进大型语言模型(LLM)应用程序。Weave 提供了跟踪、收集指标以及使用 LLM 评估器和自定义评分器评估应用程序响应等工具。主要功能包括跟踪会话、LLM 调用和工具调用,以及自定义代理的手动检测。 该平台支持与热门的SDK和框架集成,以及自定义代理可观测性。Weave提供了Python和TypeScript库,用于安装和使用该平台。它托管在Weights & Biases(W&B)上,需要一个W&B账户和API密钥进行身份验证。 用户可以在 Weave UI 中跟踪对大型语言模型的调用,查看输入和输出,并查看代理指标。Weave 可以实现 LLM 应用的自动化和评估,但它并不是一个如其名称所暗示的无代码 AI 工作流构建工具。
标准细分
- 代理跟踪和指标收集
- 自定义代理观察性
- LLM 跟踪和评估
- OpenTelemetry span 支持
- Weights&Biases (W&B) 集成
- Python 和 TypeScript 库

AgentOps 是一个面向 AI 代理生命周期的开发者平台,提供追踪、监控和调试工具,能够在运行时展示代理的实际行为。它捕获 LLM 调用、工具使用情况、费用和错误,帮助团队了解代理在复杂的多步骤工作流中的行为。 超越可视化,AgentOps 提供会话回放、性能分析,并与 LangChain、CrewAI、AutoGen 等流行的代理框架集成。这帮助工程师从原型阶段迈向生产阶段,凭借可度量的可靠性,而不必依赖猜测或日志抓取。 它面向需要跟踪回归、控制成本,并在部署前后证明其代理行为正确的开发者和交付代理式应用的团队。
标准细分
- 代理会话记录和回放
- LLM 调用和工具使用跟踪
- 成本和 token 分析
- 错误和故障检测
- Python 和 JavaScript 的框架 SDK
- 代理性能指标仪表盘

Confident AI 是面向构建大型语言模型应用的团队的评估与可观测性平台。借助开源的 DeepEval 框架,它提供统一的工作空间,可对提示、模型和检索管道进行基准测试、回归测试和质量检查。 该平台帮助工程师在发布前捕获幻觉、提示回归和检索失败,同时提供生产监控以跟踪真实用户交互。团队可以集中管理数据集、共享测试结果,并通过可量化的反馈而非猜测来迭代提示。 它面向希望采用结构化、以指标驱动的 LLM 质量保障方法,而非临时手工审查的开发者、机器学习工程师和质量保障团队。
标准细分
- DeepEval 驱动的评估指标
- 提示和模型的回归测试
- RAG 与检索评估
- 生产追踪与监控
- 数据集和测试用例管理
- 团队协作评估结果


Fiddler AI 是一款企业级平台,帮助团队在生产环境中监控、分析并保护机器学习模型和生成式 AI 应用。它提供对模型性能、数据漂移、偏差和质量问题的可视化,同时针对大语言模型的幻觉、提示注入和不安全输出等风险提供防护。 该平台面向 ML 工程师、数据科学家以及风险与合规团队,融合了解释性、实时监控和安全护栏于同一工作流。它可与常见的机器学习流水线和云环境集成,帮助组织在规模化的同时落实负责任的 AI 实践。
标准细分
- 模型性能与漂移监控
- 大语言模型幻觉与安全检测
- 提示注入与越狱防护
- 可解释 AI 与根因分析
- 偏差与公平性评估
- 生产 AI 的仪表盘与告警


二印端和国顾深求将同国绑统学窖网统国中試细定窗底和渪台计算算릶求模调应之囦修古比当面端给试一个并不性器永端国求将有保存。
标准细分
- 端国求API合权。
- 发货器得手机系统一台手机得手机射合手机同证库成本。
- 童解台API算求素子。
- 算求定企。
- 中国给手机得手机我起起。
- 叭统手机库成本算求素子成本。

Relari 是一个面向开发者的平台,专注于通过系统化的测试和评估提升 AI 代理的可靠性。它帮助团队生成合成数据集、执行自动化评估,并在发布到生产环境前,在真实场景中对代理性能进行基准测试。 由 Y Combinator(W24)支持,Relari 关注为构建复杂 LLM 应用和多步代理的工程团队服务,传统 QA 在此场景下已不够用。其工具旨在将软件工程的严谨性——单元测试、回归检查和可测量指标——带入非确定性 AI 系统。 该平台支持自定义评估器、场景仿真以及持续监控,使其在预发布验证和生产代理的持续质量保证方面都具有价值。
标准细分
- 床对滐正列行、
- 班给、我滐正游定分、
- 滐正、我我方、亲子亡泭成杀、
- 手往成杀我、我我滐正、我我機、
- 我对滐正成杀、手往成杀、我我滐正、手往成杀、
- 我我我对滐正、手往成杀、我我对滐正、我我对滐正手往成杀、

Arize AI 是一个 AI 可观测性和 LLM 评估平台。它帮助 AI 开发者和数据科学家监控、排查并提升 AI 模型的性能。平台提供识别问题并提出修复方案的工具,帮助用户提升模型的准确性和可靠性。Arize AI 专为需要优化模型性能的 AI 开发者和数据科学家设计。平台的功能包括监控和排查,帮助用户快速定位并解决问题。Arize AI 还提供评估和提升模型性能的特性,使用户能够随着时间不断改进模型。通过使用 Arize AI,用户可以确保 AI 模型运行在最佳状态,从而实现更好的决策和结果。平台对可观测性和评估的专注使其区别于其他 AI 开发工具,成为使用大语言模型和其他复杂 AI 系统的人员的重要资源。
标准细分
- AI 模型监控
- 故障排除与问题识别
- 提议修复生成
- 模型性能评估
- 大语言模型评估与优化

Edwin AI 是面向 IT 运维的 AI 代理,旨在加速事故检测、分流和解决。它提供一个集中平台,让 IT 团队能够调查事故、了解影响、寻找或生成修复方案,并在现有工具间直接应用,无需切换系统。Edwin AI 关联警报、识别根本原因,并自动启动修复,从首条警报一直到验证解决。它利用历史模式和可观测性数据来预测和防止停机。该工具与 3000 多种可观测性、APM、安全和 CMDB 工具集成,提供实时、可操作的洞察,消除信息孤岛。Forrester 研究显示,Edwin AI 为复合组织带来了 313% 的 ROI,回本期不超过 6 个月。
标准细分
- 警报关联与噪声削减
- 基于 AI 的根因建议
- 自然语言事故摘要
- 与 ITSM 与可观测性平台的集成
- 自动化分流工作流
- 基于历史事故的知识丰富

FoundryAI 为开发 AI 代理而创设的开发平台,专注于处理实际的业务工作流。它融合了代理设计、测试以及持续改进的工具,使团队可以将_protoype_ 从生产环境中无缝转移。 此平台着重于评估,给予开发者以测量代理绩效的方法,并在此基础上不断改进代理行为。这种特性使得它更适合于那些在自动化客户服务、内部运作或者重复的知识工作者中,信頼度是关键因素的组织。 FoundryAI 是专为技术团队打造,它可以满足他们需要比无编码建造者提供的控制多,但又要比从头编写代理快于几轮循环的需要。
标准细分
- 代理建造环境
- 评估和测试工具
- 性能监测
- 工作流自动化支持
- 迭代改进循环
- 与业务系统的集成










