2026年客户服务 AI 代理:实践者采购指南
如何评估、部署和衡量自主支持代理,既不破坏 CSAT,也不超出预算。

Daniel Nikulshyn
Editor
转变
变化是什么:从聊天机器人到自主支持代理
十年来,“AI 客服”主要指基于规则的聊天机器人和意图分类器——披着对话外衣的决策树。它们只能拦截简单的 FAQ,且让其他人感到沮丧。当大语言模型让自由形式的理解与生成变得足够廉价且可靠,以至于可以直接面向付费客户时,这一类别发生了根本性的变化。根据 Wikipedia 对大语言模型的概述,基于 Transformer 的系统现在能够处理开放式查询和推理,而这些是旧的意图匹配流水线从未做到的。 实际的结果是从“机器人”向“代理”转变。现代的支持代理不仅仅把查询匹配到预设答案;它会检索相关知识(通过检索增强生成),调用工具和 API 去查询订单或发放退款,并在需要时决定是否升级至人工。自主性正是关键——也是风险所在。 供应商和分析师已经大力迎合这一趋势。Intercom 的 Fin、Zendesk 的 AI 代理以及 Salesforce 的 Agentforce 都以能够自主解决——而非仅仅拦截——大量入站对话为卖点。Salesforce 公开将 Agentforce 描述为一个用于在服务及其他职能中构建自主代理的平台,体现了“代理”这一概念已成为主流。 2026 年买家的任务不再是“我们是否应该使用 AI?”而是“在什么准确率、哪些防护措施、以及怎样的定价下,使用哪种解决模型?”这些问题与供应商在演示时想让你提出的问题截然不同。
- 大语言模型 — Wikipedia — 提供驱动现代支持代理的 LLM 技术背景。
- Salesforce Agentforce — Salesforce 用于服务及更广泛场景的自主代理平台。
衡量真实
真正重要的指标(以及那些误导的指标)
在供应商的宣传材料中最危险的数字是“转移率”。转移率仅意味着对话没有转到人工——这其中也包括因失望而放弃的客户。你真正想要的是解决率:即代理成功结束的对话占比,需由客户确认或通过下游信号(如72小时内未重新打开工单)来验证。 将评估围绕三个核心指标构建。第一,具严格定义的自主解决率。第二,CSAT或类似的代理处理对话的点赞率等代理表现代理指标,需要与人工处理的对话分开统计,这样优秀的机器人不会靠优秀的人类掩盖自己的表现。第三,升级质量——当代理转交时,是否传递完整上下文,还是让客户重复说明?后者会比任何东西更快地破坏信任。 要显式关注幻觉和政策违规。在客服场景中,关于退款政策或保修条款的自信错误回答,甚至比“我不知道”更糟。Zendesk 和 Intercom 都发布了指南,强调衡量解决率和 CSAT,而不是单纯的自动化量;业界通用的首次联系解决率(FCR)——这一长期使用的呼叫中心 KPI——同样适用于智能代理。 最后,务必要求使用保留评估集:几百条真实历史工单,由你自己的团队标注,在签约前对候选代理进行回放测试。供应商如果抗拒提供沙盒权限让你自行跑这些工单,说明他们有隐情。供应商自己整理的数据基准是营销宣传,而非证据。
- 首次联系解决率 — 维基百科 — 仍然是评估代理的经典客服 KPI。
- Zendesk AI — Zendesk 关于 AI 解决率指标的指南及产品定位。
内部实现
架构:RAG、工具与升级层
一个生产支持代理实际上是由四个系统拼接而成。第一是检索——将模型 grounding 在你的知识库、帮助中心和历史工单中,使其基于你的实际情况而不是 LLM 的训练数据作答。检索增强生成(Retrieval‑augmented generation),如 Wikipedia 所述,是让模型引用当前公司专属事实而不是猜测的机制。如果你的知识库陈旧或自相矛盾,世界上最好的代理也会自信地重复你最糟糕的文章。 第二是工具调用:代理能够调用你的订单系统、订阅 API 或 CRM 执行真实操作——查询发货、应用信用、重置密码。这才是真正的自主解决,而不仅仅是回答问题的阶段。这也是你需要最严格的权限、费用上限和确认步骤的地方,因为拥有账单写权限的代理在没有防护的情况下是一个风险点。 第三是升级与交接层。优秀的代理会识别自己的置信度边界,并将对话以干净的摘要、完整的记录和建议的下一步操作转交给人工。最佳的部署方式是把代理和人工团队视为同一个工作流,而不是两个孤岛。第四是可观测性:记录每一次检索、工具调用和决策,以便审计失败并随着时间改进。 关于自建还是购买的问题:像 LangChain 这样的框架以及开源编排栈让工程团队可以组装定制代理,而一键平台则处理底层管道,使支持运营团队无需数据科学招聘即可交付。大多数拥有几百个以下代理的公司应当选择购买;构建和维护检索、评估以及防护机制的边际成本非常高,而且这通常不是竞争优势的关键。
- 检索增强生成 — Wikipedia — 保持代理信息真实且最新的 grounding 技术。
- LangChain — 用于构建自定义代理工作流的流行框架。
目录精选
聚焦工具:Noet 与 AirkitAI
Agent Pantheon 目录中的两个条目展示了现代客服代理光谱的两个极端:通用自动化和垂直专业化。 Noet 是一款 AI 驱动的客服自动化平台,能够 24/7 处理工单、聊天和咨询。它的卖点在于覆盖面广——单一代理能够持续在所有入站渠道上工作,吸收那些重复且高频的工作负载,否则这些工作会占用客服团队的夜班和周末时间。对于希望将邮件、聊天和工单队列整合到同一自主层,并在不招聘“全球轮班”团队的情况下恢复非工作时间处理能力的团队而言,它是极佳的选择。 AirkitAI 走的是垂直路线:它是一款专为电商品牌打造的 AI 驱动客服平台。这一点非常关键,因为电商客服具有独特的形态——订单状态、退货、运输异常、WISMO(“我的订单在哪里”)查询以及退款逻辑,都依赖于与电商和履约系统的紧密集成。一个开箱即用、针对这些工作流进行调优的平台,通常比需要从零开始训练的通用工具更快达到可用的解决率。 实用结论:让工具的形态匹配你的问题。如果你的工单量广泛且跨渠道,像 Noet 这样的通用型工具可以降低协调成本。如果你是零售或 DTC 品牌,工单主要集中在订单和退货上,AirkitAI 这类垂直平台能够因已有的硬集成和意图模型而缩短价值实现时间。
金钱
定价模型与总体拥有成本
2026 年的客服代理定价主要分为三大模型,每种模型都隐藏着不同的风险。按解决次数计费(如 Intercom 的 Fin,按成功解决一次收费)能够让成本与价值保持一致,但如果工单量增长或对“解决”的定义不严谨,费用可能会出现不可预料的激增。按席位或按代理人数计费则更可预测,但会因为同时扩展人工而受到惩罚。按消费或令牌计费提供了灵活性,但要求你必须精细建模使用量。 表面价永远不是实际价格。需要为实施税做预算:清理和结构化知识库、构建与订单系统和 CRM 的集成、运行评估循环,以及持续的人力审查和纠正代理的工时。常见的失败模式是买了一个低价的按解决计费工具,却花了三个月的工程师时间去让它跑通。 务必诚实地进行转移率计算。如果一个代理能够解决 40% 的每月 10,000 条工单,并且你的人力每单成本已经相当高,那么节省的成本可能相当可观——前提是这 40% 真的是有效解决,而不是放弃。对重新打开的工单以及任何 CSAT 下降都要大幅折扣,因为一个已解决但不满的客户会因流失而抵消你在人力上的节省。 最后,务必谈判退出条款。询问如果离开后,如何导出对话历史、定制流程和知识配置。客服领域的供应商锁定是真实存在的:你的代理会积累机构知识和工作流逻辑,切换成本会叠加。一个干净的数据可移植性条款是廉价的保险。
- Intercom Fin — 一种按解决次数计费的 AI 客服代理,常被引用为定价基准。
- Total cost of ownership — Wikipedia — 评估除标价之外的全部成本的框架。
执行
90 天 rollout 计划,确保不失信任
不要在第一天就直接切换到完全自治。最安全且 ROI 最高的 rollout 方式是分阶段进行。在前 30 天,让代理以“副驾驶”或建议模式运行:它起草回复,由人工客服审核后发送。这样可以建立评估数据集,发现知识盲点,并让团队在客户真正接触到自主回复前建立信心。 接下来的 30 天,为一个狭窄且已充分理解的场景开启自治——比如密码重置、订单状态查询,或特定产品 FAQ 集群——并设置严格的置信度阈值,低于阈值时自动升级。对该场景的解决率、CSAT 和升级质量进行测量,并与保留集对比。只有在指标达标时才扩大自治范围。 始终把知识库视为产品本身。大多数代理失误都源于缺失、过时或相互冲突的文档,而不是模型本身。指定专人闭环处理:每一次升级或点踩都要么是知识库的修正,要么是流程的调整。这就是让部署持续改进、避免停滞在平庸的飞轮。 及早建立治理机制。决定哪些操作绝对不能由代理自主执行(如大额退款、关闭账户),对所有行为进行日志记录以备审计,并向客户透明说明他们正在与 AI 对话——这已成为日益增长的期望,在某些司法辖区甚至是法律要求。2026 年获胜的支持团队并非自动化最快的团队,而是那些谨慎地自动化正确事项并在关键环节保留人工参与的团队。
- Customer service — Wikipedia — 关于客服职能和标准的一般背景。
- Intercom Resolution Bot / Fin guidance — 供应商关于分阶段 AI 支持 rollout 的资源。
资源
- Customer service — Wikipedia
客户服务职能和关键绩效指标的基础概览。
- Large language model — Wikipedia
现代自主支持代理背后的核心技术。
- Salesforce Agentforce
覆盖服务工作流的企业级自主代理平台。
- Zendesk AI
面向支持的 AI 解决方案及指标指南。
- Intercom Fin
按解决计费的 AI 支持代理及定价基准。
常见问题
拦截率(deflection rate)和解决率(resolution rate)有什么区别?
拦截率计入所有未转接至人工的对话——包括放弃的客户。解决率计入代理实际成功关闭的对话,理想情况下得到客户确认或在 72 小时内没有工单重新打开。始终以解决率作为购买依据,而不是拦截率。
我们应该自行构建代理还是购买平台?
大多数拥有几百以下代理的团队应当购买。构建需要维护检索、评估、护栏和集成——这是一笔庞大的工程成本,通常并非竞争优势。只有当支持工作流真正独特且是业务差异化核心时才考虑自行构建。
如何防止代理在政策问题上给出错误答案?
使用基于检索增强生成(RAG)并对接干净、最新的知识库,设定置信度阈值将不确定的案例升级给人工,限制其可自主执行的操作,并对所有交互进行审计日志记录。自信却错误的政策答案比“我不知道”更糟。
哪种定价模型最适合客服 AI?
按解决计费可将成本与价值对齐,但在高并发时会出现波动;按座位计费可预测,但会惩罚人力扩展;按 token/消费计费提供细粒度控制,但需要精细建模。无论选择哪种,都要单独预留知识清理、集成和人工审核的实施费用。
AirkitAI 与像 Noet 这样的通用工具有何不同?
AirkitAI 专为电商品牌打造,订单状态、退货和物流工作流已预集成,缩短零售企业的价值实现时间。Noet 则是更广泛的自动化平台,能够全天候处理跨渠道的工单、聊天和询问,适合需要统一渠道流量的团队。
部署 realistically 需要多长时间?
计划约 90 天:前 30 天使用协助/建议模式收集评估数据,接着 30 天在狭窄的工单切片上推行自主功能,随后根据指标逐步扩大范围。瓶颈几乎总是知识库质量,而非模型本身。
我们必须告知客户他们正在与 AI 对话吗?
是的——透明度已成为日益增长的客户期望,并在某些司法辖区构成法律要求。需明确告知,并确保随时可转接至人工,且转接时携带完整上下文,避免客户重复说明。
导致代理失败的最大单一原因是什么?
陈旧、缺失或相互矛盾的知识库内容。模型的回答取决于检索到的内容。为每一次升级和负面反馈指派负责人,将其转化为知识修复或流程调整——这种反馈闭环是让部署持续改进的关键。