上周有个老板跟我说,他差点签了一个 AI 客服的单子。
演示的时候,对方的机器人对答如流。他把公司最难缠的几个问题抛过去,全答得漂漂亮亮。
他当场就动心了。
我跟他说,你先别急。你刚才看的不是产品,是样板间。
一、样板间很好看,入住率只有 17%
买房的人都懂样板间是什么。
灯光打得好,家具摆得巧,每一寸空间都是设计师算过的。你站在里面,觉得这就是你想要的生活。
但真正的信息不在样板间里。在交房之后。
AI 行业现在也在经历这个阶段。
Gartner 在 2026 年做过一项调研,结果非常刺眼:60% 的组织打算在 2 年内部署 AI Agent(也就是能自己动手干活的 AI),真正落地的只有 17%。
也就是说,每 100 家说要上的公司,最后跑通的不到 18 家。
差了 5 倍。
这不是一家之言。
德勤的说法是:85% 的企业计划定制 Agent,只有 25% 的试点真的上了生产。
MIT 的报告更狠:花了三四百亿美元,95% 的企业 AI 项目没有回报。
Forrester 研究 AI 客服时也给出类似结论:约三分之一的企业部署 AI 自助服务会失败。
四家独立机构,口径不同,方向一致。
这不是巧合。
而且请注意 Forrester 那句话的后半段——失败的主因并不是技术。
那是什么?
二、AI 这个词,其实指的是两个东西
我得先帮你把一件事拆开。
大家嘴里的「AI」,在工作中其实是两件完全不同的事:
一是演示态的 AI。 在会议室里,在投屏上,在你随手编的几个问题里,它表现得近乎完美。
二是生产态的 AI。 在你真实的客流量里,在你客户那种毫无语法可言的提问方式里,在需要它的每一秒里,它到底行不行。
在 Gartner 的技术成熟度曲线里,Agent 现在正处于「期望膨胀期」的最高点——热度最高的时候,恰恰是它离真实落地最远的时候,而很多企业就是在这个阶段拍板掏钱的。
这两个 AI 之间的差距,就是 60% 和 17% 之间的差距。
为什么这个差距会这么大?
因为演示是免费的,而生产是要还债的。
好看的演示几乎不要成本——挑 5 个机器人答得好的问题,5 分钟就能演完。
但生产要面对的是:你客户嘴里那些乱七八糟、缺主语、带方言、一句话问 3 件事的问法。
这些问法,你在做演示的时候,一个都不会遇到。
一个都没有。
三、我今天不讲理论,讲一次真实的翻车
接下来这部分,是合尘猫自己踩的坑。
我做过一套 AI 客服的转人工判断——就是决定「这个问题该让机器人答,还是该转给人工」。
为了测它,攒了一个回归集:61 条真实的口语问句,带期望结果。其中知识库能答的 31 条、该引导的 24 条、应该转人工的 6 条。
然后拿同一个模型,测了两条路。
第一条路,云端 DeepSeek:转人工二分类准确率 100%(61/61),误转人工 0 条,平均延迟 1.14 秒。
第二条路,换成我本机跑的小模型。同一个提示词,同一批题目:96.7%(59/61),误转 2 条,平均延迟 0.46 秒。
差一档,可以理解。但我真正想说的是,那误转的 2 条里,其中一条,顾客说的是「我说不清楚,你直接给我处理了吧」。
这句话恰恰是最不该转人工的。
因为客户已经明确说了「我说不清楚」,他要的是你自己想办法,而不是你把他推给别人。
GB/T 47746—2026 里有 1 条要求,就叫不准滥用转人工。这条是硬线,所以最后没有换掉云端那套,宁可慢一点、贵一点。
这是第一个坑:便宜的那条路,往往是在你不注意的地方让步。
记着这句话。
四、真正让我睡不着的,是第二个坑
刚才那个还算正常的工程取舍。真正让我改观的,是下面这件事。
最开始给本地那个小模型做评测的时候,用的是一种很朴素的调用方式——把问题直接扔给模型,让它自己判断。
结果你猜怎么着?
转人工的召回率是 0%。
一条都没识别出来。6 条该转的,一条没转。
全漏了。
我第一反应是:这模型不行。
但后来换了一种做法——套上标准的对话模板,再给 3 个示例。
同一个模型,同一批题目,召回率从 0% 直接回升到 100%。
模型一个字都没换。
我坐在那儿想了很久。变的只是「你怎么用它」,结果就从全错变成全对。
这件事让我对整个行业的说法都警惕起来了。
后来把这条写成了一句方法论:给本地指令模型做评测,必须套对话模板并给示例。裸调用会得出「模型不行」的错误结论。
现在你回头看那个 17%。
那 83% 没落地的公司里,有多少是真的选错了模型?
我猜不多。
就这么简单。
大多数不是模型不行,是没有人认真做过「怎么用它」这件事。
五、那到底该做什么?3 件事
我不推荐一上来就比模型。模型是最好换的东西,也是最不该先换的东西。
按顺序,你应该做这 3 件事。
顺序别反。
第一件,先划边界:哪些问题,绝对不能让 AI 答。
这句话听起来反直觉,但它最重要。
你要先明确列出:纠纷、投诉、退款争议、情绪激烈的对话、涉及金额和承诺的问题——这些一律不许 AI 自己答,必须转人。
边界划在哪里,决定了你的 AI 上线之后是提效工具,还是新的投诉来源。
很多人以为 AI 客服的能力上限取决于模型。实际上,最先出问题的往往是「该拦的没拦住」。
第二件,去收集你客户真实的口语问法。
知识库最常见的病,不是内容少,是只有标准问法。
「怎么还没发货」和「物流多久到」,在客户嘴里是 2 句完全不同的话,但在业务上是同一个动作。你的知识库里如果只存了前一句,后一句进来就是识别不到。
这件事没别的办法,只能一条条攒。但你攒过一次就值——它是一次性成本,能长期复用。
第三件,才是评测和选模型。
而且评测时要记得上面那个坑:换一个调用方式,同一只模型的成绩能从 0% 变 100%。
如果你测出来的结论是「这个模型不行」,先别信。先怀疑你的测法。
六、4 个你一定想问的
问:签单之前,我怎么判断一个 AI 客服到底行不行?
答:别让它演示。你直接把你最常被投诉的 10 个问题,用客户平时说话的原话发给它。然后重点看它怎么处理它答不上来的那些——是老实说不知道并转人工,还是硬编一个答案给你。后者的风险比答不出来大得多。
问:这套东西自己做,要花多久?
答:只看「划边界 + 攒问法」这 2 件事,认真做大概 2 到 3 周能出第一版。花钱的地方主要在人工整理,不在算力(也就是跑模型要花的那笔机器钱)。
问:那我要不要干脆等大模型(也就是 ChatGPT 那一类)再强一点?
答:不建议等。上面那个 0% 到 100% 的例子已经说明——同一只模型,成绩差别可以来自用法,而不是模型本身。等新模型,解决不了「你没划边界」这个问题。
问:我知识库里有 500 条问答了,为什么还是答不准?
答:常见的情况是「假性覆盖」——500 条里大多是标准问法,用户换个说法就识别不了。这时候要加的不是数量,是同一件事的不同问法。
七、样板间不会告诉你的事
回到开头那个老板。
我后来跟他说:你想验一个 AI 客服到底行不行,别让它演示。
你直接做 1 件事——把你最常被投诉的 10 个问题,用客户平时说话的原话,发给它。
然后看它怎么处理它答不上来的那些。
因为样板间永远在展示「它答得好的时候」。
而真实的生意,全都发生在「它答不上来的时候」。
最后说一句
AI 有一个反常识的地方。
它把「看起来很好」这件事的成本,几乎干到了零。
所以今天,一个东西看起来很完美,已经不再是优点——它反而会让你想:这是不是又是样板间?
真正值钱的,不是它演示的时候有多像样,而是它在没人看的时候,能不能扛住。
我们是谁
合尘猫(SavantCat)是面向小微企业(200 人以下)的企业知识库与 AI 客服服务团队,做 3 件事:把你散落的资料整理成能被 AI 准确调用的知识库;按 GB/T 47746—2026 的 61 项自查清单做达标排查;提供可复跑的交付核验凭证。
不做全自动的承诺,也不承诺排名。只承诺 2 条:过程可核验,交付可复跑。
如果这套东西不适合你的情况,直接说别花钱。
