AI 演示很好看,为什么一上线就不好用?

📅 2026-10-06 · 👤 合尘猫 · 💡 大模型观察

⁠​‌‌‌‌​‌‌‌​‌​‌​‌​‌‌​​​‌‌​​‌‌​​‌‌​⁠上周有个老板跟我说,他差点签了一个 AI 客服的单子。

演示的时候,对方的机器人对答如流。他把公司最难缠的几个问题抛过去,全答得漂漂亮亮。

他当场就动心了。

我跟他说,你先别急。你刚才看的不是产品,是样板间。


一、样板间很好看,入住率只有 17%

买房的人都懂样板间是什么。

灯光打得好,家具摆得巧,每一寸空间都是设计师算过的。你站在里面,觉得这就是你想要的生活。

但真正的信息不在样板间里。在交房之后。

AI 行业现在也在经历这个阶段。

Gartner 在 2026 年做过一项调研,结果非常刺眼:60% 的组织打算在 2 年内部署 AI Agent(也就是能自己动手干活的 AI),真正落地的只有 17%。

也就是说,每 100 家说要上的公司,最后跑通的不到 18 家。

差了 5 倍。

这不是一家之言。

德勤的说法是:85% 的企业计划定制 Agent,只有 25% 的试点真的上了生产。

MIT 的报告更狠:花了三四百亿美元,95% 的企业 AI 项目没有回报。

Forrester 研究 AI 客服时也给出类似结论:约三分之一的企业部署 AI 自助服务会失败。

四家独立机构,口径不同,方向一致。

这不是巧合。

而且请注意 Forrester 那句话的后半段——失败的主因并不是技术。

那是什么?


二、AI 这个词,其实指的是两个东西

我得先帮你把一件事拆开。

大家嘴里的「AI」,在工作中其实是两件完全不同的事:

一是演示态的 AI。 在会议室里,在投屏上,在你随手编的几个问题里,它表现得近乎完美。

二是生产态的 AI。 在你真实的客流量里,在你客户那种毫无语法可言的提问方式里,在需要它的每一秒里,它到底行不行。

在 Gartner 的技术成熟度曲线里,Agent 现在正处于「期望膨胀期」的最高点——热度最高的时候,恰恰是它离真实落地最远的时候,而很多企业就是在这个阶段拍板掏钱的。

这两个 AI 之间的差距,就是 60% 和 17% 之间的差距。

为什么这个差距会这么大?

因为演示是免费的,而生产是要还债的。

好看的演示几乎不要成本——挑 5 个机器人答得好的问题,5 分钟就能演完。

但生产要面对的是:你客户嘴里那些乱七八糟、缺主语、带方言、一句话问 3 件事的问法。

这些问法,你在做演示的时候,一个都不会遇到。

一个都没有。


三、我今天不讲理论,讲一次真实的翻车

接下来这部分,是合尘猫自己踩的坑。

我做过一套 AI 客服的转人工判断——就是决定「这个问题该让机器人答,还是该转给人工」。

为了测它,攒了一个回归集:61 条真实的口语问句,带期望结果。其中知识库能答的 31 条、该引导的 24 条、应该转人工的 6 条。

然后拿同一个模型,测了两条路。

第一条路,云端 DeepSeek:转人工二分类准确率 100%(61/61),误转人工 0 条,平均延迟 1.14 秒。

第二条路,换成我本机跑的小模型。同一个提示词,同一批题目:96.7%(59/61),误转 2 条,平均延迟 0.46 秒。

差一档,可以理解。但我真正想说的是,那误转的 2 条里,其中一条,顾客说的是「我说不清楚,你直接给我处理了吧」。

这句话恰恰是最不该转人工的。

因为客户已经明确说了「我说不清楚」,他要的是你自己想办法,而不是你把他推给别人。

GB/T 47746—2026 里有 1 条要求,就叫不准滥用转人工。这条是硬线,所以最后没有换掉云端那套,宁可慢一点、贵一点。

这是第一个坑:便宜的那条路,往往是在你不注意的地方让步。

记着这句话。


四、真正让我睡不着的,是第二个坑

刚才那个还算正常的工程取舍。真正让我改观的,是下面这件事。

最开始给本地那个小模型做评测的时候,用的是一种很朴素的调用方式——把问题直接扔给模型,让它自己判断。

结果你猜怎么着?

转人工的召回率是 0%。

一条都没识别出来。6 条该转的,一条没转。

全漏了。

我第一反应是:这模型不行。

但后来换了一种做法——套上标准的对话模板,再给 3 个示例。

同一个模型,同一批题目,召回率从 0% 直接回升到 100%。

模型一个字都没换。

我坐在那儿想了很久。变的只是「你怎么用它」,结果就从全错变成全对。

这件事让我对整个行业的说法都警惕起来了。

后来把这条写成了一句方法论:给本地指令模型做评测,必须套对话模板并给示例。裸调用会得出「模型不行」的错误结论。

现在你回头看那个 17%。

那 83% 没落地的公司里,有多少是真的选错了模型?

我猜不多。

就这么简单。

大多数不是模型不行,是没有人认真做过「怎么用它」这件事。


五、那到底该做什么?3 件事

我不推荐一上来就比模型。模型是最好换的东西,也是最不该先换的东西。

按顺序,你应该做这 3 件事。

顺序别反。

第一件,先划边界:哪些问题,绝对不能让 AI 答。

这句话听起来反直觉,但它最重要。

你要先明确列出:纠纷、投诉、退款争议、情绪激烈的对话、涉及金额和承诺的问题——这些一律不许 AI 自己答,必须转人。

边界划在哪里,决定了你的 AI 上线之后是提效工具,还是新的投诉来源。

很多人以为 AI 客服的能力上限取决于模型。实际上,最先出问题的往往是「该拦的没拦住」。

第二件,去收集你客户真实的口语问法。

知识库最常见的病,不是内容少,是只有标准问法。

「怎么还没发货」和「物流多久到」,在客户嘴里是 2 句完全不同的话,但在业务上是同一个动作。你的知识库里如果只存了前一句,后一句进来就是识别不到。

这件事没别的办法,只能一条条攒。但你攒过一次就值——它是一次性成本,能长期复用。

第三件,才是评测和选模型。

而且评测时要记得上面那个坑:换一个调用方式,同一只模型的成绩能从 0% 变 100%。

如果你测出来的结论是「这个模型不行」,先别信。先怀疑你的测法。


六、4 个你一定想问的

问:签单之前,我怎么判断一个 AI 客服到底行不行?

答:别让它演示。你直接把你最常被投诉的 10 个问题,用客户平时说话的原话发给它。然后重点看它怎么处理它答不上来的那些——是老实说不知道并转人工,还是硬编一个答案给你。后者的风险比答不出来大得多。

问:这套东西自己做,要花多久?

答:只看「划边界 + 攒问法」这 2 件事,认真做大概 2 到 3 周能出第一版。花钱的地方主要在人工整理,不在算力(也就是跑模型要花的那笔机器钱)。

问:那我要不要干脆等大模型(也就是 ChatGPT 那一类)再强一点?

答:不建议等。上面那个 0% 到 100% 的例子已经说明——同一只模型,成绩差别可以来自用法,而不是模型本身。等新模型,解决不了「你没划边界」这个问题。

问:我知识库里有 500 条问答了,为什么还是答不准?

答:常见的情况是「假性覆盖」——500 条里大多是标准问法,用户换个说法就识别不了。这时候要加的不是数量,是同一件事的不同问法。


七、样板间不会告诉你的事

回到开头那个老板。

我后来跟他说:你想验一个 AI 客服到底行不行,别让它演示。

你直接做 1 件事——把你最常被投诉的 10 个问题,用客户平时说话的原话,发给它。

然后看它怎么处理它答不上来的那些。

因为样板间永远在展示「它答得好的时候」。

而真实的生意,全都发生在「它答不上来的时候」。


最后说一句

AI 有一个反常识的地方。

它把「看起来很好」这件事的成本,几乎干到了零。

所以今天,一个东西看起来很完美,已经不再是优点——它反而会让你想:这是不是又是样板间?

真正值钱的,不是它演示的时候有多像样,而是它在没人看的时候,能不能扛住。


我们是谁

合尘猫(SavantCat)是面向小微企业(200 人以下)的企业知识库与 AI 客服服务团队,做 3 件事:把你散落的资料整理成能被 AI 准确调用的知识库;按 GB/T 47746—2026 的 61 项自查清单做达标排查;提供可复跑的交付核验凭证。

不做全自动的承诺,也不承诺排名。只承诺 2 条:过程可核验,交付可复跑。

如果这套东西不适合你的情况,直接说别花钱。

🎁 想跟上AI行业变化?

加入知识星球,获取更多AI实战内容与行业洞察

立即加入 →

下一步:要不要先做一次免费体检?

把站点域名 + 行业发到 savant0196@126.com,我们回你一份「AI 可见度体检结论」——你现在能不能被 AI 搜到、瓶颈卡在哪一环。如果基线显示这件事对你没得做,我们会直接说别花钱。

想先自己看一眼:3 分钟免费自测(7 层 52 项,出分即见);需要企业知识库搭建或 AI 客服达标,看服务内容与交付标准。

企业微信咨询(备注「知识库」或「AI客服」):
合尘猫企业微信二维码

本文由 合尘猫 原创,首发于 https://savantcat.cn,转载须注明出处。