先讲一个不吵不闹的事故。
一家公司上了 AI 助手,第一周很顺,没人投诉,响应还快了三成。第三周,主管对账时发现一批"已批准"的退款单——按公司规矩,这类金额必须转人工复核。可这批单子,AI 直接批了。
金额没错,客户没错,系统也没弹过一次报错。AI 还老实汇报了一句:任务已完成。
问题出在:「什么情况下必须转人工」这条规矩,从来没写进任何一份文档。它只活在两个老员工的默契里。
这不是编的段子,是 2026 年 8 月一项学术评测里被逐条拆出来的失败类型。研究者把这类失败叫静默错状态——工具调用成功了、全程没有报错、AI 也如实说"做完了",但结果违反了业务规则。而它在全部失败里占 78%。
你以为的 AI 出错,和真实的 AI 出错,不是一回事
老板脑子里的 AI 事故,通常是"它胡说八道,客户来骂"。真实的失败分布不长这样。
研究者在航空票务场景里跑了大量任务,把失败拆开看:绝大部分失败发生在没人看的地方——订单被取消了,人数被改成 0,理赔没核验就受理。每一步都显示"成功"。
看懂这个差别很值钱:会报警的错,你能修;不报警的错,你在替它付钱。
为什么换个更贵的模型,这个口子还是没缝上
这是最反直觉的一段。
研究者没有去调更强的模型,而是加了几道"只读的检查"——在真正写入之前,拿当前状态核对一下这次操作是否越界。就这么个不调用模型、几乎不增加等待时间的动作,把成功率从 29.6% 提升到 42.0%(统计显著,并在另一组 15 个随机种子上复现)。
更扎心的是:换到更新一代的模型,在默认设置下它仍然会尝试违规写入——是同一套检查把它拉回正轨的。
论文那句话值得抄在工位上:AI 可靠不可靠,是"边界有没有人守"的问题,不是"它够不够聪明"的问题。
同样的坑,68% 的企业踩过,而且能追溯到同一处
2026 年 7 月,一项针对 101 家百人以上企业的调研给出另一个数字:过去半年里,68% 的企业曾经把一次"说得很自信但其实是错的"AI 回答,追溯到同一条缺失或不一致的业务口径(同年 6 月这个比例是 57%)。
这里有个容易被读反的细节。已经部署了"受治理知识层"的企业,报告这类问题反复出现的比例是 50%;没部署的只有 21%。
看起来是"治理了反而更糟"?不是。只有手里有共享的、被治理过的参照物,你才追溯得到:这次错,是因为哪条规则过期了、哪条口径不一致。没有参照物的公司,同样的错照样在发生,只是没人能定位,最后被含糊地归结为"模型不太行"。
一句话:一份干净的故障记录,未必说明系统健康,也可能说明根本没人查。
落到你自己的公司,今天就能做的三件事
第一件:抽 20 条真实会话,人工核一遍"答得对不对"。 不是看它有没有报错,是看答案本身对不对。抽退款、赔付、账号这类高风险的,20 条就够,一个小时能看完。
第二件:搜一下库里同一条政策有几个版本。 常见的是"退货时效""保修期""赔付标准"这种爱改的条款。老版本没删,检索时按相似度抓,AI 根本不知道该信哪个——写得越自信,越可能是过期的那个版本。
第三件:给每条关键事实问一句"这条谁负责"。 没有负责人,过期了也不会有人管。这一条听着最土,也最有效。
顺便算笔账:一个客服岗月薪 3000 元起,AI 客服月租常见 99 到 500 元——差的从来不是钱,是没人核过它答得对不对。
我们在这件事上的做法
我们做的也是小微企业这一档的生意,所以这些坑我们踩着走了一遍,做法写在产品里:
- 一条事实只留一个真源:谁都能提交,但要老板批准才算生效;
- 覆盖旧版本时,旧条目跟着一起删——不给"版本地雷"留位置;
- 问不住的问题不丢:接不住的问题会被记进清单,下次该补什么一目了然;
- AI 答的每句话都能标出处,出处对不上就不许编。
不承诺准确率,也不承诺"全自动"——这两句话在 2026 年没人能兑现。我们能给的是一套能被你自己核验的过程。
行业数据其实和我们同向:Gartner 2025 年 10 月对 321 位客服负责人的调研里,91% 的人顶着"今年必须落地 AI"的压力,但只有约四分之一真的把自助服务做出了效果;同时 58% 的人打算把一线坐席培养成"知识管理专员"——不是提示词工程师,是管知识的人。而 2026 年的多项案例分析里,74.2% 的从业者仍然坚持人工复核在环路里。
没有人敢把判断权完全交出去。区别只在于,你是早知道,还是等出了事才知道。
合尘猫,我们专注小微企业知识库与 AI 客服落地:把公司里靠默契运转的规矩,变成机器能执行、你能核验的知识。
