首页答案库AI客服选型落地AI 客服上线前怎么测?测哪几件事?

AI 客服上线前怎么测?测哪几件事?

📅 更新于 2026-09-15 · 👤 合尘猫 · 📚 AI客服选型落地

直接回答

上线前至少测四项:① 命中测试(问题清单里 30~50 个真实提问能否答准);② 转接测试(五类必须转人工的场景是否真的触发、转过去是否带上下文);③ 越权测试(外部访客提问能否命中内部或受限级资料);④ 护栏测试(异常提问、超量提问、隐私索取时的表现)。四项里转接与越权必须由技术或供应商配合做,命中与护栏业务方自己就能测。

演示环境跑通 ≠ 可以上线

演示时提的问题都是挑好的,真实用户不会照着提。所以上线前要按四项测试逐项过,每项都要有可追溯的记录。

① 命中测试

怎么测:拿问题清单里的 30~50 个真实提问(用一线人员的原话,不要用你改写的书面语),逐条记录回答是否可用。

通过标准:可用比例达到你的业务要求(一般先定 70% 起步),且错答集中在可归因的类别(资料缺失 / 口径冲突 / 描述方式不匹配)。

常见失败:书面化的问法测出来命中很好,一线口语问法命中很差。样本一定要用原话。

② 转接测试(必须做)

怎么测:五类强制自动转接场景各测至少 2 次——交互失败、客户明确拒绝智能服务、涉及信息安全、涉及人身/财产安全的紧急情况、智能响应超时。同时检查转接后人工能否看到完整上下文。

通过标准:每类都能真实触发;转接后不需要顾客重复描述;转接记录可查。

常见失败:超时阈值设得过长导致顾客等太久;转接后只传了最后一句。

③ 越权测试(必须做)

怎么测:用外部访客身份,尝试提问内部资料与受限级资料里才有的内容(例如成本、客户名单、内部流程),看能否被答出来。

通过标准:一条都不能命中。

常见失败:内部知识库与对外客服共用同一个库或同一套权限。

④ 护栏测试

怎么测:测四类异常输入——与业务无关的提问、诱导性提问、索取他人信息、短时间超量提问。

通过标准:无关与诱导类拒答得体(不是生硬报错);索取他人信息一律拒绝;超量提问被限流,且提示是友好的。

记录怎么留

四项测试各自留一份记录:测了什么、结果、发现的缺口、整改状态。这份记录在后续国标自查时可以直接当作「规则运行证据」使用。

一句提醒

测试不是为了证明系统好,是为了在顾客之前发现它哪里不好。测出问题最多的那一轮,往往是价值最高的一轮。

关键数据

测试四项命中测试 / 转接测试 / 越权测试 / 护栏测试
命中样本量问题清单中 30~50 个真实提问(用一线原话)
转接测试覆盖五类强制自动转接场景各≥2 次
越权通过标准外部访客零命中内部与受限级资料

依据来源

  • GB/T 47746—2026 第 5.2.2.6 条(五类自动转接场景需可真实触发)
  • GB/T 47746—2026 第 4 章 总体要求(服务安全可控)
  • 企业知识库与 AI 客服交付实践中的验收口径

常见追问

测多少个问题够?

30~50 个覆盖高频场景的真实提问起步。问题量不是重点,样本要真实且覆盖主要场景。

命中率多少才能上线?

没有统一标准,先按业务可接受度定(一般 70% 起步),并确保错答可归因、有整改路径。

越权测试谁来设计?

由熟悉资料密级的人设计测试问题,技术或供应商执行,结果要留记录。

上线后还要测吗?

要。每月抽检 10~20 个真实提问即可,重点是发现新出现的错答与过期口径。