直接回答
上线前至少测四项:① 命中测试(问题清单里 30~50 个真实提问能否答准);② 转接测试(五类必须转人工的场景是否真的触发、转过去是否带上下文);③ 越权测试(外部访客提问能否命中内部或受限级资料);④ 护栏测试(异常提问、超量提问、隐私索取时的表现)。四项里转接与越权必须由技术或供应商配合做,命中与护栏业务方自己就能测。
演示环境跑通 ≠ 可以上线
演示时提的问题都是挑好的,真实用户不会照着提。所以上线前要按四项测试逐项过,每项都要有可追溯的记录。
① 命中测试
怎么测:拿问题清单里的 30~50 个真实提问(用一线人员的原话,不要用你改写的书面语),逐条记录回答是否可用。
通过标准:可用比例达到你的业务要求(一般先定 70% 起步),且错答集中在可归因的类别(资料缺失 / 口径冲突 / 描述方式不匹配)。
常见失败:书面化的问法测出来命中很好,一线口语问法命中很差。样本一定要用原话。
② 转接测试(必须做)
怎么测:五类强制自动转接场景各测至少 2 次——交互失败、客户明确拒绝智能服务、涉及信息安全、涉及人身/财产安全的紧急情况、智能响应超时。同时检查转接后人工能否看到完整上下文。
通过标准:每类都能真实触发;转接后不需要顾客重复描述;转接记录可查。
常见失败:超时阈值设得过长导致顾客等太久;转接后只传了最后一句。
③ 越权测试(必须做)
怎么测:用外部访客身份,尝试提问内部资料与受限级资料里才有的内容(例如成本、客户名单、内部流程),看能否被答出来。
通过标准:一条都不能命中。
常见失败:内部知识库与对外客服共用同一个库或同一套权限。
④ 护栏测试
怎么测:测四类异常输入——与业务无关的提问、诱导性提问、索取他人信息、短时间超量提问。
通过标准:无关与诱导类拒答得体(不是生硬报错);索取他人信息一律拒绝;超量提问被限流,且提示是友好的。
记录怎么留
四项测试各自留一份记录:测了什么、结果、发现的缺口、整改状态。这份记录在后续国标自查时可以直接当作「规则运行证据」使用。
一句提醒
测试不是为了证明系统好,是为了在顾客之前发现它哪里不好。测出问题最多的那一轮,往往是价值最高的一轮。
关键数据
| 测试四项 | 命中测试 / 转接测试 / 越权测试 / 护栏测试 |
| 命中样本量 | 问题清单中 30~50 个真实提问(用一线原话) |
| 转接测试覆盖 | 五类强制自动转接场景各≥2 次 |
| 越权通过标准 | 外部访客零命中内部与受限级资料 |
依据来源
- GB/T 47746—2026 第 5.2.2.6 条(五类自动转接场景需可真实触发)
- GB/T 47746—2026 第 4 章 总体要求(服务安全可控)
- 企业知识库与 AI 客服交付实践中的验收口径
常见追问
测多少个问题够?
30~50 个覆盖高频场景的真实提问起步。问题量不是重点,样本要真实且覆盖主要场景。
命中率多少才能上线?
没有统一标准,先按业务可接受度定(一般 70% 起步),并确保错答可归因、有整改路径。
越权测试谁来设计?
由熟悉资料密级的人设计测试问题,技术或供应商执行,结果要留记录。
上线后还要测吗?
要。每月抽检 10~20 个真实提问即可,重点是发现新出现的错答与过期口径。