直接回答
做过,用的是 61 条真实口语问句构成的回归集(知识库可答 31 条、引导类 24 条、应转人工 6 条)。DeepSeek 路线在「该不该转人工」二分类上为 100%(61/61)、误转人工 0 条;本地小模型路线为 96.7%(59/61),差一档精度。我们据此选择继续用 DeepSeek 做判断层。
实测设置
- 回归集:61 条真实口语问句,带期望路由标注(知识库可答 31 条 / 引导类 24 条 / 应转人工 6 条)
- 比的两路:① 云端 DeepSeek 直接生成判断 ② 本机小模型读 logits 做判断
- 同一套提示词:两路共用生产环境的分诊提示词,避免「拿不同题目比较」
结果
| 指标 | DeepSeek 路线 | 本机小模型路线 |
|---|---|---|
| 转人工二分类准确率 | 100%(61/61) | 96.7%(59/61) |
| 该转的人工是否转出 | 6/6 | 6/6 |
| 误转人工条数 | 0 | 2 |
| 三分类(含引导/直答细分) | 80.3% | 70.5% |
| 平均延迟 | 1.14s | 0.46s |
| 成本 | 按量计费 | 0(本地算力) |
我们的结论
暂不替换,判断层继续用 DeepSeek。 理由是国标的一条明确要求是「不滥用转人工」——本机模型误转的两条里,有一条恰好是顾客说「我说不清楚,你直接给我处理了吧」,这正是最不该转人工的情形。
一条方法论教训
给本地指令模型做评测,必须套对话模板并给出示例。同一模型用裸 completion 调用时,转人工召回率是 0%;换成标准的对话模板 + 3 个示例后回升到 100%。方法不当会得出「模型不行」的错误结论。
关键数据
| 回归集 | 61 条真实口语问句(知识库 31 / 引导 24 / 应转人工 6) |
| DeepSeek 路线 | 转人工二分类 100%(61/61),误转 0,三分类 80.3%,平均延迟 1.14s |
| 本机小模型路线 | 96.7%(59/61),误转 2,三分类 70.5%,平均延迟 0.46s |
| 结论 | 暂不替换,判断层继续用 DeepSeek |
| 方法论教训 | 本地模型评测必须套对话模板 + 给示例,裸 completion 会得出错误结论 |
依据来源
- 我方 2026-09 实测:61 条口语回归集,两路同提示词对照
- GB/T 47746—2026 第 5 章(转人工相关要求)
常见追问
61 条够吗?
作为门禁足够,作为统计结论不够。它用来做「改动前后是否退化」的回归判断,样本量小但方向敏感;需要统计显著性时应扩大样本。
能看原始数据吗?
可以。项目交付时回归集与逐条结果一并给出,客户可自行复跑。