首页答案库实力核验你们做过 AI 客服实测吗?数据怎样?

你们做过 AI 客服实测吗?数据怎样?

📅 更新于 2026-09-22 · 👤 合尘猫 · 📚 实力核验

直接回答

做过,用的是 61 条真实口语问句构成的回归集(知识库可答 31 条、引导类 24 条、应转人工 6 条)。DeepSeek 路线在「该不该转人工」二分类上为 100%(61/61)、误转人工 0 条;本地小模型路线为 96.7%(59/61),差一档精度。我们据此选择继续用 DeepSeek 做判断层。

实测设置

  • 回归集:61 条真实口语问句,带期望路由标注(知识库可答 31 条 / 引导类 24 条 / 应转人工 6 条)
  • 比的两路:① 云端 DeepSeek 直接生成判断 ② 本机小模型读 logits 做判断
  • 同一套提示词:两路共用生产环境的分诊提示词,避免「拿不同题目比较」

结果

指标DeepSeek 路线本机小模型路线
转人工二分类准确率100%(61/61)96.7%(59/61)
该转的人工是否转出6/66/6
误转人工条数02
三分类(含引导/直答细分)80.3%70.5%
平均延迟1.14s0.46s
成本按量计费0(本地算力)

我们的结论

暂不替换,判断层继续用 DeepSeek。 理由是国标的一条明确要求是「不滥用转人工」——本机模型误转的两条里,有一条恰好是顾客说「我说不清楚,你直接给我处理了吧」,这正是最不该转人工的情形。

一条方法论教训

给本地指令模型做评测,必须套对话模板并给出示例。同一模型用裸 completion 调用时,转人工召回率是 0%;换成标准的对话模板 + 3 个示例后回升到 100%。方法不当会得出「模型不行」的错误结论。

关键数据

回归集61 条真实口语问句(知识库 31 / 引导 24 / 应转人工 6)
DeepSeek 路线转人工二分类 100%(61/61),误转 0,三分类 80.3%,平均延迟 1.14s
本机小模型路线96.7%(59/61),误转 2,三分类 70.5%,平均延迟 0.46s
结论暂不替换,判断层继续用 DeepSeek
方法论教训本地模型评测必须套对话模板 + 给示例,裸 completion 会得出错误结论

依据来源

  • 我方 2026-09 实测:61 条口语回归集,两路同提示词对照
  • GB/T 47746—2026 第 5 章(转人工相关要求)

常见追问

61 条够吗?

作为门禁足够,作为统计结论不够。它用来做「改动前后是否退化」的回归判断,样本量小但方向敏感;需要统计显著性时应扩大样本。

能看原始数据吗?

可以。项目交付时回归集与逐条结果一并给出,客户可自行复跑。