阅读原文
arXiv 预印本Jianru Shen论文88

小型语言模型语言化不确定性的可证明局限与可认证延迟决策

原标题:Provable Limits and Certified Deferral for Verbalized Uncertainty in Small Language Models

小型开放权重语言模型日益部署于私有、离线且对成本敏感的场景中。在这些场景里,关键的部署问题不仅是模型会回答什么,还包括它应在何时将任务交由人工处理。我们研究了口头表达的置信度是否能够支持风险受控的任务转交,并在 ARC-Challenge 和 TruthfulQA 上评估了来自三个模型系列的 11 个指令微调模型,这些模型的参数量从 0.5B 到 14B 不等,共生成 25,168 条本地预测结果。三个理论结果限定了校准所能提供的能力:严格单调的校准会保留风险覆盖率前沿和错误检测 AUROC;当模型的置信度始终高于 0.5 而准确率低于 0.5 时,温度缩放无法对其进行校准;Clopper-Pearson 程序则可在独立同分布(i.i.d.)部署假设下,将一个包含 200 道问题的校准集转换为有限样本风险证书。在实证研究中,22 个模型-任务组合中的 8 个在距离预测界限一个百分点以内达到温度缩放不可行性下限。Platt 缩放将 ECE 降低至最低 0.02,但在 20% 的风险预算下,只有 3 个模型-任务组合获得了经认证的自主运行资格;在 10% 的风险预算下则一个也没有。我们还识别并修复了 TruthfulQA 选择题形式中的答案排序伪影。校准赋予置信度以语义;经认证的任务转交则决定了小型模型何时可以安全使用。

为什么值得读

小模型正进入离线和隐私场景,但低ECE并不等于可安全自治;本文把置信度校准连接到可审计的转交风险证书。

标签

小语言模型不确定性校准风险覆盖人工转交TruthfulQAARC-Challenge安全部署