论文提出一种为特定提示计算大型语言模型有害输出概率严格界限的框架,将 Clopper-Pearson 置信区间用于 PAC 界限,并利用潜空间特征优先探索更可能产生有害输出的自回归生成分支。作者称,该方法能在真实危害概率极低时高效计算有意义且经过形式证明的下界,并在先进 LLM 上获得非平凡结果。
最近 24 小时暂无可用热度快照。