论文指出,音频深伪检测器可能依赖与真假标签相关的说话人身份线索,而非纯粹识别合成伪影。作者提出无需推理时真实标签的身份敏感性分数(ISS)。在两个检测器和两个数据集上,误分类样本的ISS高出29至52倍,最高可达0.954的AUC预测误分类;对500条语音的变声实验也显示,ISS标记的敏感样本得分变化强19至30倍。
最近 24 小时暂无可用热度快照。