论文研究端到端语音语言模型中的离散语音Token是否保留可被攻击者利用的说话人特征,并提出Audio BERT(AuB)与两阶段SpInv反演方法。针对Moshi、Higgs3、Kimi-Audio和Qwen3-Omni,在VoxCeleb说话人不重叠协议上测试,结果显示仅需3秒前端输出,SpInv在指定说话人编码器空间中的余弦相似度即可超过0.70。
最近 24 小时暂无可用热度快照。