论文提出多模态语音活动投影(MM-VAP),将原有仅音频的未来语音活动预测扩展至同步音视频输入,用语音相关预训练音视频编码器和LoRA进行适配,并加入说话人间注意力与语义一致性损失。在NoXi、NoXi+J及Haru EDR语料上的结果显示,该方法相较基线在部分轮流发言事件上有所提升,适用于面向对话调解的社交机器人。
最近 24 小时暂无可用热度快照。