arXiv 预印本Zisen Shao论文88
将物体表示为音视模态声场
原标题:Objects as Audio-Visual Modal Sound Fields
尽管现代三维重建技术在物体几何与外观建模方面表现出色,但它在很大程度上忽略了物理交互所揭示的丰富声学线索。物体的撞击声能够传达其材质、刚度和结构属性,为视觉信息提供补充。然而,现有的撞击声建模方法要么依赖成本高昂的基于物理的仿真,要么需要大规模数据集才能通过纯数据驱动的方式实现泛化。我们提出音视频模态声场(Audio-Visual Modal Sound Field,AV-MSF),这是一种新颖的物体级声学表示,可通过多视角图像和仅少量撞击声录音完成重建。AV-MSF 以融合稠密三维视觉特征的三维高斯泼溅(3D Gaussian Splatting)为基础,提供强大的几何感知先验,并使用紧凑且具有明确物理意义的模态参数来表示撞击声场,从而实现稳健的少样本重建。在两个真实世界数据集上的实验表明,AV-MSF 实现了当前最先进的撞击声渲染效果,优于基于物理和数据驱动的基线方法。此外,我们还展示了该表示所支持的下游应用,包括接触位置定位和物体声音编辑。
为什么值得读
它把少样本声音重建与可编辑的三维物体表示结合起来,可能影响机器人触觉、沉浸式交互和视听内容生成,但关键实验细节仍需核验。
标签
3D重建音视学习声场Gaussian Splatting少样本学习声音编辑接触定位