论文提出提示引导的选择性目标声源定位任务与端到端模型 SelectTSL,使系统在多声源复杂声学场景中只定位用户指定目标。模型通过 PGSA 生成提示相关嵌入,增强跨通道相位差(IPD)并联合估计目标声源到达方向(DoA)与目标数量,支持目标数量随时间变化。作者称其在合成数据和真实录音上优于基线并具备真实环境泛化能力。
最近 24 小时暂无可用热度快照。