Audio-Zero提出一种无需人工标签的音频语言模型自进化框架。它从无标签音频对比样本构造听觉自博弈:多数参与者听参考音频,一名参与者听细微变体,模型先生成听觉线索,再依据线索不一致性找出异常听者,并利用其已知身份产生可验证奖励。在Qwen2-Audio-7B-Instruct和Qwen2.5-Omni-7B上,论文报告其提升了事件顺序、重复和持续时间等细粒度推理,同时保持整体音频理解能力。
最近 24 小时暂无可用热度快照。