BackgroundMellow将长篇叙事转化为分层、同步的电影感声音景观,采用主控—专家智能体架构拆解音频线索,并分别生成环境声、音乐等内容后混音。系统基于Tango2潜在扩散模型与专业配乐检索器,使用NLP模块预测声音的开始时间、持续时长和相对响度;论文以YouTube电影预告片数据集,通过近邻检索评估同步性、覆盖率和频谱丰富度。
最近 24 小时暂无可用热度快照。