arXiv 预印本Yuezhang Peng论文70
语音函数调用:大型音频语言模型语音理解的新视角
原标题:Spoken Function Calling: A New Perspective on Spoken Language Understanding for Large Audio Language Models
口语语言理解(SLU)是面向任务的对话系统的核心组件,也是实现人与智能体无缝交互的关键环节。传统 SLU 在经过领域内监督微调后,能够有效提取封闭集任务中的用户语义;然而,由于规则定义存在歧义,它在利用上下文学习处理开放域任务方面面临重大挑战。本文提出口语函数调用(SFC),一种全新的语义理解视角,通过结构化规则定义优化语义理解,推动 SLU 超越传统的封闭集范式。具体而言,我们基于传统 SLU 数据集整理并扩展了一套口语函数,构建多智能体系统以合成 SFC-Bench 数据集,评估大型语言模型(LLM)和大型音频语言模型(LALM)的性能,并通过后训练增强 LALM 的 SFC 能力。实验表明,SFC 优于传统 SLU,显著提升了 LLM 和 LALM 的语义提取准确率。
为什么值得读
语音智能体正转向可执行工具调用,SFC能否把音频输入可靠映射为结构化函数参数,直接影响端到端语音代理的落地。
标签
SFC语音理解函数调用音频语言模型SFC-Bench多智能体合成后训练