arXiv 预印本Yi-Jen Shih
语音大模型的回溯思考机制:RetroThinker 如何边听边纠错
原标题:RetroThinker: Enabling Retrospective Thinking in Speech LLMs
论文81
语音大语言模型(SpeechLLM)能够降低延迟,并保留在级联式自动语音识别(ASR)与文本语言模型架构中通常会丢失的副语言细微特征。然而,在复杂的推理任务上,它们仍落后于纯文本LLM,同时实时语音交互又带来了严格的延迟限制。尽管先前的研究采用思维链(CoT)和并发推理来增强推理能力且不引入过高的延迟,但准确率与延迟之间固有的权衡依然存在。在本文中,我们探讨了流式语音大语言模型是否可以在运行过程中动态修正其推理轨迹。我们提出了 RetroThinker,这是一个多阶段后训练框架,赋予了 Moshi 模型在推理期间自我验证和前向修正 CoT 步骤的能力。RetroThinker 将针对精选回顾性思考数据的监督微调(SFT)与基于长度的直接偏好优化(DPO)相结合,以在早期推理阶段(即在用户讲话的同时进行并发推理)优化回顾能力。在 GSM8K 基准上的评估表明,RetroThinker 相比无回顾机制的基线显著改善了准确率与延迟的权衡,在相当的延迟下实现了 11% 的绝对准确率提升。
为什么值得读
实时端到端语音交互正从拟真语调走向逻辑推演,该研究验证了模型在用户发话时边听边动态修正思考链的可行路径。
标签
SpeechLLMReasoningChain-of-ThoughtMoshiDPOStreaming AI