Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

阅读原文
HuggingFace 每日论文·Haojun Zhang·2026年9月9日 20:00

语音大模型音频编码器剪枝框架 X-AuT:渐进式蒸馏与表征对齐

原标题:X-AuT: Progressive Audio-Encoder Compression for Speech LLMs with Cross-Scale Distillation

论文76

削减语音大模型的音频编码器层数能压低推理开销,却常破坏解码表征,导致文本漏字或提前截断。X-AuT 提出渐进式修剪机制,在冻结语言基座的前提下,结合行为探测与跨尺度蒸馏恢复表征。在 Qwen3-ASR-0.6B 测试中,音频塔层数由 18 层降至 14 层,参数减少 20.7%,错误率维持在 5.75%。

为什么值得读

端到端语音模型落地常受限于前端音频计算开销,该研究在避免解码截断的前提下剪除两成音频塔参数,提供了实用的推理优化参考。

标签

Speech LLMModel CompressionAudio EncoderKnowledge DistillationPruningQwen-ASREfficiency

评分依据

  • 新颖性75
  • 影响力73
  • 实践价值82
  • 可信度76
  • 时效性74