阅读原文
hf-paperspapers80

ARCHead:基于激活度量残差校正的大语言模型输出头压缩

原标题:ARCHead: Activation-Metric Residual Correction for Large Language Model Output Heads

AI 导读

ARCHead针对权重量化常遗漏的LM输出头,将量化低秩核心、分组INT4残差与基于激活度量拟合的低秩校正结合,无需保留稠密BF16头。论文报告其在Qwen3-8B-Base上仅占BF16头存储的25.6%,相对困惑度为1.007;替换AWQ或bitsandbytes遗留的BF16头后,交叉熵仅增加0.006至0.007。

为什么值得读

输出头可能成为量化部署中最后一块显著的高精度存储开销,而ARCHead给出了可与AWQ及bitsandbytes衔接的针对性方案。

深度解读

1. 发生了什么

原始事实: 论文提出ARCHead,用于压缩LLM最终的语言建模输出头。该模块通常是词表维度很大的投影层,部分权重量化后端仍以BF16或FP16保存它。作者同时提供了代码仓库。

2. 核心技术

原始事实: ARCHead由量化低秩核心、分组INT4残差,以及在激活数据导出的度量下拟合的低秩校正组成,并且不保存稠密BF16输出头。其目标不是替代Transformer块量化器,而是处理这些量化器可能遗漏的最终投影。

3. 关键证据与数字

原始事实,均为论文摘要所报告: ARCHead将持久化LM-head存储缩小3.7至3.9倍。在Qwen3-8B-Base上,其存储为BF16头的25.6%,相对困惑度为1.007;同等存储的朴素INT4方案为1.14至1.16。替换AWQ或bitsandbytes留下的BF16头后,交叉熵增加0.006至0.007,实测吞吐变化低于2%。

4. 为什么重要

分析: 当Transformer块已压缩到低比特时,尺寸随隐藏维度和词表大小增长的输出头会占据更显眼的剩余显存或磁盘空间。若论文结果可复现,ARCHead可补齐端到端权重压缩中的这一缺口,同时比直接INT4量化更好地保持词表logit分布。

5. 实际影响

分析: 该方法最适合输出头较大、已有AWQ或bitsandbytes量化流程,且受模型加载显存、分发体积或常驻权重限制的部署。摘要中的低吞吐变化表明计算开销可能有限,但实际收益仍取决于推理内核是否原生支持其打包布局和校正路径。

6. 局限与不确定性

原始事实: 给定摘要只列出Qwen3-8B-Base的具体数字,未提供更多模型规模、词表、任务、硬件或长时间吞吐结果。分析: 相对困惑度接近1并不自动保证生成质量、少数token排序或下游任务完全不受影响。未验证信息: 当前条目的发布日期为2026-08-02,属于未来日期元数据;本文所列结果未在此处独立复现或核验。

7. 原始来源

标签

LLM量化LM-headINT4低秩压缩AWQbitsandbytesQwen3推理部署