HERMES提出一种从数据中学习的层级标注基底:先进行学习式语义变换,再通过三阶段残差向量量化,为每篇文档生成可由前缀长度控制粒度的粗到细编码,最多约13万个单元。在1B参数、25B token预训练实验中,不同粒度揭示了固定标签管线难以观察的数据配比交互。
最近 24 小时暂无可用热度快照。