论文提出逻辑预预训练(Logic-PPT),先用形式推导初始化语言模型,再进行自然语言训练。在最高1000亿token的评估中,作者称模型达到语言任务80%准确率所需数据减少360亿token;形式推导还带来低秩、频谱更集中的表征,并使模型在约33%稀疏度下经剪枝后仍匹配稠密基线。
最近 24 小时暂无可用热度快照。