本文研究联邦预训练模型应如何可靠评估。作者使用在相同客户端数据上训练的集中式与联邦式16M参数Transformer,比较GLUE下游微调与基于GLUE文本的下一词预测。结果显示,下游微调排名未能稳定反映预训练测试集困惑度,而更接近预训练目标的直接下一词预测具有更强对应关系。
最近 24 小时暂无可用热度快照。