TESSERA v2在固定的像素级Barlow Twins框架中完成395次训练、覆盖1,024块GH200超级芯片,并在15项下游任务上评估扩展规律。研究发现预训练损失与下游表现相关性很弱,应共同扩大编码器和数据、固定投影器,再通过蒸馏生成紧凑模型;21M参数的TESSERA v2-1B-M据称整体超过所测开放及专有模型。
最近 24 小时暂无可用热度快照。