论文研究如何用外部遗憾与交换遗憾直接训练单层自注意力模型。作者声称,特定驻点的前向计算分别对应平滑虚构博弈和 Blum–Mansour 无遗憾算法,从而在博弈部署中导向粗相关均衡或相关均衡,无需监督算法轨迹。
最近 24 小时暂无可用热度快照。