LeAct把专家系统给出的动作视为监督信号,将其未显式表达的思维链作为潜变量:学生模型采样候选推理,并保留能提高目标动作概率的候选。摘要称,该方法在不完美信息博弈与模拟机器人任务上优于专家迭代和直接模仿,包括在约10亿信息集的Flop Hold'em中取得+60 mbb/g。
最近 24 小时暂无可用热度快照。