论文提出“自主策略演化”评测设定:让模型在固定交互预算下,反复编辑可执行策略系统,并依据环境反馈改进已探索策略。其基准包含16个紧凑型交互式强化学习环境,同时记录预算分配、反馈利用和机制发现过程。摘要称,GPT-5.5取得最高综合排名,并在全部16个环境中进入前二。
最近 24 小时暂无可用热度快照。