Trace提出一种面向视觉语言模型RLVR训练的可复现环境,将任务构造拆分为场景语法与可执行任务程序,并由共享语义状态统一生成图像、提示、答案、验证器状态和实例轨迹。环境覆盖277种场景语法、11个视觉领域、1000项任务;64,000个训练实例使Qwen2.5-VL-3B和7B在24个外部基准上的宏平均分别提升3.51和4.06个百分点。
最近 24 小时暂无可用热度快照。