论文提出 SVA(Search、Value、Act),用仿真环境中的蒙特卡洛树搜索探索冻结 VLA 的候选动作分布,以经验回报训练轻量 Q 值模型,部署时由评估器选择长期后果更优的动作。诊断显示 pass@1 成功率为 33%,pass@32 达 92%;摘要称 9B VLA 在特定测试设置下比 27B 模型高 7 个百分点,推理延迟降低 27%。
最近 24 小时暂无可用热度快照。