HumanCLAW提出一种将视觉语言模型的动作决策与低层运动执行解耦的具身智能评测框架。其基准包含41个室内场景、1,218个长时程第一视角任务,测试9个VLM后,最佳成功率仅16.8%。摘要称,主要瓶颈不是识别目标,而是缺乏身体自我感知。
最近 24 小时暂无可用热度快照。