香港大学多模态实验室提出 UniClawBench,用五项基础能力评估主动式智能体:技能使用、探索、长上下文推理、多模态理解和跨平台协同。基准包含400个双语真实任务,在实时 Docker 容器中通过细粒度检查点评分,并以执行器、隐藏监督器和用户智能体构成闭环多轮评测,同时比较模型能力与智能体框架的共同影响。
最近 24 小时暂无可用热度快照。