论文提出SIS-Bench,用统一的“空间中的自我”框架评估无人机具身空间智能,覆盖感知、记忆、推理三个层级的13项任务。基准包含来自1,646段真实无人机视频的4,856组问答。评测显示,现有多模态大模型在动态、以自身为中心的建模上存在明显不足;引入光流与视觉特征融合的运动感知表示后,空间认知、自我意识及下游决策表现均得到改善。
最近 24 小时暂无可用热度快照。