论文提出 LingBot-Video,一种面向具身智能的 DiT 视频预训练范式。研究采用混合专家架构扩展模型容量并降低推理成本,加入操作、导航和第一视角机器人视频,还以物理合理性与任务完成度为目标设计多维奖励系统,定位为大规模开源 MoE 视频基础模型。
最近 24 小时暂无可用热度快照。