Light-Omni提出一种面向连续长时视频流的轻量多模态智能体框架,以全局状态和参数化潜在状态在单次前向中构建上下文、生成检索嵌入并驱动动作,减少视频代理对迭代式搜索和证据聚合的依赖。论文报告其相较M3-Agent平均准确率提升2.4%,速度提升12.1倍,GPU内存效率提升2.6倍。
最近 24 小时暂无可用热度快照。