论文提出一种并行化自回归框架,用于提升全模态密集视频描述的推理效率与时间定位能力。方法利用不同事件间较弱的局部依赖,将跨事件令牌并行解码,同时保留事件内部的顺序生成;核心包括潜在全局规划与事件因子化并行解码两个机制。摘要称其在多个基准上同时改善效率和性能,但未给出具体加速比与准确率。
最近 24 小时暂无可用热度快照。