论文提出HAS视频摘要方法,先在全局范围预测连续的逐帧高光分布,再将其作为多模态大语言模型的注意力调控向量,使模型在连续视频输入中更多关注高光帧,同时保留低高光帧的信息,减少离散关键帧选择造成的连贯性和信息损失。作者称其在多个视频摘要基准上取得有竞争力的表现,但摘要未披露具体数据集、指标与增益。
最近 24 小时暂无可用热度快照。