VideoChat3提出一个4B参数、完全开放的视频多模态大模型,面向通用、长视频和流式视频理解。其核心包括Inflated 3D Vision Transformer(I3D-ViT)、自适应帧分辨率,以及覆盖三类场景的VideoChat3-Academic2M、LV116K和OL617K数据集。论文摘要称,该模型在多个基准上超过参数量相当或更大的开源模型,但未提供具体分数。
最近 24 小时暂无可用热度快照。