Mage-VL将视频编解码器的运动向量与残差能量直接用于视觉分词,在稀疏I/P帧的16×16图像块上选择动态、高熵区域,据称减少逾75%视觉token。其4B模型采用事件门控与因果解码双系统,摘要报告其静态任务接近Qwen3-VL-4B,并在视频、空间推理及推理速度上取得优势。
最近 24 小时暂无可用热度快照。