arXiv 预印本Haiwen Diao
商汤推出原生统一多模态模型 SenseNova-U1.5,8B 架构摒弃外挂编码器与 VAE
原标题:SenseNova-U1.5: Towards Native Unified Visual Intelligence
模型82
我们推出了 SenseNova-U1.5,这是一款 8B-MoT 原生统一多模态模型,能够在无编码器(encoder-free)和无 VAE(VAE-free)的架构下理解、推理并生成视觉内容。我们通过具有空间连贯性的图像块重构强化了其视觉接口,并通过精心筛选的生成与编辑数据、改进的任务构建、结构化提示词增强以及高达 4K 的原生分辨率扩展了训练规模。在后训练阶段,我们针对视觉美学、双语文本渲染、信息图表生成和图像编辑优化了专用专家模型,并通过多专家 on-policy 蒸馏整合了这些能力。在广泛的评测中,SenseNova-U1.5 大幅提升了图像保真度、文本渲染、复杂构图、多参考图编辑和图文交错生成表现,同时改善了指令遵循能力,并完好保留了主体一致性、几何结构以及未修改区域。尽管在生成数据中接触到的结构化格式较为有限,SenseNova-U1.5 依然能有效泛化到长篇、复杂且结构化的视觉指令中,进一步证明了多模态理解能力可以迁移至视觉规划与创作。综合来看,这些发现表明原生统一建模是迈向在全端到端框架内实现感知、推理与创作系统的一条极具前景的路径。我们将开源训练代码,包括监督微调、强化学习以及 on-policy 蒸馏。
为什么值得读
展现了原生端到端架构在规避传统视觉编码器和扩散组件后,以单一 8B 模型承接 4K 分辨率图文理解与生成的落地路径。
标签
商汤SenseNova多模态大模型统一视觉模型图像生成计算机视觉开源