Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

阅读原文
arXiv 预印本·Haiwen Diao·2026年9月10日 17:59

商汤推出原生统一多模态模型 SenseNova-U1.5,8B 架构摒弃外挂编码器与 VAE

原标题:SenseNova-U1.5: Towards Native Unified Visual Intelligence

模型82

我们推出了 SenseNova-U1.5,这是一款 8B-MoT 原生统一多模态模型,能够在无编码器(encoder-free)和无 VAE(VAE-free)的架构下理解、推理并生成视觉内容。我们通过具有空间连贯性的图像块重构强化了其视觉接口,并通过精心筛选的生成与编辑数据、改进的任务构建、结构化提示词增强以及高达 4K 的原生分辨率扩展了训练规模。在后训练阶段,我们针对视觉美学、双语文本渲染、信息图表生成和图像编辑优化了专用专家模型,并通过多专家 on-policy 蒸馏整合了这些能力。在广泛的评测中,SenseNova-U1.5 大幅提升了图像保真度、文本渲染、复杂构图、多参考图编辑和图文交错生成表现,同时改善了指令遵循能力,并完好保留了主体一致性、几何结构以及未修改区域。尽管在生成数据中接触到的结构化格式较为有限,SenseNova-U1.5 依然能有效泛化到长篇、复杂且结构化的视觉指令中,进一步证明了多模态理解能力可以迁移至视觉规划与创作。综合来看,这些发现表明原生统一建模是迈向在全端到端框架内实现感知、推理与创作系统的一条极具前景的路径。我们将开源训练代码,包括监督微调、强化学习以及 on-policy 蒸馏。

为什么值得读

展现了原生端到端架构在规避传统视觉编码器和扩散组件后,以单一 8B 模型承接 4K 分辨率图文理解与生成的落地路径。

标签

商汤SenseNova多模态大模型统一视觉模型图像生成计算机视觉开源

其他信源

  • HuggingFace Daily Papers — SenseNova-U1.5: Towards Native Unified Visual Intelligence

评分依据

  • 新颖性84
  • 影响力81
  • 实践价值80
  • 可信度83
  • 时效性85