论文提出将计算机视觉任务统一表达为多模态生成:符号结果生成文本,密集空间预测生成图像,组合任务生成文本与图像。SenseNova-Vision基于现成统一多模态模型训练,无需任务专用架构或预测头,覆盖检测、OCR、关键点、分割、深度、法线、点图和相机位姿等任务,并公开模型与数据集。
最近 24 小时暂无可用热度快照。