Argus-Unified提出一种兼顾图像理解与生成的紧凑多模态模型。方法复用预训练视觉语言模型,以冻结视觉编码器产生混合视觉令牌:连续令牌服务理解,离散令牌服务生成。两阶段训练仅使用1560万条数据、约2000美元成本;论文称其在GQA、POPE和VQAv2上达到当前最佳,并以约十倍更低成本取得与Janus、Janus-Pro相当的生成质量。
最近 24 小时暂无可用热度快照。