Xuanke Shi bio photo

Xuanke Shi

Email

Github

Google Scholar

ResearchGate

视觉任务能否统一成一种生成接口?——SenseNova-Vision 论文解读

发布时间:2026-07-18
本文讨论论文 Vision as Unified Multimodal Generation 的问题设定、技术路线、实验结论与局限性。

计算机视觉通常按照任务组织模型:检测输出边界框,分割输出掩码,深度估计输出连续距离,表面法线预测输出三维方向,多视图重建还要同时处理点图与相机参数。它们同样指向“理解图像”,却使用不同的模型结构、监督信号和输出协议。

语言模型提供了另一种思路。翻译、问答、摘要和代码生成原本也是不同任务,如今都可以被写成“根据指令生成文本”。沿着这条思路,一个自然的问题是:传统视觉任务能否也被统一成条件生成问题?

SenseNova-Vision 的核心价值在于对这个问题进行了一次大规模验证。它让同一个统一多模态模型根据自然语言指令和可选视觉提示,生成文本、图像或图文交错结果,从而覆盖检测、OCR、关键点、分割、深度、表面法线和多视图几何等任务。

统一模型处理检测、OCR、分割、深度、表面法线和多视图几何等视觉任务
同一个模型覆盖结构化视觉理解、图像分割、稠密几何与多视图三维视觉。

到底统一了什么?

“一个模型完成多个任务”本身并不新鲜。多任务网络可以共享骨干,多模态模型也可以把坐标和类别序列化为文本。真正困难的是,不同视觉结果天然属于不同的数据空间:

  • 边界框、关键点、OCR 文本和相机参数是离散的符号记录;
  • 分割掩码、深度图与表面法线是像素对齐的稠密结果;
  • 多视图重建既包含稠密点图,也包含离散的相机参数;
  • 全景分割等任务还需要语义描述与像素区域保持对应。

因此,这项工作统一的不是所有任务的内部计算过程,而是任务接口与输出表达。模型主体保持不变,具体任务由指令、视觉提示、输出格式和解码约定共同定义。

这个区分很重要。所谓“统一”并不意味着检测与深度估计变成了同一种问题,而是它们可以共享同一个条件生成框架,不再必须各自配备一套任务专用预测头。

三种输出空间

为了容纳不同类型的视觉结果,论文使用了三种输出形式。

文本:表达符号化结果

检测、指代定位、关键点、OCR、GUI Grounding 和相机位姿等任务,被表示为带有轻量标记的结构化文本。类别、坐标、文字和参数因此可以与自然语言条件出现在同一序列中。

这种表示的优点不只是接口统一。由于任务条件本身也是语言,类别、属性、空间位置和目标区域可以自由组合,例如“检测画面左侧的红色车辆”,而不必为新条件重新设计类别头。

图像:表达稠密结果

分割掩码、深度图、表面法线和三维点图与输入图像逐像素对应。将这些结果序列化为文本既冗长又破坏空间结构,因此模型直接生成经过约定编码的图像,再用确定性规则还原为标准结果。

这里的关键是:统一生成不等于把一切都翻译成文字。适合二维空间表达的答案仍然留在图像空间中,并利用预训练模型已有的图像生成能力。

文本与图像交错:表达组合结果

全景分割、对话式分割和部分多视图任务同时需要符号信息与稠密输出。例如,全景分割既要给出区域类别和颜色图例,又要生成对应掩码。模型因而可以在一次响应中交错生成文本与图像。

视觉任务被映射到文本、图像和文本图像混合生成空间
符号结果用文本表达,稠密结果用图像表达,组合任务使用文本—图像混合响应。

三种输出空间构成了整项工作的基本逻辑:不是寻找一种万能数据格式,而是让不同结果进入基础模型原生支持的生成空间。

模型没有增加任务专用分支

模型从预训练的 Bagel-7B-MoT 出发,不为检测、分割、深度或三维任务增加独立预测头。不同任务共享语言指令、视觉输入和多模态解码器,通过混合训练学习各自的输出协议。

这使论文的研究问题相当清晰:一个已经具备图文理解与生成能力的统一多模态模型,能否仅通过任务表达和训练数据的重组,获得传统计算机视觉能力?

但“没有任务专用分支”不代表任务差异消失了。模型仍需学习边界框的文本格式、深度与法线的图像编码、掩码颜色约定以及相机位姿的参数表示。过去分散在模型结构中的差异,有一部分被迁移到了数据协议和解码规则中。

数据工程可能比模型结构更关键

要在同一生成框架中训练异构任务,首先要把已有视觉标注转换为统一的“视觉输入—指令—可解码响应”。论文构建的 SenseNova-Vision Corpus(SN-VC) 覆盖四个任务家族,并公开了其中约 5000 万帧的 SN-VC-50M

  • 结构化视觉理解:1890 万帧,包括检测、指代、关键点、OCR、版面与 GUI Grounding;
  • 图像分割:130 万帧,包括通用、指代、推理、交互和对话式分割;
  • 稠密几何预测:1730 万帧,包括深度与表面法线;
  • 多视图视觉几何:1250 万帧,包括点图重建和相机位姿估计。
检测、OCR、深度、分割与相机位姿任务的统一指令响应数据
异构视觉标注被转换为带自然语言指令的文本、图像或混合响应。

每条样本包含一个或多个视觉输入、定义任务与输出约定的自然语言指令,以及可确定性解码的目标响应。这里的“指令化”不只是给旧数据加一句提示词,还包括坐标归一化、稠密结果编码、颜色图例对齐和多视图数据组织等具体协议。

公开语料没有重复打包所有来源数据的 RGB 图像,而是保留相对路径、转换后标注和处理规则;完整使用时仍需按说明准备原始数据。代码采用 Apache 2.0,模型权重与语料采用 CC BY-NC 4.0。

实验回答了什么?

实验最有意义的结论不是某个单项指标刷新纪录,而是同一个生成模型能否在四组差异很大的任务上保持整体竞争力。

在结构化视觉理解上,统一文本接口覆盖了 COCO 检测、长尾与密集检测、指代定位、OCR、GUI Grounding 和人体关键点。论文报告 COCO-Com. 56.6 mAP、LVIS 54.8 mAP,在密集目标、小目标和 OCR 定位上也表现出较强能力。

在稠密几何上,模型直接生成深度图和表面法线图。NYUv2 深度估计达到 4.0 AbsRel / 98.1 δ1,在多个深度与法线基准上接近强专用模型。

分割与多视图几何的结果更能说明问题的边界。推理分割表现较强,但通用、指代和交互分割的部分指标仍落后于 X-SAM 等专门系统;多视图重建和相机位姿估计已经可以由同一生成模型完成,但 Depth Anything 3、VGGT 等具有几何归纳偏置的模型在若干指标上仍然更好。

统一模型与专用模型及其他通用视觉模型的综合指标对比
评价这项工作的重点是跨任务覆盖与整体竞争力,而非所有单项都超过专用模型。
结构化理解、深度、法线、分割与多视图几何的定性结果
不同任务均通过同一套语言条件多模态生成接口完成。

论文还比较了视觉任务训练前后的通用能力。相较 Bagel,MMVP 从 69.3 提升到 79.0,GenEval 从 0.82 提升到 0.85;但 MMMU 从 0.55 降到 0.42,MathVista 从 73.1 降到 67.7,WISE 从 0.52 降到 0.45。

这组结果值得单独强调:能力并不是无成本叠加的。混合训练可以增强部分视觉感知与图像生成能力,却也可能损害知识问答、数学推理或其他通用能力。统一模型仍然面临数据比例、梯度冲突和能力保持问题。

更值得讨论的是任务组合

统一接口真正有别于“把多个模型装在一起”的地方,是已有能力可能在语言条件下重新组合。

论文展示了一些训练任务之外的组合形式:用文本坐标代替点提示完成交互分割;给定参考实例后分割同类对象;用语言指定不同区域的掩码颜色;在没有专门文字分割标注时,组合 OCR 定位与掩码生成来分割指定单词。

开放场景案例也提供了直观观察。在未见过的游戏画面上,同一模型可以分别预测表面法线、实例掩码和角色关键点。

游戏画面的原图、表面法线、实例分割与关键点结果
从左到右:输入图像、表面法线、实例分割与关键点结果。

在鱼群和货架商品等密集场景中,模型能够分离大量相邻实例;镜面和视觉错觉案例则考察语义先验是否能帮助几何预测摆脱局部纹理的干扰。

鱼群与货架商品场景中的稠密实例分割结果
密集、遮挡场景中的实例分割。
镜面场景的输入图像、深度估计与表面法线结果
从左到右:镜面场景、深度估计与表面法线。
纹理错觉、借位摄影与透视错觉的几何预测结果
三组视觉错觉案例及对应的深度或表面法线预测。

这些案例仍然主要是定性证据,不能单独证明模型获得了稳定的物理推理能力。但它们支持了一个更谨慎的判断:检测、OCR、分割和几何任务在共享表示与语言接口下,确实出现了跨任务复用的可能。

统一生成仍然有哪些问题?

首先,统一接口不等于统一性能。专用模型拥有更强的任务归纳偏置、更精确的数值约束和更成熟的后处理,在一些分割与几何基准上仍然领先。

其次,输出协议并没有消失。文本结果需要解析,深度、法线和点图需要解码,颜色与区域需要保持一致。系统复杂度从多套模型部分转移到了数据构建、提示模板与结果解释。

第三,生成式输出的可靠性需要单独研究。提示方式、输出长度和解码过程都可能影响结果。对于机器人、自动驾驶或测量等高风险场景,深度和相机位姿不能未经校验直接使用。

第四,能力冲突仍然存在。通用能力评测的升降说明,多任务联合训练没有自动解决灾难性遗忘和任务干扰。如何控制数据混合比例、路由不同能力并保持模型可扩展,是后续工作的重要问题。

最后,计算成本并不低。完整演示建议使用一张 80GB GPU,全套评测建议至少使用 8×80GB GPU。当前方案更适合作为研究统一视觉接口的平台,而不是轻量部署方案。

从任务专用模型到可编程视觉接口

这项工作没有证明专用视觉模型已经过时,也没有彻底消除不同任务之间的结构差异。它更重要的贡献,是验证了框、点、文字、掩码、深度、法线、点图和相机参数可以被组织进统一多模态模型的原生生成空间。

过去,增加一项视觉能力通常意味着增加模型、预测头与数据管线;在统一生成范式下,增加任务更接近于定义输入条件、输出协议和训练样本。如果这条路线能够继续扩展,视觉系统的接口可能从固定的任务菜单,逐渐变成一种由语言与视觉提示共同控制的可编程接口。

因此,SenseNova-Vision 值得关注的并不是“一个模型是否已经做遍计算机视觉”,而是它提出了一个更基础的问题:计算机视觉能否像自然语言处理一样,从大量彼此独立的任务,走向共享模型、共享接口与可组合能力?

资料链接