TensorX

TensorX · Paper Blog

Image Generators are Generalist Vision Learners

Valentin Gabeur, Shangbang Long, Songyou Peng, Paul Voigtlaender, Shuyang Sun, Yanan Bao, Karen Truong, Zhicheng Wang, Wenlei Zhou, Jonathan T. Barron, Kyle Genova, Nithish Kannen, Sherry Ben, Yandong Li, Mandy Guo, Suhas Yogin, Yiming Gu, Huizhong Chen, Oliver Wang, Saining Xie, Howard Zhou, Kaiming He, Thomas Funkhouser, Jean-Baptiste Alayrac, Radu Soricut · 2026-06-05

Image GenerationVisual UnderstandingFoundation ModelsInstruction Tuning

本文探讨了图像生成预训练是否能作为通用视觉学习器。通过对生成模型 Nano Banana Pro 进行轻量级指令微调,构建出的 Vision Banana 在 2D 和 3D 视觉理解任务上均达到了 SOTA 级别,证明了生成预训练中蕴含着深层的通用视觉表征。

💡 核心创新点

传统的计算机视觉研究通常假设,视觉理解(Perception)与视觉生成(Generation)是两种截然不同的任务,需要采用不同的模型架构和训练策略。传统的表征学习方法多依赖于判别式学习、对比学习或自监督自编码器。然而,本研究打破了这一固有假设,提出了一个颠覆性的观点:图像生成训练本身就是一种强力的通用视觉学习器(Generalist Vision Learner)。 相比于现有的多任务视觉模型或特定领域的专家模型(如 SAM 3 或 Depth Anything),其核心机制差异在于,本研究并没有为不同的下游任务引入复杂的专用网络头(Task-specific Heads),而是将所有视觉任务(如分割、深度估计、法线估计)的输出空间统一参数化为 RGB 图像。这种“图像进,图像出”(Image-to-Image)的生成范式,使得模型可以使用完全相同的生成网络来处理所有视觉感知任务。 这种范式之所以能够带来显著的性能提升,原因在于生成模型在海量图像数据预训练过程中,为了能够生成高保真、语义连贯的图像,已经隐式地在潜空间(Latent Space)中建模了极强的三维几何结构、物体边界、语义关系以及常识先验。通过轻量级的指令微调(Instruction-Tuning),即可完美释放这些隐藏在生成器内部的视觉理解潜力。

🔍 背景与动机

在当前的 AI 浪潮中,大语言模型(LLMs)已经展现出令人惊叹的涌现能力(Emergent Capabilities),即通过通用的生成式预训练(Generative Pretraining),模型能够自然地习得语言理解和常识推理能力。但在计算机视觉(CV)领域,这种“生成即理解”的统一范式一直未能成为主流。 目前的行业痛点在于,虽然现有的视觉专家模型(Specialist Models)在特定任务上表现优异,但它们往往“各行其道”:

  • 分割任务依赖于像 Segment Anything (SAM 3) 这样在大规模掩码上重度微调的模型;
  • 深度估计则依赖于 Depth Anything 这样在特定几何管道上优化的系统。 这导致视觉领域极度缺乏像 LLM 那样能够“一通百通”的通用基础模型。现有的生成式视觉模型(如各种扩散模型)虽然能生成精美的图片,但其强大的内部表征却一直被视为“黑盒”,难以被直接应用于定量的、高精度的三维或二维感知任务。

🎯 核心结论:图像生成不仅是视觉内容创造的终点,更是视觉通用理解的起点。生成预训练与指令微调的结合,将成为构建通用视觉基础模型的基石。

📊 数据集与实验环境

为了对提出的通用视觉模型进行严谨的指令微调与多任务评估,研究人员构建了一个包含生成数据和少量多任务感知数据的混合训练集。

评估数据集介绍

研究人员在以下具有代表性的基准上进行了零样本迁移(Zero-shot Transfer)评估,以测试模型的通用泛化能力:

  1. Cityscapes:用于评估二维语义分割(Semantic Segmentation),包含经典的 19 个城市街景类别。
  2. SA-Co/Gold:用于评估开词汇实例分割(Open-vocabulary Instance Segmentation),包含大量的物体掩码。
  3. RefCOCOg (UMD)ReasonSeg:用于指代性表达式分割(Referring Expression Segmentation),重点测试语言与视觉的深层对齐与推理。
  4. NYU v2、iBims1、ETH3D、DIODE-Indoor、KITTI、nuScenes:涵盖了室内外多种场景,用于严格测试单目度量深度估计(Monocular Metric Depth Estimation)。
  5. ScanNetVirtual KITTI 2 (VKitti):用于评估三维表面法线估计(Surface Normal Estimation)。

实验环境与训练超参数

为了保证模型在保留原始强大的图像生成能力的同时,精准对齐到感知任务的输出格式,研究人员采用了非常轻量且精细的训练策略:

  • 基础模型:采用 Nano Banana Pro (NBP) 作为预训练生成器基座。
  • 微调配比:将极少量的视觉感知任务数据,以极低的混合比例混入 Nano Banana Pro 原始的图像生成训练流中。
  • 优化器:采用常用的 AdamW 优化器进行训练。
  • 超参控制:采用极小的学习率和适度的 Weight Decay,防止生成先验发生灾难性遗忘(Catastrophic Forgetting)。
  • 推理策略:在实例分割(SA-Co/Gold)任务中,利用轻量级多模态模型 Gemini 3.1 Flash-Lite 作为正负查询过滤器,以提高开词汇检测的准确性。

🛠️ 核心机制与研究方法

研究的核心逻辑是:将所有计算机视觉感知任务,无缝重构为基于指令的图像生成任务。通过引入独特的编解码器设计,模型能够以完全一致的 pipeline,将视觉信息解码为高精度的度量值或类别掩码。

Vision Banana 通过指令微调将多种 2D/3D 理解任务统一参数化为图像生成任务,并保留了基础生成能力

2D 语义与实例分割的“RGB 颜色映射”机制

🎨 分割掩码的生成式编码与解码

传统的分割模型通常输出像素级的类别概率分布,而 Vision Banana 则直接生成彩色掩码图像

  • 语义分割处理:通过构建一个结构化的 JSON 映射或自然语言提示词(如“猫用红色表示,背景用黄色表示”),让模型在输出图片中将对应的区域染成指定的 RGB 颜色。在推理时,通过最近邻像素匹配将 RGB 色值还原为离散的类别标签。
  • 开词汇实例分割处理:由于实例数量无法提前确定,模型采用了一种“动态着色”机制。在提示词中不指定具体的颜色,而是直接要求模型对属于同一类别的不同实例涂上“不同且独特的颜色”。 为了消除图像生成固有的边界模糊与色漂移噪声,研究提出了一种多阶段聚类算法(Multi-stage clustering algorithm)来解析生成的彩色实例掩码,主要步骤包括:
  • 背景初始化:剔除所有色彩极接近背景预设色的像素点,设定色彩容差阀值为 14,将其余前景像素进行保留。
  • 色彩相似度分组:应用 16-连通性的种子填充(Floodfill)算法,根据颜色空间距离对相邻像素进行划分。
  • 去噪与形态学修剪:通过 3imes33 imes 3 核的二进制腐蚀算子对物体边缘进行精细化处理,去除过小的杂点和边界晕染(Halo Artifacts)。

度量深度估计的非线性幂变换与 Hilbert 曲线映射

📏 连续几何深度向 RGB 空间的无损投影

对于深度估计等连续值回归任务,直接用简单的灰度图表示会由于量化精度不足(仅 256 阶)而丢失大量的细节。为此,研究设计了一种高精度的双向可逆编码映射。 为了使模型对近处物体(如机器人抓取范围内的物体)的深度更加敏感,首先对原始度量深度 dimes[0,extinf)d imes [0, ext{inf}) 进行幂变换,映射到归一化的区间 [0,1)[0, 1)

f(d,λ,c)=1(1d/c)λ+1f(d, \lambda, c) = 1 - (1 - d/c)^{\lambda + 1}

在公式 (1) 中,变量 dd 为原始绝对度量深度值,λ\lambda 代表形状参数(在所有实验中设为 λ=3\lambda = -3),cc 代表尺度参数(设为 c=10/3c = 10/3)。通过这一幂变换,无限的物理深度范围被压缩为有限的归一化距离 f(d,λ,c)f(d, \lambda, c)

💡 关键技巧:在得到归一化距离后,Vision Banana 沿着 3D RGB 色彩立方体(Color Cube)的边缘进行分段线性插值(类似于三维 Hilbert 曲线的一阶迭代),将该标量值映射为三维空间的 RGB 三元组。

三维彩色立方体上的 Hilbert 映射曲线,展示了连续标量深度向 RGB 空间的双向无损转换 这一设计使得连续的物理深度能够以高达数万级的有效分辨度,无损地编码进三维 RGB 色彩空间。在推理时,通过沿色彩立方体边缘线段进行投影,可以百分之百可逆地还原出高精度的物理度量距离(单位:米)。

三维表面法线估计的相机空间自然映射

🧭 表面方向向量的天然 RGB 对齐

相比于深度估计复杂的非线性变换,三维表面法线(Surface Normal)具有天然的几何对齐优势。法线向量 (x,y,z)(x, y, z) 是三维空间中的单位向量,其各个分量的取值范围均在 [1.0,1.0][-1.0, 1.0] 区间内。 Vision Banana 巧妙地利用了这一特性,将相机坐标系(右手法则,+x 向右,+y 向上,+z 指向相机外)下的三个法线分量直接线性映射到 RGB 图像的三个颜色通道:

  • R=trunc((1x)/2×255)R = \text{trunc}((1 - x)/2 \times 255)
  • G=trunc((1+y)/2×255)G = \text{trunc}((1 + y)/2 \times 255)
  • B=trunc((1+z)/2×255)B = \text{trunc}((1 + z)/2 \times 255) 这种直接的映射保证了表面法线估计可以被极其自然地当成一个标准的 3 通道图像生成问题。Facing Left(向左,即 (1,0,0)(-1, 0, 0))编码为粉红色,Facing Up(向上,即 (0,1,0)(0, 1, 0))编码为浅绿色,Facing the Camera(朝向相机,即 (0,0,1)(0, 0, 1))则编码为淡蓝色。

📈 结果与深度分析

为了证明 Vision Banana 的通用表征能力,研究人员在多项 2D 和 3D 感知任务上将其与领域内最顶级的专家模型(Domain Specialists)进行了对比。

2D 任务性能对比

根据汇总数据,Vision Banana 虽然作为一个统一通用模型,但在多项任务上展现出击败或匹敌专用 SOTA 模型的能力:

Vision Banana 与各个 2D、3D 视觉任务以及生成任务最强专家模型的全面性能对比

  • 语义分割:在 Cityscapes 验证集上,其 mIoU 达到了 69.9%,超越了高度特化的 SAM 3(65.2%),大幅度缩小了与有监督专家模型(SegMan-L,84.2%)之间的差距。
  • 指代分割:在 RefCOCOg 验证集上取得了 73.8% 的 cIoU,超越了 SAM 3 + Gemini 2.5 Pro 的强力组合(73.4%)。
  • 实例分割:在 SA-Co/Gold 数据集上,Vision Banana 与 Gemini 3.1 Flash-Lite 结合后,取得了 47.5 的 cgF1 成绩,远超 OWLv2 专家的 24.6。

3D 任务性能对比

在单目度量深度估计中,Vision Banana 的零样本迁移能力尤为惊人:

在零样本单目深度估计任务上,Vision Banana 与多款领域最强模型的定量对比

在不依赖任何相机内参的情况下,在 NYU、iBims1、ETH3D、DIODE、KITTI 等六大基准的平均 δ1\delta_1 精度上达到了 0.882。它成功超越了包括 UniK3D (0.823) 和 MoGe-2 (0.802) 在内的专用三维模型。而在一众测试集中,iBims1 的绝对相对误差(AbsRel)降低到了 0.078。 而在表面法线估计任务中,Vision Banana 在室内多数据集的平均角度误差(Mean Angular Error)仅为 15.549°,超越了包括 Marigold、DSINE、StableNormal 以及强大的 Lotus-2-Normal (16.558°) 在内的所有基线模型:

在表面法线估计任务上,Vision Banana 与各路专家模型的平均角度误差对比 同时,定性可视化分析进一步印证了其生成的法线图具有极其卓越的微观几何细节:

Vision Banana 与 Lotus-2 在法线估计上的定性效果对比,展示了极佳的细粒度结构还原

⚠️ 局限性与失败案例: 尽管 Vision Banana 表现抢眼,但它依然存在生成模型固有的局限。在极度嘈杂或物体密集的复杂场景中(如处理 ReasonSeg 中“拥挤的人群”),模型偶尔会将邻近的独立物体错误地合并为一个实例(Instance Merging),或者发生边界解析溢出。此外,生成式推理比轻量级的判别式专家模型具有明显更高的计算开销与延迟,这对其在移动端或实时机器人感知中的部署提出了挑战。

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号