TensorX
返回文献探索

Paper · arXiv 2505.24025

DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models

Chenbin Pan, Wenbin He, Zhengzhong Tu, Liu Ren

28 upvotesMay 29, 2025arXiv 预印本
AI 摘要

DINO-R1 incorporates reinforcement learning to enhance visual in-context reasoning capabilities in vision foundation models, achieving better performance than supervised fine-tuning across various visual prompting scenarios.

DeepSeek-R1reinforcement learning-based fine-tuningGroup Relative Policy Optimization (GRPO)visual in-context reasoningvision foundation modelsDINO seriesDINO-R1Group Relative Query Optimization (GRQO)KL-regularizationobjectness distributionGrounding-DINOvisual prompt encodervisual-guided query selection mechanismCOCOLVISODinWopen-vocabularyclosed-set visual prompting

Abstract

The recent explosive interest in the reasoning capabilities of large language models, such as DeepSeek-R1, has demonstrated remarkable success through reinforcement learning-based fine-tuning frameworks, exemplified by methods like Group Relative Policy Optimization (GRPO). However, such reasoning abilities remain underexplored and notably absent in vision foundation models, including representation models like the DINO series. In this work, we propose DINO-R1, the first such attempt to incentivize visual in-context reasoning capabilities of vision foundation models using reinforcement learning. Specifically, DINO-R1 introduces Group Relative Query Optimization (GRQO), a novel reinforcement-style training strategy explicitly designed for query-based representation models, which computes query-level rewards based on group-normalized alignment quality. We also apply KL-regularization to stabilize the objectness distribution to reduce the training instability. This joint optimization enables dense and expressive supervision across queries while mitigating overfitting and distributional drift. Building upon Grounding-DINO, we train a series of DINO-R1 family models that integrate a visual prompt encoder and a visual-guided query selection mechanism. Extensive experiments on COCO, LVIS, and ODinW demonstrate that DINO-R1 significantly outperforms supervised fine-tuning baselines, achieving strong generalization in both open-vocabulary and closed-set visual prompting scenarios.

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号
DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models | TensorX