TensorX
返回文献探索

Paper · arXiv 2408.03326

LLaVA-OneVision: Easy Visual Task Transfer

Bo Li, Yuanhan Zhang, Dong Guo, Renrui Zhang, Feng Li, Hao Zhang, Kaichen Zhang, Yanwei Li, Ziwei Liu, Chunyuan Li

61 upvotesAugust 6, 2024arXiv 预印本
AI 摘要

LLaVA-OneVision is a unified multimodal model that advances performance across single-image, multi-image, and video scenarios with strong transfer learning capabilities.

multimodal modelsLMMsLLaVA-OneVisionsingle-imagemulti-imagevideo scenariostransfer learningvideo understandingcross-scenario capabilitiestask transfer

Abstract

We present LLaVA-OneVision, a family of open large multimodal models (LMMs) developed by consolidating our insights into data, models, and visual representations in the LLaVA-NeXT blog series. Our experimental results demonstrate that LLaVA-OneVision is the first single model that can simultaneously push the performance boundaries of open LMMs in three important computer vision scenarios: single-image, multi-image, and video scenarios. Importantly, the design of LLaVA-OneVision allows strong transfer learning across different modalities/scenarios, yielding new emerging capabilities. In particular, strong video understanding and cross-scenario capabilities are demonstrated through task transfer from images to videos.

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号