TensorX

Explore · 每周精选

发现最受关注的研究论文,追踪研究趋势,订阅感兴趣的期刊与关键词。

Jul 8 – Jul 14, 2024
本周最热82

Vision language models are blind

Pooyan Rahmanzadehgervi, Logan Bolton, Mohammad Reza Taesiri +1 authors

State-of-the-art large language models with vision capabilities perform poorly on simple visual tasks, indicating limitations in their visual understanding.

large language modelsvision capabilitiesVLMsGPT-4oHF ↗arXiv ↗

50 篇论文 · 按点赞排序

02

PaliGemma: A versatile 3B VLM for transfer

Lucas Beyer, Andreas Steiner, André Susano Pinto +32 authors

PaliGemma, a versatile Vision-Language Model based on SigLIP-So400m and Gemma-2B, demonstrates strong performance across numerous open-world tasks, including specialized areas like remote sensing and segmentation.

73Vision-Language ModelSigLIP-So400mHF ↗arXiv ↗
04

Unveiling Encoder-Free Vision-Language Models

Haiwen Diao, Yufeng Cui, Xiaotong Li +3 authors

EVE is an encoder-free vision-language model that achieves competitive performance on multiple benchmarks using a unified decoder and extra supervision.

53vision-language modelsVLMsHF ↗arXiv ↗
08

Video Diffusion Alignment via Reward Gradients

Mihir Prabhudesai, Russell Mendonca, Zheyang Qin +2 authors

Utilizing pre-trained reward models to adapt video diffusion models with gradient-based feedback enhances efficiency and performance compared to gradient-free methods.

48video diffusion modelspre-trained reward modelsHF ↗arXiv ↗
13

Associative Recurrent Memory Transformer

Ivan Rodkin, Yuri Kuratov, Aydar Bulatov +1 authors

The Associative Recurrent Memory Transformer effectively handles long sequences by combining transformer self-attention with segment-level recurrence, achieving high accuracy in long-context tasks like BABILong.

35transformer self-attentionsegment-level recurrenceHF ↗arXiv ↗
18

MAVIS: Mathematical Visual Instruction Tuning

Renrui Zhang, Xinyu Wei, Dongzhi Jiang +9 authors

The paper introduces MAVIS, a comprehensive framework for improving the visual mathematics problem-solving capabilities of multi-modal large language models through tailored datasets and specialized training stages.

31multi-modal large language modelsmathematical problem-solvingHF ↗arXiv ↗
24

ChartGemma: Visual Instruction-tuning for Chart Reasoning in the Wild

Ahmed Masry, Megh Thakkar, Aayush Bajaj +3 authors

ChartGemma, a novel chart understanding model, outperforms existing methods by training directly on chart images and using a vision-language backbone, achieving state-of-the-art results in summarization, question answering, and fact-checking tasks.

24PaliGemmavision-language backboneHF ↗arXiv ↗
25

Self-Recognition in Language Models

Tim R. Davidson, Viacheslav Surkov, Veniamin Veselovsky +3 authors

A study assesses self-recognition in language models using model-generated security questions, revealing no evidence of self-recognition and emphasizing models' preference for the "best" answer.

23language modelsself-recognitionHF ↗arXiv ↗
1 / 2

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号