TensorX

Explore · 每周精选

发现最受关注的研究论文,追踪研究趋势,订阅感兴趣的期刊与关键词。

403 篇论文 · 按点赞排序

242

PaLI-3 Vision Language Models: Smaller, Faster, Stronger

Xi Chen, Xiao Wang, Lucas Beyer +16 authors

PaLI-3, a smaller vision language model, outperforms larger models on multimodal tasks, particularly localization and text understanding, using SigLIP pretraining and achieves state-of-the-art results in multilingual cross-modal retrieval.

29Vision TransformerSigLIPHF ↗arXiv ↗
244

Learning From Mistakes Makes LLM Better Reasoner

Shengnan An, Zexiong Ma, Zeqi Lin +3 authors

LeMa, a learning-from-mistakes approach, enhances LLMs' mathematical reasoning by learning from inaccurate reasoning paths corrected by GPT-4, surpassing SOTA performance on math problems.

29Large language modelsLearning from MistakesHF ↗arXiv ↗
251

AudioSR: Versatile Audio Super-resolution at Scale

Haohe Liu, Ke Chen, Qiao Tian +2 authors

A diffusion-based generative model, AudioSR, achieves robust audio super-resolution across various audio types and bandwidths, enhancing generation quality for different audio models.

28diffusion-based generative modelaudio super-resolutionHF ↗arXiv ↗
256

MotionGPT: Human Motion as a Foreign Language

Biao Jiang, Xin Chen, Wen Liu +3 authors

MotionGPT, a unified motion-language model using discrete vector quantization, achieves top performance in various motion-related tasks by treating motion as a language similar to text.

28discrete vector quantizationmotion tokensHF ↗arXiv ↗
259

CogVLM: Visual Expert for Pretrained Language Models

Weihan Wang, Qingsong Lv, Wenmeng Yu +13 authors

CogVLM, a visual language foundation model, uses a trainable visual expert module to deeply integrate vision and language without compromising NLP performance.

28visual language foundation modelshallow alignment methodHF ↗arXiv ↗
262

LIMA: Less Is More for Alignment

Chunting Zhou, Pengfei Liu, Puxin Xu +12 authors

A 65B parameter LLaMa language model trained with minimal instructional data matches or outperforms models with extensive human preference modeling in most cases, indicating that pretraining is predominantly responsible for knowledge acquisition.

27large language modelsunsupervised pretrainingHF ↗arXiv ↗
265

HallusionBench: You See What You Think? Or You Think What You See? An Image-Context Reasoning Benchmark Challenging for GPT-4V(ision), LLaVA-1.5, and Other Multi-modality Models

Fuxiao Liu, Tianrui Guan, Zongxia Li +4 authors

HallusionBench is a benchmark that highlights language hallucination and visual illusion issues in vision-language models (VLMs), showcasing the limitations of current state-of-the-art models like GPT-4V and LLaVA-1.5.

27Large language modelsvision modelsHF ↗arXiv ↗
268

DreamTuner: Single Image is Enough for Subject-Driven Generation

Miao Hua, Jiawei Liu, Fei Ding +3 authors

DreamTurner uses a novel approach by injecting reference information through subject encoders and self-subject-attention layers to enhance subject-driven image generation, balancing subject learning and model capabilities.

27diffusion-based modelstext-to-image generationHF ↗arXiv ↗
9 / 14

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号