TensorX

Explore · 每周精选

发现最受关注的研究论文,追踪研究趋势,订阅感兴趣的期刊与关键词。

Apr 8 – Apr 14, 2024

50 篇论文 · 按点赞排序

33

BRAVE: Broadening the visual encoding of vision-language models

Oğuzhan Fatih Kar, Alessio Tonioni, Petra Poklukar +3 authors

BRAVE consolidates features from multiple vision encoders to improve VLM performance on captioning and VQA tasks, addressing visual encoding limitations with reduced parameters and compressed representation.

20vision-language modelsVLMsHF ↗arXiv ↗
34

Adapting LLaMA Decoder to Vision Transformer

Jiahao Wang, Wenqi Shao, Mengzhao Chen +6 authors

A decoder-only Transformer model, LLaMA, is adapted for computer vision tasks through architectural modifications, achieving performance comparable to encoder-only models with fewer parameters and improved attention mechanisms.

19decoder-only TransformersLLaMAHF ↗arXiv ↗
35

CodecLM: Aligning Language Models with Tailored Synthetic Data

Zifeng Wang, Chun-Liang Li, Vincent Perot +5 authors

CodecLM is a framework that utilizes LLMs to generate high-quality, aligned synthetic data for instruction-following tasks, improving adaptability and performance across various LLMs and instruction distributions.

18instruction tuninglarge language models (LLMs)HF ↗arXiv ↗
37

YaART: Yet Another ART Rendering Technology

Sergey Kastryulin, Artem Konev, Alexander Shishenya +20 authors

YaART, a text-to-image cascaded diffusion model enhanced with RLHF, achieves high-quality image generation efficiently and outperforms existing state-of-the-art models in user evaluations.

17text-to-image diffusion systemscascaded diffusion modelHF ↗arXiv ↗
38

MuPT: A Generative Symbolic Music Pretrained Transformer

Xingwei Qu, Yuelin Bai, Yinghao Ma +26 authors

Large Language Models are adapted for music pre-training using ABC Notation instead of MIDI, leading to enhanced musical composition through synchronized multi-track handling and exploration of the Symbolic Music Scaling Law.

16Large Language ModelsLLMsHF ↗arXiv ↗
40

Social Skill Training with Large Language Models

Diyi Yang, Caleb Ziems, William Held +3 authors

This perspective paper proposes using large language models to create an AI Partner and AI Mentor framework for social skill training, integrating experiential learning with personalized feedback to address barriers in workforce development and social equality.

15large language modelsAI PartnerHF ↗arXiv ↗
44

Aligning Diffusion Models by Optimizing Human Utility

Shufan Li, Konstantinos Kallidromitis, Akash Gokul +2 authors

Diffusion-KTO fine-tunes text-to-image diffusion models using per-image binary feedback, enhancing performance in both human and automatic evaluations.

14Diffusion-KTOtext-to-image diffusion modelsHF ↗arXiv ↗
45

Sparse Laneformer

Ji Liu, Zifeng Zhang, Mingjie Lu +7 authors

A transformer-based lane detection framework using sparse anchors outperforms state-of-the-art methods with fewer computations.

13transformer-basedlane detectionHF ↗arXiv ↗
46

SambaLingo: Teaching Large Language Models New Languages

Zoltan Csaki, Bo Li, Jonathan Li +7 authors

This investigation explores comprehensive techniques for adapting large language models to new languages, addressing vocabulary extension, preference optimization, and data scarcity issues across multiple languages and model sizes.

13vocabulary extensiondirect preference optimizationHF ↗arXiv ↗
2 / 2

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号