TensorX

Explore · 每周精选

发现最受关注的研究论文,追踪研究趋势,订阅感兴趣的期刊与关键词。

Mar 18 – Mar 24, 2024

50 篇论文 · 按点赞排序

34

LightIt: Illumination Modeling and Control for Diffusion Models

Peter Kocsis, Julien Philip, Kalyan Sunkavalli +2 authors

LightIt, a method for controllable illumination in image generation, uses shading and normal maps to produce high-quality images with consistent lighting, achieving results comparable to specialized relighting techniques.

18shading estimationcontrol networkHF ↗arXiv ↗
35

MusicHiFi: Fast High-Fidelity Stereo Vocoding

Ge Zhu, Juan-Pablo Caceres, Zhiyao Duan +1 authors

MusicHiFi is an efficient high-fidelity stereophonic vocoder using a cascade of GANs to improve audio quality and spatialization control.

17diffusion-based audiomusic generation modelsHF ↗arXiv ↗
36

MyVLM: Personalizing VLMs for User-Specific Queries

Yuval Alaluf, Elad Richardson, Sergey Tulyakov +2 authors

External concept heads augment VLMs to integrate user-specific concepts into image captioning and question-answering, demonstrating generalization to unseen images.

16large-scale vision-language modelsVLMsHF ↗arXiv ↗
42

DiPaCo: Distributed Path Composition

Arthur Douillard, Qixuan Feng, Andrei A. Rusu +7 authors

A modular architecture and training approach, DiPaCo, improves large-scale neural network training by distributing computation and optimizing communication across heterogeneous workers, achieving performance exceeding a billion-parameter dense transformer.

14DIstributed PAth COmposition (DiPaCo)Local-SGD inspired optimization (DiLoCo)HF ↗arXiv ↗
44

Reverse Training to Nurse the Reversal Curse

Olga Golovneva, Zeyuan Allen-Zhu, Jason Weston +1 authors

Reverse training enhances LLM performance on reversal tasks by doubling the training data through forward and reverse direction training while preserving entities.

13Large language modelsReversal CurseHF ↗arXiv ↗
46

Explorative Inbetweening of Time and Space

Haiwen Feng, Zheng Ding, Zhihao Xia +4 authors

Time Reversal Fusion enables video generation by fusing forward and backward denoising paths conditioned on start and end frames, outperforming existing methods in generating smooth, complex motions, and 3D-consistent views.

12bounded generationimage-to-video modelHF ↗arXiv ↗
49

Chart-based Reasoning: Transferring Capabilities from LLMs to VLMs

Victor Carbune, Hassan Mansoor, Fangyu Liu +4 authors

A method transfers reasoning capabilities from large-language models to vision-language models, achieving state-of-the-art performance on ChartQA and superior performance on PlotQA and FigureQA by enhancing chart representation and training with a larger, synthesized dataset and multitask loss.

12vision-language modelslarge-language modelsHF ↗arXiv ↗
2 / 2

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号