TensorX

Explore · 每周精选

发现最受关注的研究论文,追踪研究趋势,订阅感兴趣的期刊与关键词。

Sep 2 – Sep 8, 2024
本周最热97

Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency

Jianwen Jiang, Chao Liang, Jiaqi Yang +3 authors

An audio-only conditioned video diffusion model, Loopy, improves natural and high-quality human video generation without auxiliary spatial signals.

diffusion-based video generationaudio-conditionedhuman video generationmotionHF ↗arXiv ↗

50 篇论文 · 按点赞排序

05

OLMoE: Open Mixture-of-Experts Language Models

Niklas Muennighoff, Luca Soldaini, Dirk Groeneveld +21 authors

A sparse Mixture-of-Experts language model with 7 billion parameters achieves superior performance by using only 1 billion parameters per input token and outperforms larger models in various experiments.

81sparse Mixture-of-ExpertsOLMoE-1B-7BHF ↗arXiv ↗
06

Kvasir-VQA: A Text-Image Pair GI Tract Dataset

Sushant Gautam, Andrea Storås, Cise Midoglu +4 authors

Kvasir-VQA is a dataset with question-and-answer annotations for GI diagnostics, supporting image captioning, VQA, synthetic image generation, object detection, and classification.

71Visual Question Answering (VQA)image captioningHF ↗arXiv ↗
16

LinFusion: 1 GPU, 1 Minute, 16K Image

Songhua Liu, Weihao Yu, Zhenxiong Tan +1 authors

A novel linear attention mechanism, named LinFusion, is introduced to enhance high-resolution image generation with reduced computational cost, offering performance comparable to or better than existing diffusion models.

34diffusion modelsTransformer-based UNetHF ↗arXiv ↗
17

FLUX that Plays Music

Zhengcong Fei, Mingyuan Fan, Changqian Yu +1 authors

FluxMusic extends diffusion-based rectified flow Transformers to generate music from text by transforming it into a latent VAE space of mel-spectra and using text encoders and modulations for enhanced semantic capture.

33diffusion-based rectified flowTransformersHF ↗arXiv ↗
24

Affordance-based Robot Manipulation with Flow Matching

Fan Zhang, Michael Gienger

A framework for assistive robot manipulation uses parameter-efficient prompt tuning and supervised Flow Matching to learn manipulation affordances and robot trajectories in daily living scenarios.

20parameter-efficient prompt tuningprompt tuningHF ↗arXiv ↗
25

Diffusion Policy Policy Optimization

Allen Z. Ren, Justin Lidard, Lars L. Ankile +6 authors

DPPO, a policy gradient method for fine-tuning diffusion-based policies, outperforms other RL methods in continuous control and robot learning tasks, offering stable training, robust policies, and effective zero-shot deployment.

20Diffusion Policy Policy OptimizationDPPOHF ↗arXiv ↗
29

Building Math Agents with Multi-Turn Iterative Preference Learning

Wei Xiong, Chengshuai Shi, Jiaming Shen +10 authors

A multi-turn direct preference learning framework, incorporating feedback from code interpreters, enhances large language models' mathematical problem-solving capabilities with substantial performance improvements.

16large language modelsChain-of-Thought reasoningHF ↗arXiv ↗
30

Compositional 3D-aware Video Generation with LLM Director

Hanxin Zhu, Tianyu He, Anni Tang +3 authors

A novel text-to-video generation method decomposes concepts into 3D representations using LLMs, composes them with multi-modal LLM guidance, and refines with 2D diffusion models to produce high-fidelity videos with controlled motion and flexibility.

15generative modelslarge-scale internet dataHF ↗arXiv ↗
1 / 2

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号