TensorX

Explore · 每周精选

发现最受关注的研究论文,追踪研究趋势,订阅感兴趣的期刊与关键词。

Jan 15 – Jan 21, 2024
本周最热156

Self-Rewarding Language Models

Weizhe Yuan, Richard Yuanzhe Pang, Kyunghyun Cho +3 authors

A study on Self-Rewarding Language Models shows that using LLM-as-a-Judge prompting for iterative DPO training enhances both instruction-following and self-reward generation, leading to superior performance compared to existing systems.

Self-Rewarding Language ModelsLLM-as-a-JudgeIterative DPO trainingAlpacaEval 2.0HF ↗arXiv ↗

31 篇论文 · 按点赞排序

04

VMamba: Visual State Space Model

Yue Liu, Yunjie Tian, Yuzhong Zhao +5 authors

VMamba, a novel state space model architecture, combines global receptive fields and dynamic weights from ViTs with linear complexity, outperforming established models as image resolution increases.

39Convolutional Neural NetworksVision TransformersHF ↗arXiv ↗
06

Scalable Pre-training of Large Autoregressive Image Models

Alaaeldin El-Nouby, Michal Klein, Shuangfei Zhai +5 authors

Autoregressive pre-training for vision models (AIM) scales similarly to LLMs, showing improved performance with more data and parameters, and does not exhibit performance saturation.

37autoregressive objectivevision modelsHF ↗arXiv ↗
08

ReFT: Reasoning with Reinforced Fine-Tuning

Trung Quoc Luong, Xinbo Zhang, Zhanming Jie +3 authors

Reinforced Fine-Tuning (ReFT) improves the generalizability of large language models in reasoning tasks like math problem-solving by using reinforcement learning to learn from multiple reasoning paths.

32Supervised Fine-TuningChain-of-ThoughtHF ↗arXiv ↗
09

DiffusionGPT: LLM-Driven Text-to-Image Generation System

Jie Qin, Jie Wu, Weifeng Chen +6 authors

DiffusionGPT combines Large Language Models with diffusion models and Trees-of-Thought to handle diverse prompts and integrate domain-expert models, demonstrating superior image synthesis performance across various domains.

30diffusion modelsLarge Language ModelsHF ↗arXiv ↗
11

Tuning Language Models by Proxy

Alisa Liu, Xiaochuang Han, Yizhong Wang +3 authors

Proxy-tuning, a lightweight decoding-time algorithm, customizes large language models efficiently using smaller LMs without accessing their weights, achieving competitive performance and better factual truthfulness.

22proxy-tuningdecoding-time algorithmHF ↗arXiv ↗
12

GARField: Group Anything with Radiance Fields

Chung Min Kim, Mingxuan Wu, Justin Kerr +3 authors

GARField extracts semantically meaningful hierarchical groupings from 3D scenes using scale-conditioned 3D affinity feature fields derived from 2D masks.

20scale-conditioned 3D affinity feature fieldGroup Anything with Radiance Fields (GARField)HF ↗arXiv ↗
14

Improving fine-grained understanding in image-text pre-training

Ioana Bica, Anastasija Ilić, Matthias Bauer +8 authors

SPARC pretrains fine-grained multimodal representations using sparse contrastive alignment, improving both global and local information in vision-language models and enhancing performance on classification and region-level tasks.

19SPARCfine-grained multimodal representationsHF ↗arXiv ↗
17

UniVG: Towards UNIfied-modal Video Generation

Ludan Ruan, Lei Tian, Chuanwei Huang +2 authors

The Unified-modal Video Generation system uses Multi-condition Cross Attention and Biased Gaussian Noise to handle diverse video generation tasks across text and image modalities, achieving superior performance on benchmarks.

17diffusion based video generationUnified-modal Video GenerationHF ↗arXiv ↗
18

Extending LLMs' Context Window with 100 Samples

Yikai Zhang, Junlong Li, Pengfei Liu

A novel extension to rotary position embedding, adjusted by modifying the base frequency and scaling attention logits, enhances LLMs' context window efficiently and robustly across various tasks.

16rotary position embeddingattention entropyHF ↗arXiv ↗
20

Towards A Better Metric for Text-to-Video Generation

Jay Zhangjie Wu, Guian Fang, Haoning Wu +11 authors

A new metric, T2VScore, is introduced to evaluate text-to-video generation by combining text-video alignment and video quality, addressing the limitations of current automated metrics.

15generative modelstext-to-video modelsHF ↗arXiv ↗
23

Quantum Denoising Diffusion Models

Michael Kölle, Gerhard Stenzel, Jonas Stein +3 authors

Quantum diffusion models address sampling speed and parameter requirements in classical diffusion models by using variational quantum circuits, demonstrating superior performance and one-step image generation.

14quantum machine learningvariational quantum circuitsHF ↗arXiv ↗
24

FreGrad: Lightweight and Fast Frequency-aware Diffusion Vocoder

Tan Dat Nguyen, Ji-Hoon Kim, Youngjoon Jang +2 authors

FreGrad is a lightweight and fast diffusion-based vocoder that uses discrete wavelet transform for simplified feature representation, frequency-aware dilated convolution for improved frequency accuracy, and optimization techniques to achieve faster training and inference while maintaining audio quality.

13diffusion-based vocoderdiscrete wavelet transformHF ↗arXiv ↗
1 / 2

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号