TensorX

Explore · 每周精选

发现最受关注的研究论文,追踪研究趋势,订阅感兴趣的期刊与关键词。

Sep 29 – Oct 5, 2025

50 篇论文 · 按点赞排序

32

Sequential Diffusion Language Models

Yangzhou Liu, Yue Cao, Hao Li +13 authors

Sequential Diffusion Language Model (SDLM) enhances pre-trained autoregressive language models by adaptively determining generation length and maintaining KV-cache compatibility, achieving high efficiency and throughput.

48diffusion language modelsfixed-length decodingHF ↗arXiv ↗
33

Beyond the Exploration-Exploitation Trade-off: A Hidden State Approach for LLM Reasoning in RLVR

Fanding Huang, Guanbo Huang, Xiao Fan +7 authors

Re-examining the exploration-exploitation trade-off in Reinforcement Learning for Verifiable Rewards through hidden-state analysis reveals opportunities for simultaneous enhancement using Effective Rank and its derivatives, leading to improved performance in diverse benchmarks.

47Reinforcement Learning for Verifiable Rewardsexploration-exploitation trade-offHF ↗arXiv ↗
34

RLP: Reinforcement as a Pretraining Objective

Ali Hatamizadeh, Syeda Nahida Akter, Shrimai Prabhumoye +5 authors

RLP, an information-driven reinforcement pretraining objective, enhances reasoning models by integrating exploration into pretraining, leading to significant performance improvements across various benchmarks.

47reinforcement learningpre-trainingHF ↗arXiv ↗
39

Democratizing AI scientists using ToolUniverse

Shanghua Gao, Richard Zhu, Pengwei Sui +8 authors

ToolUniverse is an ecosystem that standardizes and integrates tools, models, and data for AI scientists, enabling automated refinement, creation, and composition of workflows.

40AI scientistsToolUniverseHF ↗arXiv ↗
42

Visual Jigsaw Post-Training Improves MLLMs

Penghao Wu, Yushan Zhang, Haiwen Diao +3 authors

Visual Jigsaw, a self-supervised reinforcement learning framework, enhances multimodal large language models' visual understanding through a permutation task without additional annotations or generative components.

37reinforcement learningpost-trainingHF ↗arXiv ↗
50

ModernVBERT: Towards Smaller Visual Document Retrievers

Paul Teiletche, Quentin Macé, Max Conti +4 authors

ModernVBERT, a compact vision-language encoder, outperforms larger models in document retrieval by optimizing attention masking, image resolution, modality alignment, and contrastive objectives.

33multimodal embedding modelsdocument retrievalHF ↗arXiv ↗
2 / 2

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号