TensorX

Explore · 每周精选

发现最受关注的研究论文,追踪研究趋势,订阅感兴趣的期刊与关键词。

Jul 6 – Jul 12, 2026
本周最热171

The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning

Jing Liang, Hongyao Tang, Yi Ma +9 authors

Training-inference mismatch in reinforcement learning for large language models leads to instability, which is addressed through a new policy optimization objective and framework that ensures consistent policy improvements between training and inference phases.

reinforcement learninglarge language modelstraining-inference mismatchoff-policyHF ↗arXiv ↗

50 篇论文 · 按点赞排序

03

RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation

Haoyu Zhao, Xingyue Zhao, Siteng Huang +3 authors

A multi-modal 4D world model generates synchronized RGB, depth, and optical flow data from single RGB-D images and language instructions, enabling efficient robotic manipulation through unified diffusion processes and inverse dynamics policy learning.

96RGB-DFdiffusion modelsHF ↗arXiv ↗
05

Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning

Chen Tang, Yizhou Wang, Jianyu Wu +26 authors

SciReasoner is a multimodal scientific foundation model that enables interpretable structural reasoning across proteins, molecules, and crystals by discretizing structural elements into a unified vocabulary for enhanced prediction and scientific inference.

90multimodal scientific foundation modelstructural reasoningHF ↗arXiv ↗
07

Gemma 4 Technical Report

Gemma Team, Sherif El Abd, Vaibhav Aggarwal +298 authors

Gemma 4 introduces efficient, multimodal language models with diverse architectures, enhanced reasoning capabilities, and improved performance across various tasks.

83Mixture-of-Experts architecturesvision encodersHF ↗arXiv ↗浏览 Blog
09

OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers

Siyuan Li, Jiabao Pan, Yumou Liu +9 authors

OmniOpt presents a unified framework for optimizer selection in large-scale model training by combining meta-pipeline transformations, norm-constrained linear minimization oracles, and a cross-domain benchmark to systematically analyze optimizer families and their trade-offs across different training objectives and model scales.

78optimizer selectionlarge-scale model trainingHF ↗arXiv ↗
18

DataComp-VLM: Improved Open Datasets for Vision-Language Models

Matteo Farina, Vishaal Udandarao, Thao Nguyen +33 authors

DataComp for VLMs (DCVLM) establishes a comprehensive benchmark for evaluating data curation strategies in vision-language models, demonstrating that data mixing rather than filtering significantly improves model performance at scale.

56Vision-Language Modelsdata curationHF ↗arXiv ↗
20

Vision as Unified Multimodal Generation

Xiaoyang Han, Jianhua Li, Kewang Deng +14 authors

A unified multimodal model formulates computer vision tasks as generation problems using natural language and visual prompts, achieving performance comparable to specialized systems across diverse vision tasks.

50multimodal generationunified multimodal modelHF ↗arXiv ↗
22

MANCE: Manifold Aware Concept Erasure

Matan Avitan, Yoav Goldberg, Yanai Elazar

Manifold constraint hypothesis enables improved concept erasure by projecting updates onto estimated representation manifolds, achieving state-of-the-art results in nonlinear concept removal.

49concept erasuremanifold constraint hypothesisHF ↗arXiv ↗
23

Infinite Worlds with Versatile Interactions

Zelin Gao, Qiuyu Wang, Jiapeng Zhu +17 authors

An advanced world modeling system with extended interaction capabilities, real-time processing, diverse interactive elements, and multi-agent behavior control for collaborative virtual environments.

47causal pretraining paradigmreal-time variantHF ↗arXiv ↗
24

Vision Pretraining for Dense Spatial Perception

Zelin Fu, Bin Tan, Changjiang Sun +6 authors

Boundary modeling enables dense spatial perception by learning sub-pixel representations that enhance depth estimation and support embodied AI applications.

45boundary modelingmasked boundary modelingHF ↗arXiv ↗
25

Wan-Streamer v0.2: Higher Resolution, Same Latency

Lianghua Huang, Zhi-Fan Wu, Yupeng Shi +23 authors

Wan-Streamer v0.2 enhances audio-visual interaction by increasing visual resolution while maintaining low latency through optimized thinker-performer architecture with multi-GPU parallel processing.

45streaming perceptionTransformerHF ↗arXiv ↗
29

GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation

GigaWorld Team, Angyuan Ma, Boyuan Wang +24 authors

World models for robotic policy evaluation are systematically studied through a new benchmark, revealing that long-horizon rollout consistency and robot-specific controllability are more important than short-term visual realism for reliable policy assessment.

41world modelsrobotic policiesHF ↗arXiv ↗
1 / 2

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号