TensorX

Explore · 每周精选

发现最受关注的研究论文,追踪研究趋势,订阅感兴趣的期刊与关键词。

Jul 13 – Jul 19, 2026
本周最热235

Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable

Ruhan Wang, Yucheng Shi, Zongxia Li +7 authors

The Harness Handbook and Behavior-Guided Progressive Disclosure automatically map agent behaviors to source code, improving localization and edit planning for evolving AI harnesses.

Harness Handbookbehavior-centric representationstatic analysisLLM-assisted structuringHF ↗arXiv ↗

50 篇论文 · 按点赞排序

04

Weak-to-Strong Generalization via Direct On-Policy Distillation

Shiyuan Feng, Huan-ang Gao, Haohan Chi +7 authors

Direct On-Policy Distillation transfers reinforcement learning improvements from smaller to larger models by using the policy shift induced by RL as an implicit reward signal, enabling efficient scaling of training without re-running expensive RL on the target model.

150reinforcement learningverifiable rewardsHF ↗arXiv ↗
08

ABot-N1: Toward a General Visual Language Navigation Foundation Model

Ruiyan Gong, Yingnan Guo, Junjun Hu +43 authors

ABot-N1 improves visual language navigation by separating reasoning from control through a slow-fast architecture that uses explicit chain-of-thought reasoning and pixel goals to guide continuous waypoint generation, achieving strong results across diverse embodied tasks.

103Visual Language NavigationChain-of-Thought reasoningHF ↗arXiv ↗
10

Video Generation Models are General-Purpose Vision Learners

Letian Wang, Chuhan Zhang, Rishabh Kabra +9 authors

GenCeption uses a video generative diffusion backbone to build a generalist vision model that achieves strong performance across diverse perception tasks with high data efficiency and emergent generalization.

90text-to-video generationgenerative diffusionHF ↗arXiv ↗
15

MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

Yuliang Liu, Zhang Li, Ziyang Zhang +11 authors

MonkeyOCRv2 is a document-oriented visual-text pretrained encoder that improves performance across document analysis and multimodal document understanding tasks while using a much smaller vision backbone.

81visual-text pretrainingdocument-image pretrainingHF ↗arXiv ↗
20

OvisOCR2 Technical Report

Shiyin Lu, Yinglun Li, Yu Xia +10 authors

OvisOCR2 is a compact end-to-end document parsing model that uses supervised fine-tuning, reinforcement learning, and distillation to generate structured Markdown from document images with state-of-the-art accuracy.

56supervised fine-tuningreinforcement learningHF ↗arXiv ↗
21

4D Human-Scene Reconstruction from Low-Overlap Captures

Minhyuk Hwang, Sangmin Kim, Seunguk Do +2 authors

StudioRecon reconstructs dynamic human scenes from sparse cameras by separating background and human reconstruction, using synthesized views and deformable Gaussian initialization with consistency refinement.

554D reconstructionvideo diffusion modelsHF ↗arXiv ↗
23

LightMem-Ego: Your AI Memory for Everyday Life

Yijun Chen, Boyi Xiao, Yixian Zhao +10 authors

LightMem-Ego is a lightweight streaming multimodal memory system that organizes continuous egocentric visual and audio data into hierarchical memory levels to support real-time retrieval and personalized assistance on mobile and wearable devices.

50multimodal memoryegocentric visual and audio streamsHF ↗arXiv ↗
30

Trust Region Policy Distillation

Zhengpeng Xie, Li Lyna Zhang, Zeke Xie +1 authors

Trust Region Policy Distillation stabilizes on-policy distillation via a proximal teacher, reducing gradient variance and improving convergence for mathematical reasoning tasks without extra computation.

37Trust Region Policy DistillationOn-Policy DistillationHF ↗arXiv ↗
1 / 2

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号