TensorX

Explore · 每周精选

发现最受关注的研究论文,追踪研究趋势,订阅感兴趣的期刊与关键词。

May 18 – May 24, 2026
本周最热325

HRM-Text: Efficient Pretraining Beyond Scaling

Guan Wang, Changling Liu, Chenyu Wang +6 authors

A Hierarchical Recurrent Model architecture with specialized training on instruction-response pairs achieves competitive language modeling performance with significantly reduced computational requirements compared to traditional Transformer-based approaches.

Hierarchical Recurrent ModelTransformersdeep recurrenceMagicNormHF ↗arXiv ↗

50 篇论文 · 按点赞排序

03

Code as Agent Harness

Xuying Ning, Katherine Tieu, Dongqi Fu +39 authors

This survey frames code as the operational foundation for agent reasoning, action, and verification, organizing agent harnesses across interface, mechanism, and multi-agent scaling layers.

227agent harnessescode as agent harnessHF ↗arXiv ↗
06

AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration

Jiaqi Liu, Shi Qiu, Mairui Li +32 authors

AutoResearchClaw is a multi-agent autonomous research system that improves scientific discovery through structured debate, self-healing execution, verifiable reporting, human collaboration, and evolutionary learning, outperforming previous systems on a benchmark while maintaining human oversight.

192multi-agent autonomous researchstructured multi-agent debateHF ↗arXiv ↗
09

When Vision Speaks for Sound

Xiaofei Wen, Wenjie Jacky Mo, Xingyu Fu +6 authors

Video-capable multimodal large language models exhibit apparent audio understanding driven by visual cues rather than actual audio processing, necessitating intervention-based frameworks for diagnosing and improving audio-visual alignment.

161video-capable MLLMsaudio-visual Clever Hans effectHF ↗arXiv ↗
11

PhysBrain 1.0 Technical Report

Shijie Lian, Bin Yu, Xiaopeng Lin +10 authors

PhysBrain 1.0 leverages human egocentric video to generate physical commonsense supervision for vision-language-action models, achieving state-of-the-art performance in embodied control tasks through capability-preserving adaptation.

145vision-language-action modelsphysical commonsense supervisionHF ↗arXiv ↗
14

MMSkills: Towards Multimodal Skills for General Visual Agents

Kangning Zhang, Shuai Shao, Qingyao Li +8 authors

Multimodal procedural knowledge frameworks enable visual agents to leverage external reusable skills through structured representations combining text, state cards, and visual keyframes, improving decision-making in complex environments.

124multimodal procedural knowledgevisual agentsHF ↗arXiv ↗
18

Active Learners as Efficient PRP Rerankers

Jeremías Figueiredo Paschmann, Juan Kaplan, Francisco Nattero +3 authors

Pairwise ranking prompting is reformulated as active learning from noisy comparisons, with improved rankers that enhance ranking quality under call constraints and address position bias through a randomized oracle.

98pairwise ranking promptingactive learningHF ↗arXiv ↗
20

OpenComputer: Verifiable Software Worlds for Computer-Use Agents

Jinbiao Wei, Qianran Ma, Yilun Zhao +4 authors

OpenComputer presents a framework for creating verifiable software environments for computer-use agents through integrated state verification, self-improving layers, task synthesis, and evaluation systems across multiple desktop applications.

89verifier-grounded frameworkstate verifiersHF ↗arXiv ↗
22

Lance: Unified Multimodal Modeling by Multi-Task Synergy

Fengyi Fu, Mengqi Huang, Shaojin Wu +10 authors

Lance is a unified multimodal model that combines understanding, generation, and editing capabilities for images and videos through collaborative multi-task training and a dual-stream architecture.

79mixture-of-experts architecturemultimodal understandingHF ↗arXiv ↗
23

AI for Auto-Research: Roadmap & User Guide

Lingdong Kong, Xian Sun, Wei Chow +17 authors

AI systems demonstrate varying reliability across research stages, excelling in structured tasks but struggling with novel ideas and scientific judgment, necessitating human oversight for credible outcomes.

73AI-assisted researchautomated systemsHF ↗arXiv ↗
26

ACC: Compiling Agent Trajectories for Long-Context Training

Qisheng Su, Zhen Fang, Shiting Huang +8 authors

Agent Context Compilation (ACC) enhances long-context reasoning in LLMs by converting multi-turn agent trajectories into structured QA pairs, enabling direct supervision of distant context integration without additional annotation.

62long-context reasoningagent SFTHF ↗arXiv ↗
1 / 2

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号