TensorX

Explore · 每周精选

发现最受关注的研究论文,追踪研究趋势,订阅感兴趣的期刊与关键词。

Dec 8 – Dec 14, 2025

50 篇论文 · 按点赞排序

32

Stronger Normalization-Free Transformers

Mingzhi Chen, Taiming Lu, Jiachen Zhu +2 authors

Derf, a novel point-wise normalization function, outperforms existing alternatives across various domains, enhancing generalization without increased fitting capacity.

25Dynamic Tanhpoint-wise functionsHF ↗arXiv ↗
34

Relational Visual Similarity

Thao Nguyen, Sicheng Mo, Krishna Kumar Singh +6 authors

Vision-Language models fine-tuned on anonymized image captions can capture relational similarity between images, a capability lacking in current visual similarity metrics.

25relational similarityperceptual attribute similarityHF ↗arXiv ↗
36

LongCat-Image Technical Report

Meituan LongCat Team, Hanghang Ma, Haoxian Tan +10 authors

LongCat-Image is a bilingual open-source foundation model for image generation that addresses multilingual text rendering, photorealism, and deployment efficiency through rigorous data curation, compact design, and comprehensive open-source support.

25foundation modelimage generationHF ↗arXiv ↗
40

Thinking with Images via Self-Calling Agent

Wenxi Yang, Yuzhong Zhao, Fang Wan +1 authors

sCoT, a language-only CoT paradigm with self-calling subagents, enhances visual reasoning performance and efficiency through group-relative policy optimization.

23Chain-of-ThoughtCoTHF ↗arXiv ↗
45

Self-Improving VLM Judges Without Human Annotations

Inna Wanyin Lin, Yushi Hu, Shuyue Stella Li +5 authors

A framework for self-training a Vision-Language Model (VLM) judge using self-synthesized data improves judge accuracy on VL-RewardBench, surpassing larger models in several dimensions.

21Vision-Language ModelsVLM judgesHF ↗arXiv ↗
46

Evaluating Gemini Robotics Policies in a Veo World Simulator

Gemini Robotics Team, Coline Devin, Yilun Du +18 authors

A generative evaluation system using a frontier video model (Veo) enables comprehensive policy evaluation in robotics, including nominal performance, out-of-distribution generalization, and safety checks.

20generative world modelsvideo modelsHF ↗arXiv ↗
47

Rethinking Chain-of-Thought Reasoning for Videos

Yiwu Zhong, Zi-Yuan Hu, Yin Li +1 authors

Efficient video reasoning can be achieved using concise chains of thought and reduced visual tokens without manual annotations or supervised fine-tuning.

19chain-of-thoughtmultimodal large language modelsHF ↗arXiv ↗
50

Arbitrage: Efficient Reasoning via Advantage-Aware Speculation

Monishwaran Maheswaran, Rishabh Tiwari, Yuezhou Hu +8 authors

Arbitrage is a dynamic routing framework for speculative decoding that improves efficiency in large language model inference by predicting when the target model will provide a better step, outperforming traditional step-level methods.

17Speculative Decodingdraft modelHF ↗arXiv ↗
2 / 2

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号