TensorX

Explore · 每周精选

发现最受关注的研究论文,追踪研究趋势,订阅感兴趣的期刊与关键词。

Jun 9 – Jun 15, 2025

50 篇论文 · 按点赞排序

31

Image Reconstruction as a Tool for Feature Analysis

Eduard Allakhverdov, Dmitrii Tarasov, Elizaveta Goncharova +1 authors

Image reconstruction reveals that vision encoders retain more image information after image-based tasks and that orthogonal rotations in feature space control color encoding.

29SigLIPSigLIP2HF ↗arXiv ↗
36

Seeing Voices: Generating A-Roll Video from Audio with Mirage

Aditi Sundararaman, Amogh Adishesha, Andrew Jaegle +10 authors

Mirage generates realistic video from audio inputs, integrating with speech synthesis to create compelling multimodal content through a unified, self-attention-based training approach.

26audio-to-video foundation modelself-attention-based audio-to-video generation modelsHF ↗arXiv ↗
37

Fine-Grained Perturbation Guidance via Attention Head Selection

Donghoon Ahn, Jiwon Kang, Sanghyun Lee +7 authors

The paper proposes HeadHunter, a systematic framework for selecting attention heads in Diffusion Transformer architectures to enable precise control over image generation quality and style, outperforming existing methods.

25diffusion modelsattention perturbationHF ↗arXiv ↗
42

Resa: Transparent Reasoning Models via SAEs

Shangshang Wang, Julian Asilis, Ömer Faruk Akgül +4 authors

SAE-Tuning efficiently elicits strong reasoning in language models by leveraging sparse autoencoders, enabling cost-effective performance gains without extensive retraining.

22sparse autoencoder tuningSAE-TuningHF ↗arXiv ↗
44

Vision Transformers Don't Need Trained Registers

Nick Jiang, Amil Dravid, Alexei Efros +1 authors

A training-free method shifts high-norm activations in Vision Transformers to an untrained token, enhancing attention maps and performance across visual tasks, and improving interpretability in vision-language models.

22Vision Transformershigh-norm tokensHF ↗arXiv ↗
46

Build the web for agents, not agents for the web

Xing Han Lù, Gaurav Kamath, Marius Mosbach +1 authors

A new Agentic Web Interface (AWI) design paradigm is proposed to optimize web agents for navigating websites, focusing on safety, efficiency, and standardization to address fundamental interface mismatches.

21Large Language ModelsmultimodalHF ↗arXiv ↗
2 / 2

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号