TensorX

Explore · 每周精选

发现最受关注的研究论文,追踪研究趋势,订阅感兴趣的期刊与关键词。

Jun 8 – Jun 14, 2026

50 篇论文 · 按点赞排序

33

CoVEBench: Can Video Editing Models Handle Complex Instructions?

Jiangtao Wu, Jiaming Wang, Yiwen He +7 authors

A new benchmark called CoVEBench is introduced to evaluate compositional video editing capabilities, addressing limitations of existing models in handling complex, multi-step editing tasks while preserving spatiotemporal content.

53text-guided video editingcompositional editingHF ↗arXiv ↗
34

GENEB: Why Genomic Models Are Hard to Compare

Daria Ledneva, Mikhail Nuridinov, Denis Kuznetsov

GENEB presents a comprehensive benchmark for evaluating genomic foundation models across diverse tasks and architectures under a unified protocol.

50genomic foundation modelsdiagnostic benchmarkHF ↗arXiv ↗
36

MMAE: A Massive Multitask Audio Editing Benchmark

Ziyang Ma, Ruiqi Yan, Ruiyang Xu +35 authors

MMAE presents a comprehensive benchmark for instruction-based audio editing across multiple modalities and complexity levels, revealing significant gaps in current model capabilities.

46Multitask Audio Editinginstruction-based editingHF ↗arXiv ↗
42

Human Psychometric Questionnaires Mischaracterize LLM Behavior

Woojung Song, Dongmin Choi, Yoonah Park +3 authors

Human psychometric questionnaires fail to reliably predict LLM behavior in real-world interactions, while generation-based profiling offers superior accuracy for understanding model responses to everyday user queries.

36LLMspsychometric questionnairesHF ↗arXiv ↗
43

Rethinking the Divergence Regularization in LLM RL

Jiarui Yao, Xiangxin Zhou, Penghui Qi +3 authors

DRPO improves LLM reinforcement learning stability by replacing hard masks with smooth regularization that provides continuous gradient corrections beyond trust-region boundaries.

34reinforcement learninglarge language modelsHF ↗arXiv ↗
44

EurekAgent: Agent Environment Engineering is All You Need For Autonomous Scientific Discovery

Amy Xin, Jiening Siow, Junjie Wang +5 authors

Environment engineering enhances autonomous scientific discovery by designing structured agent environments that optimize behaviors like exploration and collaboration while mitigating issues such as reward hacking and human oversight friction, as demonstrated by the EurekAgent system that achieves state-of-the-art results across multiple domains with low computational costs.

33environment engineeringautonomous scientific discoveryHF ↗arXiv ↗
46

WorldOlympiad: Can Your World Model Survive a Triathlon?

Yuke Zhao, Wangbo Zhao, Weijie Wang +8 authors

WorldOlympiad presents a comprehensive benchmark for evaluating video-based world models across physical faithfulness, geometric consistency, and interaction fidelity, revealing significant gaps in current generative models' capabilities.

33world modelsvideo generationHF ↗arXiv ↗
47

Echo-Memory: A Controlled Study of Memory in Action World Models

Wayne King, Zeyue Xue, Yuxuan Bian +13 authors

Controlled study of memory mechanisms in action-conditioned world models reveals that memory structure and capacity significantly impact open-domain return performance beyond simple replay fidelity measures.

33action-conditioned world modelsvideo diffusion backboneHF ↗arXiv ↗
48

HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers

Guozhen Zhang, Xuerui Qiu, Yutao Cui +11 authors

HYDRA-X presents a unified multimodal model that integrates image and video tokenization within a single Vision Transformer, addressing spatiotemporal reconstruction and semantic awareness through causal temporal attention and hierarchical compression.

31Vision Transformerspatiotemporal reconstructionHF ↗arXiv ↗
50

Robots Need More than VLA and World Models

Elis Karcini, Faisal Mehrban, Quang Nguyen +6 authors

Robot intelligence advancement requires integrating unstructured behavioral data through specialized interfaces for labeling, embodiment mapping, world modeling, and reward inference rather than relying solely on policy scaling.

31Vision-Language-Action modelsrobot demonstrationsHF ↗arXiv ↗
2 / 2

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号