TensorX

Explore · 每周精选

发现最受关注的研究论文,追踪研究趋势,订阅感兴趣的期刊与关键词。

50 篇论文 · 按点赞排序

31

MagicVideo-V2: Multi-Stage High-Aesthetic Video Generation

Weimin Wang, Jiawei Liu, Zhijie Lin +9 authors

MagicVideo-V2 generates high-fidelity and smooth videos from text using an integrated pipeline that includes text-to-image, video motion generation, and frame interpolation modules, outperforming existing systems in user evaluations.

49text-to-imagevideo motion generatorHF ↗arXiv ↗
32

Weaver: Foundation Models for Creative Writing

Tiannan Wang, Jiamin Chen, Qingrui Jia +43 authors

Weaver, a family of specialized large language models, achieves superior writing capabilities through pre-training and fine-tuning methods, surpasses GPT-4 in various writing tasks, and supports retrieval-augmented generation and tool usage.

46large language modelspre-trainingHF ↗arXiv ↗
36

VMamba: Visual State Space Model

Yue Liu, Yunjie Tian, Yuzhong Zhao +5 authors

VMamba, a novel state space model architecture, combines global receptive fields and dynamic weights from ViTs with linear complexity, outperforming established models as image resolution increases.

40Convolutional Neural NetworksVision TransformersHF ↗arXiv ↗
38

Transformers are Multi-State RNNs

Matanel Oren, Michael Hassid, Yossi Adi +1 authors

Decoder-only transformers can be conceptualized as finite multi-state RNNs, and a new cache compression technique, TOVA, significantly reduces their computational cost while maintaining high performance.

39transformersrecurrent neural networksHF ↗arXiv ↗
39

Scalable Pre-training of Large Autoregressive Image Models

Alaaeldin El-Nouby, Michal Klein, Shuangfei Zhai +5 authors

Autoregressive pre-training for vision models (AIM) scales similarly to LLMs, showing improved performance with more data and parameters, and does not exhibit performance saturation.

38autoregressive objectivevision modelsHF ↗arXiv ↗
46

LARP: Language-Agent Role Play for Open-World Games

Ming Yan, Ruihao Li, Hao Zhang +3 authors

LARP is a language agent framework for open-world games, incorporating memory and decision-making capabilities to enhance interaction and coherence in a diverse range of applications.

34cognitive architecturememory processingHF ↗arXiv ↗
2 / 2

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号