Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model
Lianghui Zhu, Bencheng Liao, Qian Zhang +3 authors
A new vision backbone using bidirectional Mamba blocks (Vim) outperforms established vision transformers like DeiT in terms of performance and efficiency on high-resolution image tasks.