MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention
MiniMax, Aili Chen, Aonian Li +124 authors
A hybrid-attention reasoning model called MiniMax-M1, featuring a Mixture-of-Experts architecture and lightning attention mechanism, is introduced for efficient long-input processing and reinforcement learning.