Group Sequence Policy Optimization
Chujie Zheng, Shixuan Liu, Mingze Li +9 authors
Group Sequence Policy Optimization (GSPO) is a reinforcement learning algorithm that improves training efficiency and performance of large language models by using sequence-level importance ratios and operations.