Self-Consistency Preference Optimization
Archiki Prasad, Weizhe Yuan, Richard Yuanzhe Pang +6 authors
Self-consistency preference optimization (ScPO) enhances model training by iteratively preferring consistent answers, improving performance on reasoning tasks and outperforming larger models on specific benchmarks.