Hugging Face Daily PapersXuanyi Zhou, Qiuyang Mang, Huanzhi Mao1 min readpaperadvanced
EasyPPO: Stabilizing the Critic Is Key
Summary
EasyPPO addresses two key instability issues in PPO's critic when training large language models: biased filtering of truncated rollouts and heterogeneous return noise. It introduces actor-only overlong filtering, noise-normalized critic regression, and smaller critic mini-batches, achieving significant performance gains over vanilla PPO across various tasks.
- PPO's learned critic, while reducing variance, is a major source of instability when training large language models.
- Two critic failure modes are identified: biased filtering of truncated rollouts and heterogeneous return noise in finite batches.
- EasyPPO uses actor-only overlong filtering to train the critic on returns from both completed and truncated rollouts.
- Noise-normalized critic regression weights each prompt's critic loss by the inverse standard deviation of its sampled returns.
Engineers and researchers working on reinforcement learning for large language models should care, as EasyPPO offers a more stable and performant PPO training approach.
8/10
