Hugging Face Daily Papers·· 4 天前AI 评分42
EasyPPO:稳定 critic 是关键
EasyPPO: Stabilizing the Critic Is Key
AI 导读
EasyPPO 针对 LLM 强化学习中 PPO 的 critic 不稳定问题,提出 actor-only overlong filtering、noise-normalized critic regression 和更小的 critic mini-batches。
来源:Hugging Face Daily Papers · arxiv.org