跳到正文
原文
Hugging Face Daily Papers·· 4 天前AI 评分44

模型在何处改变主意:用于可验证奖励高效强化学习的 Hindsight-Divergence Localization

Where the Model Changes Its Mind: Hindsight-Divergence Localization for Efficient Reinforcement Learning with Verifiable Rewards

AI 导读

Hindsight-Divergence Localization(HDL)用事后 token log-likelihood 变化选择分支点,以降低 RLVR 中完整轨迹采样成本。

来源:Hugging Face Daily Papers · arxiv.org