Hugging Face Daily Papers·· 4 天前AI 评分44
模型在何处改变主意:用于可验证奖励高效强化学习的 Hindsight-Divergence Localization
Where the Model Changes Its Mind: Hindsight-Divergence Localization for Efficient Reinforcement Learning with Verifiable Rewards
AI 导读
Hindsight-Divergence Localization(HDL)用事后 token log-likelihood 变化选择分支点,以降低 RLVR 中完整轨迹采样成本。
来源:Hugging Face Daily Papers · arxiv.org