跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分39

无需搜索的锐化:序列级幂分布的在策略蒸馏

Sharpen Without Search: On-Policy Distillation of Sequence-Level Power Distribution

AI 导读

OPPD 将序列级幂分布蒸馏进模型,使其无需多候选搜索即可单次生成更高准确答案。在 MATH500 和 GSM8K 上,相同温度下较未训练模型最高提升 23.0 和 27.3 points;相比同 checkpoint 和预算的 GRPO,在 MATH500、GSM8K、AIME 上高 3.8、4.0、5.4 points。

来源:Hugging Face Daily Papers · arxiv.org