跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分41

通过位置选择性自蒸馏从语言反馈训练 LLM 评判器

Training LLM Judges from Language Feedback via Position-Selective Self-Distillation

AI 导读

研究提出用位置选择性自蒸馏从自然语言反馈训练 LLM 评判器,以改善主观任务中的评价标准选择与加权。方法基于教师与学生的逐位置 entropy shift,屏蔽较高 entropy-shift 位置以提升分布外泛化。实验中,自蒸馏评判器在主观子类别上比 outcome-supervised RL 高 2-9 个百分点,并在客观类别上保持竞争力。

来源:Hugging Face Daily Papers · arxiv.org