Hugging Face Daily Papers·· 2 天前AI 评分41
通过位置选择性自蒸馏从语言反馈训练 LLM 评判器
Training LLM Judges from Language Feedback via Position-Selective Self-Distillation
AI 导读
研究提出用位置选择性自蒸馏从自然语言反馈训练 LLM 评判器,以改善主观任务中的评价标准选择与加权。方法基于教师与学生的逐位置 entropy shift,屏蔽较高 entropy-shift 位置以提升分布外泛化。实验中,自蒸馏评判器在主观子类别上比 outcome-supervised RL 高 2-9 个百分点,并在客观类别上保持竞争力。
来源:Hugging Face Daily Papers · arxiv.org