Hugging Face Daily Papers·· 3 天前AI 评分48
Sherpa:教 LLM 自适应教学
Sherpa: Teaching LLMs to Teach Adaptively
AI 导读
Sherpa 是一个多轮强化学习框架,用不同学习偏好的 LLM 模拟学生原型,训练教师模型直接最大化学习效果。经 Sherpa 训练的教师 LLM 让学生表现平均提升 20.5 个百分点,在 MathTutorBench 上将总体教学分数从 52.5% 提高到 79.2%。人类研究中,训练后的教师在 79.6% 的成对比较里优于基座模型,代码和模型已可用。
来源:Hugging Face Daily Papers · arxiv.org