Hugging Face Daily Papers·· 2 天前AI 评分46
PivotOPD:学习从多轮智能体的关键错误中恢复
PivotOPD: Learning to Recover from Pivotal Mistakes in Multi-Turn Agents
AI 导读
PivotOPD 是一种 on-policy distillation 框架,在关键错误处用教师 gold action 和后续 recovery action 训练多轮语言智能体预防并恢复错误。
来源:Hugging Face Daily Papers · arxiv.org