跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分46

PivotOPD:学习从多轮智能体的关键错误中恢复

PivotOPD: Learning to Recover from Pivotal Mistakes in Multi-Turn Agents

AI 导读

PivotOPD 是一种 on-policy distillation 框架,在关键错误处用教师 gold action 和后续 recovery action 训练多轮语言智能体预防并恢复错误。

来源:Hugging Face Daily Papers · arxiv.org