跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分48

Agent Error Dataset:用于失败分析和错误感知后训练的 50,000 个错误-诊断对

Agent Error Dataset: Scaling 50,000 Error--Diagnosis Pairs for Failure Analysis and Error-Aware Post-Training

AI 导读

Agent Error Dataset (AED) 汇集 50,228 个文本式 LLM agent 错误-诊断对,覆盖 9,961 个源任务和 33 个环境。AET 在 3,062 个匹配回放对中将 verifier 通过率从 18.4% 提至 51.1%;微调 Qwen3-8B 后,943 例 holdout 的 exact-step agreement 从 47.2% 升至 63.6%。

来源:Hugging Face Daily Papers · arxiv.org