Hugging Face Daily Papers·· 1 天前AI 评分46
工具使用型 AI 智能体如何从证据到行动中失效
From Evidence to Action: How Tool-Using Agents Fail
AI 导读
SafeActBench 评测显示,工具使用型 AI 智能体的失败不只来自信息缺失,也来自决策和执行中对既有证据的使用方式。该基准包含 656 个案例,覆盖 6 个运营领域和 5 类协议;10 种模型-harness 配置中,静态动作评估较强,但交互式执行明显较弱。
来源:Hugging Face Daily Papers · arxiv.org