跳到正文
原文
Hugging Face Daily Papers·· 1 天前AI 评分48

LLM Agents 在知识冲突下的认知谦逊评估:准确但不谦逊

Accurate but Not Humble: Evaluating Epistemic Humility in LLM Agents under Knowledge Conflict

AI 导读

这项研究提出用认知谦逊(EH)评估 LLM Agents 在知识冲突中是否识别、处理并表达不确定性。研究以 Identify、Solve、Escalate(ISE)三个轨迹级行为维度评估四个 agents,发现更高任务准确率不一定带来更高 EH。模型级干预可改善 EH,但常以任务准确率下降为代价。

来源:Hugging Face Daily Papers · arxiv.org