Hugging Face Daily Papers·· 1 天前AI 评分48
LLM Agents 在知识冲突下的认知谦逊评估:准确但不谦逊
Accurate but Not Humble: Evaluating Epistemic Humility in LLM Agents under Knowledge Conflict
AI 导读
这项研究提出用认知谦逊(EH)评估 LLM Agents 在知识冲突中是否识别、处理并表达不确定性。研究以 Identify、Solve、Escalate(ISE)三个轨迹级行为维度评估四个 agents,发现更高任务准确率不一定带来更高 EH。模型级干预可改善 EH,但常以任务准确率下降为代价。
来源:Hugging Face Daily Papers · arxiv.org