跳到正文
原文
Hugging Face Daily Papers·· 1 天前AI 评分39

MARGIN:用于多智能体基础模型协作的运行时置信度校准

MARGIN: Runtime Confidence Calibration for Multi-Agent Foundation Model Coordination

AI 导读

MARGIN 通过观测答案结果学习各基础模型的置信度修正,无需重训模型或保留校准集。评测覆盖代码生成、问答和数学,使用 18-model pool,并在分布偏移实验中使用 nine-model subset;在 BigCodeBench 上,模型平均置信度与准确率呈负相关。

来源:Hugging Face Daily Papers · arxiv.org