跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分40

LLM 泛化是稳定性而非准确率:多轴评估研究

Generalization Is Stability, Not Accuracy: Multi-Axis Evaluation of LLMs

AI 导读

这项研究将 LLM 泛化定义为同一输入不同表述下输出的语义稳定性,而非单一提示或任务上的汇总准确率。研究提出 SAGO,从生成一致性、内部激活、置信度和响应镜像等维度衡量行为变化。结果显示常用模型普遍存在显著泛化不稳定性,且跨数据集变化会逆转模型排名。

来源:Hugging Face Daily Papers · arxiv.org