Hugging Face Daily Papers·· 2 天前AI 评分40
LLM 泛化是稳定性而非准确率:多轴评估研究
Generalization Is Stability, Not Accuracy: Multi-Axis Evaluation of LLMs
AI 导读
这项研究将 LLM 泛化定义为同一输入不同表述下输出的语义稳定性,而非单一提示或任务上的汇总准确率。研究提出 SAGO,从生成一致性、内部激活、置信度和响应镜像等维度衡量行为变化。结果显示常用模型普遍存在显著泛化不稳定性,且跨数据集变化会逆转模型排名。
来源:Hugging Face Daily Papers · arxiv.org