跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分60

论文提出 Sharpening Tax 衡量 LLM 后训练带来的测试时扩展性损失

Sharpening Tax in Post-Training

AI 导读

arXiv:2610.01509 提出 Sharpening Tax,用于量化 LLM 在 RL 后训练后测试时扩展性和解法覆盖率的损失。研究发现,配备轻量推理 harness 的预训练 LLM 可作为有效 Agent,虽然 pass@1 较低,但在足够测试时预算下常在 pass@K 上超过后训练模型。

来源:Hugging Face Daily Papers · arxiv.org