Hugging Face Daily Papers·· 2 天前AI 评分60
论文提出 Sharpening Tax 衡量 LLM 后训练带来的测试时扩展性损失
Sharpening Tax in Post-Training
AI 导读
arXiv:2610.01509 提出 Sharpening Tax,用于量化 LLM 在 RL 后训练后测试时扩展性和解法覆盖率的损失。研究发现,配备轻量推理 harness 的预训练 LLM 可作为有效 Agent,虽然 pass@1 较低,但在足够测试时预算下常在 pass@K 上超过后训练模型。
来源:Hugging Face Daily Papers · arxiv.org