跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分46

合成非自然语言数据 PPT 可扩展,但并非语法先验

Synthetic Pre-pretraining Survives Scale, but Not as a Grammatical Prior

AI 导读

合成非自然语言数据的 PPT 在更大规模 PT 中仍提升下游性能和 token 效率。研究覆盖 5 个 PPT 任务、4 种 PT 数据混合、500M 至 7B 参数规模和最高 100B tokens,3B 规模至少节省 21B PT tokens。收益未显示稳定来自语法先验,而更可能来自改善长程检索;无网页文本时效果才减弱。

来源:Hugging Face Daily Papers · arxiv.org