Hugging Face Daily Papers·· 1 天前AI 评分33
重新思考跨 tokenizer On-Policy Distillation:从对齐覆盖到监督可靠性
Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability
AI 导读
跨 tokenizer On-Policy Distillation 中,严格 1:1 对齐已覆盖大多数学生模型生成 token,扩大对齐覆盖不一定提升学习。在 3 组异构教师—学生模型的数学推理和代码生成实验中,仅用共享词表 top-16 子集的 reverse KL 可达到接近完整共享词表 OPD 的准确率。
来源:Hugging Face Daily Papers · arxiv.org