Hugging Face Daily Papers·· 2 天前AI 评分42
Where-OPD:用合成场景对 MLLM 进行空间引导的 on-policy 自蒸馏
Where-OPD: Spatially Guided On-Policy Self-Distillation of MLLMs with Synthetic Scenes
AI 导读
Where-OPD 提出面向 MLLM 的 on-policy 自蒸馏,让教师模型获得文本化空间引导并训练学生仅凭图像和问题复现行为。该方法用程序生成场景进行免标注后训练,在多个模型的计数、文档和图表理解 benchmark 上持续提升,并在 CVBench、V*、ZoomBench、BLINK、HR-Bench、MME-RealWorld 平均提升 3.23-point。
来源:Hugging Face Daily Papers · arxiv.org