跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分41

UniEvo-VL:用于多模态模型自我改进的 on-policy 自蒸馏训练方案

UniEvo-VL: An On-policy Self-Distillation Training Recipe for Multimodal Model Self-improvement

AI 导读

UniEvo-VL 提出一种多模态模型自进化框架,用自我批评反馈进行 on-policy 自蒸馏训练。基于开源 Qwen-image-2512,GenEval 从 0.747 提升到 0.808,GenEval2 Soft-TIFA 从 32.97 提升到 35.53。外部批评器 GPT5.6-Luna 的尝试显示,更强评判能力可能对应更高自进化上限。

来源:Hugging Face Daily Papers · arxiv.org