Hugging Face Daily Papers·· 1 天前AI 评分51
MiMo-V2.6 技术报告提出通过规模化强化学习推进模型自我改进
MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement
AI 导读
Xiaomi LLM-Core Team 在 arXiv 发布 MiMo-V2.6 技术报告,介绍一个通过扩展 RL compute 推进模型自我改进的 omni-modal 模型系列。
来源:Hugging Face Daily Papers · arxiv.org