Hugging Face Daily Papers·· 2 天前AI 评分44
ROSS:通过选择性监督从自生成 Rollouts 中重新学习
ROSS: Relearning from Self-Generated Rollouts through Selective Supervision
AI 导读
ROSS 保留完整历史轨迹作为上下文,仅对选定的模型生成续写施加损失,用于从自生成 rollouts 中再学习。其在 Qwen3.6-35B-A3B 上将六项 MOPD 平均分从 58.40% 提至 62.20%,SWE-bench Verified 从 64.20% 提至 68.40%,且无需额外 policy rollouts。
来源:Hugging Face Daily Papers · arxiv.org