跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分44

ROSS:通过选择性监督从自生成 Rollouts 中重新学习

ROSS: Relearning from Self-Generated Rollouts through Selective Supervision

AI 导读

ROSS 保留完整历史轨迹作为上下文,仅对选定的模型生成续写施加损失,用于从自生成 rollouts 中再学习。其在 Qwen3.6-35B-A3B 上将六项 MOPD 平均分从 58.40% 提至 62.20%,SWE-bench Verified 从 64.20% 提至 68.40%,且无需额外 policy rollouts。

来源:Hugging Face Daily Papers · arxiv.org