Hugging Face Daily Papers·· 2 天前AI 评分41
Q-Learning with Scalar Adjoint Matching:用于流策略微调的 SQAM 方法
Q-Learning with Scalar Adjoint Matching
AI 导读
Q-Learning with Scalar Adjoint Matching(SQAM)用闭式标量伴随替代逐步 vector--Jacobian product,以更低成本微调流策略。SQAM 在四个最难的 OGBench 域上成功率比最强基线高 18 到 35 个百分点,并在真实双臂机器人上的三个任务中优于 supervised fine-tuning。
来源:Hugging Face Daily Papers · arxiv.org