跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分41

Q-Learning with Scalar Adjoint Matching:用于流策略微调的 SQAM 方法

Q-Learning with Scalar Adjoint Matching

AI 导读

Q-Learning with Scalar Adjoint Matching(SQAM)用闭式标量伴随替代逐步 vector--Jacobian product,以更低成本微调流策略。SQAM 在四个最难的 OGBench 域上成功率比最强基线高 18 到 35 个百分点,并在真实双臂机器人上的三个任务中优于 supervised fine-tuning。

来源:Hugging Face Daily Papers · arxiv.org