跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分52

InterEvolve 研究人形机器人 loco-manipulation 的测试时奖励程序演化

InterEvolve: Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation

AI 导读

InterEvolve 研究在人形机器人 loco-manipulation 中进行测试时演化,让控制器在不重新训练的情况下解决未训练过的任务。方法包含 object-aware forward-backward 行为基础模型,以及由 LLM Agent 根据执行反馈和已验证技能库修订的奖励程序,并由数值优化器调参。

来源:Hugging Face Daily Papers · arxiv.org