跳到正文
原文
Hugging Face Daily Papers·· 1 天前AI 评分34

RLHND:将视频基础模型用于机器人学习的物理约束手部跟踪器

RLHND: Video Foundation Models as Physically Grounded Hand Trackers for Robot Learning

AI 导读

RLHND 提出基于视频基础模型的手部跟踪方法,可从单目第一视角视频联合估计手部姿态和真实触觉信息。该方法将预训练 Cosmos 3 视频扩散模型主干转为确定性片段级特征提取器,并用独立触觉专家流预测手部表面的密集接触和力。RLHND 在姿态估计、接触和力估计的多个 benchmark 数据集上达到 SOTA,代码将公开。

来源:Hugging Face Daily Papers · arxiv.org