Hugging Face Daily Papers·· 2 天前AI 评分43
PanoVLN:迈向有效的全景视觉语言导航
PanoVLN: Towards Effective Panoramic Vision-and-Language Navigation
AI 导读
PanoVLN提出面向全景观测的视觉语言导航方法,针对直接用全景图替换透视图收益有限的问题,改造动作预测、训练监督和视觉表示。其CGE策略动态决定重规划前执行多少预测动作,并结合RGB全景的语义与几何特征,不增加visual tokens。在4B backbone和RGB-only输入下,PanoVLN在R2R-CE和RxR-CE Val-Unseen成功率较此前SOTA高11.9%和8.7%。
来源:Hugging Face Daily Papers · arxiv.org