跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分42

CoEvoWhen:用于超长视频时序定位的策略-工具协同进化

CoEvoWhen: Policy-Tool Coevolution for Ultra-Long Video Temporal Grounding

AI 导读

CoEvoWhen 提出策略-工具协同进化框架,从 VLM 的智能体推理轨迹中共同进化高层策略和可执行媒体工具,无需更新模型参数。五个 benchmark、三个 VLM 的实验显示,该方法提升超长视频时序定位准确率并降低推理时视觉 token 成本,进化技能也能迁移到通用长视频 QA。

来源:Hugging Face Daily Papers · arxiv.org