跳到正文
原文
机器之心(公众号 · Wechat2RSS)·· 2 天前AI 评分60

VA-Bench 评测 12 个多模态模型,揭示空间智能从看懂到执行的断层

看懂不等于做对:VA-Bench测出大模型空间智能的执行断层

AI 导读

VA-Bench 以观察、推理、行动、修正闭环测试 12 个多模态模型,显示目标识别和操作语义接近满分,但完整任务成功率约一半。Qwen3.8-max、Opus-5 和 GPT-5.6-sol 的完整任务成功率分别为 53.93%、52.86%和 51.55%,错误发现得分高于在线修正。

来源:机器之心(公众号 · Wechat2RSS) · mp.weixin.qq.com