热点事件观察中
VA-Bench评测空间智能断层
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
2026年10月5日,机器之心报道了 VA-Bench 对 12 个多模态模型的评测。该评测以观察、推理、行动、修正的闭环方式测试模型空间智能表现。结果显示,模型在目标识别和操作语义方面接近满分,但完整任务成功率约为一半。其中,Qwen3.8-max、Opus-5 和 GPT-5.6-sol 的完整任务成功率分别为 53.93%、52.86% 和 51.55%。报道还称,模型的错误发现得分高于在线修正能力,反映出从“看懂”到“执行”之间存在断层。
AI 根据报道生成 · 1 小时前更新
最新进展10月5日 11:43
VA-Bench测试显示12个多模态模型完整任务成功率约一半。报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- 机器之心(公众号 · Wechat2RSS)VA-Bench 评测 12 个多模态模型,揭示空间智能从看懂到执行的断层
VA-Bench 以观察、推理、行动、修正闭环测试 12 个多模态模型,显示目标识别和操作语义接近满分,但完整任务成功率约一半。Qwen3.8-max、Opus-5 和 GPT-5.6-sol 的完整任务成功率分别为 53.93%、52.86%和 51.55%,错误发现得分高于在线修正。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。