跳到正文
热点事件观察中

VA-Bench评测空间智能断层

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

2026年10月5日,机器之心报道了 VA-Bench 对 12 个多模态模型的评测。该评测以观察、推理、行动、修正的闭环方式测试模型空间智能表现。结果显示,模型在目标识别和操作语义方面接近满分,但完整任务成功率约为一半。其中,Qwen3.8-max、Opus-5 和 GPT-5.6-sol 的完整任务成功率分别为 53.93%、52.86% 和 51.55%。报道还称,模型的错误发现得分高于在线修正能力,反映出从“看懂”到“执行”之间存在断层。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. 机器之心(公众号 · Wechat2RSS)
    VA-Bench 评测 12 个多模态模型,揭示空间智能从看懂到执行的断层

    VA-Bench 以观察、推理、行动、修正闭环测试 12 个多模态模型,显示目标识别和操作语义接近满分,但完整任务成功率约一半。Qwen3.8-max、Opus-5 和 GPT-5.6-sol 的完整任务成功率分别为 53.93%、52.86%和 51.55%,错误发现得分高于在线修正。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。