跳到正文
热点事件观察中

SpaceCast-Bench基准发布

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

2026年10月8日,Hugging Face Daily Papers 报道 SpaceCast-Bench 发布。该基准用于评估视觉语言模型的预测性空间推理能力,包含 182 个真实场景中的 3,862 个问题,覆盖 16 类任务。报道显示,研究对 21 个模型进行了评测,最强模型得分为 58.0%,低于人类表现 87.2%。报道还称,对 Qwen3-VL-4B 进行微调后,其成绩从 34.0% 提升到 65.7%。目前报道仅披露了该基准的任务规模、评测结果以及微调带来的性能提升。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. Hugging Face Daily Papers
    SpaceCast-Bench:评估视觉语言模型的预测性空间推理能力

    SpaceCast-Bench 是一个评估视觉语言模型预测性空间推理能力的 benchmark,包含 182 个真实场景的 3,862 个问题,覆盖 16 类任务。21 个模型评测显示,最强模型仅达 58.0%,低于人类 87.2%;对 Qwen3-VL-4B 微调后,成绩从 34.0% 提升到 65.7%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。