热点事件观察中
SpaceCast-Bench基准发布
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
2026年10月8日,Hugging Face Daily Papers 报道 SpaceCast-Bench 发布。该基准用于评估视觉语言模型的预测性空间推理能力,包含 182 个真实场景中的 3,862 个问题,覆盖 16 类任务。报道显示,研究对 21 个模型进行了评测,最强模型得分为 58.0%,低于人类表现 87.2%。报道还称,对 Qwen3-VL-4B 进行微调后,其成绩从 34.0% 提升到 65.7%。目前报道仅披露了该基准的任务规模、评测结果以及微调带来的性能提升。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 08:00
SpaceCast-Bench发布并公布21个模型评测结果。报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- Hugging Face Daily PapersSpaceCast-Bench:评估视觉语言模型的预测性空间推理能力
SpaceCast-Bench 是一个评估视觉语言模型预测性空间推理能力的 benchmark,包含 182 个真实场景的 3,862 个问题,覆盖 16 类任务。21 个模型评测显示,最强模型仅达 58.0%,低于人类 87.2%;对 Qwen3-VL-4B 微调后,成绩从 34.0% 提升到 65.7%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。