跳到正文
原文
Hugging Face Daily Papers·· 1 天前AI 评分44

SpaceCast-Bench:评估视觉语言模型的预测性空间推理能力

SpaceCast-Bench: Evaluating Predictive Spatial Reasoning in Vision-Language Models

AI 导读

SpaceCast-Bench 是一个评估视觉语言模型预测性空间推理能力的 benchmark,包含 182 个真实场景的 3,862 个问题,覆盖 16 类任务。21 个模型评测显示,最强模型仅达 58.0%,低于人类 87.2%;对 Qwen3-VL-4B 微调后,成绩从 34.0% 提升到 65.7%。

来源:Hugging Face Daily Papers · arxiv.org