Hugging Face Daily Papers·· 1 天前AI 评分44
SpaceCast-Bench:评估视觉语言模型的预测性空间推理能力
SpaceCast-Bench: Evaluating Predictive Spatial Reasoning in Vision-Language Models
AI 导读
SpaceCast-Bench 是一个评估视觉语言模型预测性空间推理能力的 benchmark,包含 182 个真实场景的 3,862 个问题,覆盖 16 类任务。21 个模型评测显示,最强模型仅达 58.0%,低于人类 87.2%;对 Qwen3-VL-4B 微调后,成绩从 34.0% 提升到 65.7%。
来源:Hugging Face Daily Papers · arxiv.org