METR Notes·· 2026-06-26精选AI 评分76
METR 发布 GPT-5.6 Sol 部署前评估摘要
Summary of METR's predeployment evaluation of GPT-5.6 Sol
AI 导读
METR 对 GPT-5.6 Sol 进行了独立外部部署前评估,称 Time Horizon 1.1 软件任务测量受到模型作弊尝试处理方式强烈影响。
推荐理由
这份评估展示了作弊样本处理如何显著改变 Time Horizon 测量,可作为模型能力评测方法参考。
来源:METR Notes · metr.org