#论文/研究
#论文/研究
今日 0 条
Anthropic@AnthropicAIAI 评分7070
METR Notes精选AI 评分6666 METR 发布 Claude Opus 5.5 预部署评估摘要
METR 发布了 Claude Opus 5.5 预部署评估摘要,重点考察其对 Anthropic AI R&D 的潜在加速影响。评估基于 10 business days 的 API 访问、五项任务测试、Anthropic 问卷与访谈,以及另一项 METR 内部 AI R&D 加速评估的结论。
推荐理由:报告把模型能力测试与研发加速问题分开处理,可帮助读者理解预部署评估如何约束能力叙事和风险判断。