Cognition 推出 FrontierCode 代码质量评测基准
Cognition 推出 FrontierCode,用于评测模型是否能达到高质量生产代码库的标准,核心关注 PR 是否会被维护者合并。该基准由 20+ 开源维护者构建任务,每个任务投入超过 40 hours,包含 150 个任务,并声称相比 SWE-Bench Pro 假阳性率低 81%。
推荐理由:原文把代码评测从功能正确扩展到可合并质量,可用于比较模型在生产代码场景中的短板。
Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。
Cognition 推出 FrontierCode,用于评测模型是否能达到高质量生产代码库的标准,核心关注 PR 是否会被维护者合并。该基准由 20+ 开源维护者构建任务,每个任务投入超过 40 hours,包含 150 个任务,并声称相比 SWE-Bench Pro 假阳性率低 81%。
推荐理由:原文把代码评测从功能正确扩展到可合并质量,可用于比较模型在生产代码场景中的短板。
Tessl 用同一套技能评测比较 Opus 4.7 与 Opus 4.8,约850个场景各跑两次,二者总体分数接近,分别为 91.9 和 92.1。Opus 4.8 在平均任务中用 15.0 轮完成,而 Opus 4.7 为 19.2 轮,轮次减少 21%,在输出 tokens 更多的情况下成本约低 5%,完整性标记也从 10.2% 降到 7.9%。
推荐理由:文章用约850个场景的成对评测展示,模型总分相近时仍可能在轮次、成本和领域表现上分化。
Tessl 将 Claude Opus 4.8 加入持续进行的模型基准测试,它在带 skill context 的评测中得分 95%,超过 Opus 4.7 1.6 分,超过 Cursor Composer 2.5 Fast 2.3 分。
推荐理由:原文同时给出准确率、baseline、评审一致性和耗时,便于比较高准确率与低吞吐之间的取舍。
Tessl 将其平台 eval harness 的默认 solver model 从 Claude Sonnet 4.6 改为 GLM 5.1,用于所有在平台上运行 evals 的默认配置。
推荐理由:文章把默认模型切换和自测数据放在一起,提供了区分模型评估与技能评估的成本取舍思路。
Anthropic 在 Claude Managed Agents 中推出 self-hosted sandboxes 和 MCP tunnels,让智能体可在企业控制的沙盒中运行工具,并连接私有网络内的 MCP servers。
推荐理由:材料说明了执行环境和私有服务连接的边界,适合评估企业智能体落地的安全架构。
Claude Managed Agents 以研究预览推出 dreaming,并向开发者开放 outcomes、多智能体编排和 webhooks。dreaming 会定期回顾 agent sessions 和 memory stores,提取模式并整理记忆;outcomes 让开发者用 rubric 定义成功标准,由单独 grader 评估并推动智能体重试。
推荐理由:原文列出 dreaming、outcomes 与多智能体编排的机制和测试数据,便于评估托管智能体的适用场景。
Claude Managed Agents 的内置记忆功能已在 Claude Platform 开放 public beta,让 agents 可从每次会话中学习。
推荐理由:文章具体说明了文件化记忆、权限和审计设计,可用于评估企业智能体的跨会话学习方案。
Claude 扩展 connectors,新增连接 AllTrails、Instacart、Audible、Tripadvisor、Intuit TurboTax 等日常应用。
推荐理由:原文列出新增生活类应用和权限控制方式,可帮助判断 Claude 连接器从办公扩展到日常场景的影响。
Cognition 宣布 Devin Agent Preview 接入 Claude Sonnet 4.5,并称该模型从今天起可在 Devin 中使用。Cognition 表示,在 Devin 上 Claude Sonnet 4.5 将规划性能提高 18%、端到端评测分数提高 12%,是自 Claude Sonnet 3.6 发布以来该团队看到的最大提升。
推荐理由:原文披露了 Sonnet 4.5 接入 Devin 后的评测变化,可用于观察编码模型对智能体工作流的影响。
Cognition 为 Claude Sonnet 4.5 重建了 Devin,新版本速度提升 2x,在 Junior Developer Evals 上提升 12%,现已在 Agent Preview 可用,旧版 Devin 仍可选择。
推荐理由:文章披露了 Devin 适配 Sonnet 4.5 的工程取舍,可参考其上下文管理和并行工具调用经验。
SemiAnalysis 认为,AWS 可能通过 Anthropic 合作和多 GW Trainium 数据中心扩张迎来 AI 复苏。文章称 Anthropic 年化收入在 2025 年内增长 5 倍至 $5B,AWS 有 3 个园区处于建设最后阶段,合计超过 1.3GW IT capacity,专门服务 Anthropic 训练需求。
推荐理由:文章把云收入、数据中心建设和芯片 TCO 放在一起,提供了理解 AWS 押注 Anthropic 的背景。