跳到正文

Anthropic / Claude

Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。

最新精选

第 61–71 条 · 共 71 条
6月8日周一
  1. Cognition Blog69

    Cognition 推出 FrontierCode 代码质量评测基准

    Cognition 推出 FrontierCode,用于评测模型是否能达到高质量生产代码库的标准,核心关注 PR 是否会被维护者合并。该基准由 20+ 开源维护者构建任务,每个任务投入超过 40 hours,包含 150 个任务,并声称相比 SWE-Bench Pro 假阳性率低 81%。

    推荐理由:原文把代码评测从功能正确扩展到可合并质量,可用于比较模型在生产代码场景中的短板。

5月29日周五
  1. Tessl74

    Tessl 评测 Opus 4.7 与 4.8,4.8 准确率接近但轮次和成本更低

    Tessl 用同一套技能评测比较 Opus 4.7 与 Opus 4.8,约850个场景各跑两次,二者总体分数接近,分别为 91.9 和 92.1。Opus 4.8 在平均任务中用 15.0 轮完成,而 Opus 4.7 为 19.2 轮,轮次减少 21%,在输出 tokens 更多的情况下成本约低 5%,完整性标记也从 10.2% 降到 7.9%。

    推荐理由:文章用约850个场景的成对评测展示,模型总分相近时仍可能在轮次、成本和领域表现上分化。

5月19日周二
  1. Claude Blog78

    Claude Managed Agents 推出 dreaming 研究预览,开放 outcomes 与多智能体编排

    Claude Managed Agents 以研究预览推出 dreaming,并向开发者开放 outcomes、多智能体编排和 webhooks。dreaming 会定期回顾 agent sessions 和 memory stores,提取模式并整理记忆;outcomes 让开发者用 rubric 定义成功标准,由单独 grader 评估并推动智能体重试。

    推荐理由:原文列出 dreaming、outcomes 与多智能体编排的机制和测试数据,便于评估托管智能体的适用场景。

4月23日周四
9月29日周一
  1. Cognition Blog69

    Cognition 发布搭载 Claude Sonnet 4.5 的 Devin Agent Preview

    Cognition 宣布 Devin Agent Preview 接入 Claude Sonnet 4.5,并称该模型从今天起可在 Devin 中使用。Cognition 表示,在 Devin 上 Claude Sonnet 4.5 将规划性能提高 18%、端到端评测分数提高 12%,是自 Claude Sonnet 3.6 发布以来该团队看到的最大提升。

    推荐理由:原文披露了 Sonnet 4.5 接入 Devin 后的评测变化,可用于观察编码模型对智能体工作流的影响。

9月4日周四
  1. SemiAnalysis76

    SemiAnalysis:AWS 与 Anthropic 的多 GW Trainium 扩张推动 Amazon AI 复苏

    SemiAnalysis 认为,AWS 可能通过 Anthropic 合作和多 GW Trainium 数据中心扩张迎来 AI 复苏。文章称 Anthropic 年化收入在 2025 年内增长 5 倍至 $5B,AWS 有 3 个园区处于建设最后阶段,合计超过 1.3GW IT capacity,专门服务 Anthropic 训练需求。

    推荐理由:文章把云收入、数据中心建设和芯片 TCO 放在一起,提供了理解 AWS 押注 Anthropic 的背景。