跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 21–31 条 · 共 31 条
9月25日周五
9月22日周二
  1. METR Notes66

    METR 发布 Claude Opus 5.5 预部署评估摘要

    METR 发布了 Claude Opus 5.5 预部署评估摘要,重点考察其对 Anthropic AI R&D 的潜在加速影响。评估基于 10 business days 的 API 访问、五项任务测试、Anthropic 问卷与访谈,以及另一项 METR 内部 AI R&D 加速评估的结论。

    推荐理由:报告把模型能力测试与研发加速问题分开处理,可帮助读者理解预部署评估如何约束能力叙事和风险判断。

9月16日周三
  1. Claude Blog82

    Claude 将 Cowork 与聊天合并,并推出 Docs 和 Slides

    Claude Cowork 和聊天从今天起合并为一个 Claude,Claude 会根据任务需要在对话中调用 Cowork 和 Design 能力。该功能将在未来几周先面向 Pro 和 Max 计划推出,之后扩展到更多计划;Claude Docs 和 Claude Slides 同日上线,Claude Design 也可在对话中使用。

    推荐理由:原文把 Cowork、Design 与聊天合并的可用范围讲清楚,可帮助判断 Claude 工作流入口的变化。

9月15日周二
9月4日周五
  1. Anthropic Research90

    Anthropic 称 Claude 生成 Fermat’s Last Theorem 的首个完整计算机校验证明

    Anthropic 称 Claude 在 11 天内基本自主地用 Lean 写出了 Fermat’s Last Theorem 的首个端到端计算机校验证明。该证明包含 13 million 行 Lean,过程中证明 30,300 个定理,最终证明使用 29,500 个中间定理,并由 Lean 校验。

    推荐理由:材料呈现 Claude 与 Prove2Me 形式化大型数学定理的流程,可参考其多智能体分工方式。

8月31日周一
  1. METR Notes76

    METR 更新安全事件,API key 被盗与公开端点暴露未发现敏感信息被访问

    METR 披露今年早些时候两起外部安全事件,经与安全顾问调查,认为两起事件均未有敏感信息被访问。3 月,一名研究员公开部署的个人 EC2 实例因认证失效暴露,攻击者诱导 Agent 泄露公共模型 API key,并消耗约 $600,000 的免费授信 API credits。

    推荐理由:披露了评测机构遭遇 API key 泄露和端点暴露的处置过程,可为敏感模型访问管理提供参照。

8月26日周三
  1. Claude Blog85

    Claude in Chrome 面向所有付费 Claude 计划开放并支持自主浏览器操作

    Claude in Chrome 现已面向所有付费 Claude 计划正式可用,并可在浏览器中自主执行部分操作,不再需要每一步都获批。它能查看当前页面,使用现有登录状态阅读和输入文本、点击链接、页面跳转和填写表单,安全分类器会在操作执行前检查其是否安全并符合用户请求。

    推荐理由:原文同时给出浏览器自动操作范围、提示注入防护和企业管理入口,便于判断落地边界。

8月25日周二
  1. zai-org · Hugging Face 新模型80

    zai-org 发布 GLM-5.3-Flash,GLM-5 系列首个原生多模态模型

    zai-org 发布 GLM-5.3-Flash,称其为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 激活参数。官方称它在基准和真实工作负载中超过 GLM-5.2,价格为其十分之一,并在编码和智能体基准上接近 Claude Opus 4.8。

    推荐理由:原文同时给出参数规模、架构变化和本地部署框架,便于比较其成本与落地路径。

7月31日周五
  1. meituan-longcat · Hugging Face 新模型70

    美团 LongCat 发布 LongCat-Flash-Lite-Sparse 稀疏 MoE 模型

    美团 LongCat 在 Hugging Face 发布 LongCat-Flash-Lite-Sparse,这是基于 LongCat-Flash-Lite 的非思考 MoE 模型,拥有 69B 总参数、每 token 约 3B 激活参数,并原生支持最高 1M tokens 上下文。

    推荐理由:原文同时给出架构改动、长上下文设定和多项基准,便于比较稀疏版与密集前代的取舍。

4月27日周一
4月14日周二
  1. moonshotai · Hugging Face 新模型83

    Moonshot AI 开源 Kimi-K2.6 原生多模态智能体模型

    Moonshot AI 在 Hugging Face 发布 Kimi-K2.6,这是开源的原生多模态智能体模型。该模型采用 MoE 架构,Total Parameters 1T、Activated Parameters 32B、Context Length 256K,支持长周期编码、coding-driven design、Agent Swarm、图像和视频输入。

    推荐理由:原文同时给出模型结构、评测表和部署入口,便于对比其在编码与智能体任务中的定位。