跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 101–118 条 · 共 118 条
5月20日周三
5月19日周二
  1. Claude Blog78

    Claude Managed Agents 推出 dreaming 研究预览,开放 outcomes 与多智能体编排

    Claude Managed Agents 以研究预览推出 dreaming,并向开发者开放 outcomes、多智能体编排和 webhooks。dreaming 会定期回顾 agent sessions 和 memory stores,提取模式并整理记忆;outcomes 让开发者用 rubric 定义成功标准,由单独 grader 评估并推动智能体重试。

    推荐理由:原文列出 dreaming、outcomes 与多智能体编排的机制和测试数据,便于评估托管智能体的适用场景。

5月18日周一
  1. Cognition Blog73

    Cognition 推出 Devin Auto-Triage,用于自动调查告警并生成后续行动

    Cognition 推出 Devin Auto-Triage,Devin 现在可以监控新告警、自动调查,并返回调查结果、后续步骤甚至 PR。它可响应 Slack、Linear、GitHub、日程和 incoming webhooks,检查代码库、可观测性工具、相关 ticket 或 thread,并在需要人工时标记负责人。

    推荐理由:原文展示了 Devin 从告警检测延伸到调查和 PR 的流程,可帮助评估工程值班自动化的边界。

5月13日周三
  1. Cognition Blog63

    Devin 现已支持 Android 模拟器

    Devin 现在可以启动 Android Virtual Device(AVD),支持面向 Android 应用的自主开发。此前 Devin 能处理 Android 代码,但不能在本地 Android 环境中运行和测试应用;新的 Android 模拟器支持让它能在自己的机器上构建和运行 Android 应用,打开应用、检查行为、复现问题并验证更改。

    推荐理由:原文说明了 Devin 从编写 Android 代码扩展到本地运行测试,对移动应用开发流程有直接参考。

5月6日周三
4月30日周四
  1. Google DeepMind68

    Google DeepMind 公布 AI co-clinician 研究计划

    Google DeepMind 公布 AI co-clinician 研究计划,探索在医生临床监督下让 AI agent 与患者互动并辅助照护。研究称,在 98 个现实初级保健查询的客观分析中,AI co-clinician 有 97 个案例记录为零关键错误,并在 OpenFDA 的 RxQA 开放式用药问答上超过可用的前沿模型。

    推荐理由:材料同时覆盖证据检索和远程问诊模拟,可帮助理解医疗 AI 更适合辅助而非替代医生的边界。

4月27日周一
4月23日周四
4月14日周二
  1. moonshotai · Hugging Face 新模型83

    Moonshot AI 开源 Kimi-K2.6 原生多模态智能体模型

    Moonshot AI 在 Hugging Face 发布 Kimi-K2.6,这是开源的原生多模态智能体模型。该模型采用 MoE 架构,Total Parameters 1T、Activated Parameters 32B、Context Length 256K,支持长周期编码、coding-driven design、Agent Swarm、图像和视频输入。

    推荐理由:原文同时给出模型结构、评测表和部署入口,便于对比其在编码与智能体任务中的定位。

4月3日周五
  1. Google DeepMind84

    Google DeepMind 发布 Gemma 4 开放模型家族

    Google DeepMind 发布 Gemma 4 开放模型家族,包含 E2B、E4B、26B MoE 和 31B Dense,面向高级推理和智能体工作流,并采用 Apache 2.0 license。

    推荐理由:原文同时给出模型尺寸、端侧部署方式和生态入口,便于比较开放模型在硬件约束下的能力取舍。

2月27日周五
  1. Cognition Blog70

    Cognition 如何用 Devin 构建 Devin

    Cognition 介绍了内部如何用 Devin 构建 Devin,上周将 659 个 Devin PR 合并进自家代码库,高于 2025 年最好一周的 154 个。

    推荐理由:文章拆解了 Cognition 内部把 Devin 接入 PR、工单、日志和数据分析的工作流,可迁移到工程团队的智能体落地。

11月4日周二
  1. moonshotai · Hugging Face 新模型85

    Moonshot AI 发布 Kimi-K2-Thinking 开源推理模型

    Moonshot AI 发布 Kimi-K2-Thinking,称其为最新、能力最强的开源 thinking model,支持逐步推理并动态调用工具。该模型为 MoE 架构,总参数 1T、激活参数 32B、上下文长度 256K,原生 INT4 量化,称可在低延迟模式下实现无损 2x 加速,并在 200–300 次连续工具调用中保持稳定。

    推荐理由:原文同时给出架构参数、评测设置和部署入口,便于比较开源推理模型的长程工具调用能力。

9月2日周二
  1. Mistral AI65

    Mistral AI 为 Le Chat 推出 Memories beta 和 Memory Insights

    Mistral AI 为 Le Chat 推出 Memories beta,让助手自动保存有用信息,并在调用记忆时显示来源链接、相关性和正在使用的记忆。用户可以随时关闭 Memories、开启不使用记忆的隐身聊天、编辑或删除单条记忆,并导出或从其他地方导入记忆。

    推荐理由:原文说明了 Le Chat 记忆功能的可见性和控制项,可帮助评估长期上下文如何进入助手工作流。

7月30日周三
7月11日周五
  1. moonshotai · Hugging Face 新模型85

    Moonshot AI 发布 Kimi-K2-Instruct,1T 参数 MoE 模型面向 Agent 能力

    Moonshot AI 发布 Kimi-K2-Instruct,这是 Kimi K2 的后训练版本,面向通用聊天和 agentic experiences。Kimi K2 是 MoE 语言模型,拥有 1T 总参数、32B 激活参数、128K 上下文窗口,并在 15.5T tokens 上预训练。

    推荐理由:材料同时给出架构参数、基准对比和部署方式,便于评估 Kimi K2 的编码与工具调用定位。