跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 201–220 条 · 共 290 条
5月29日周五
  1. Cognition Blog65

    Cognition 详解 Devin 的大规模智能体开发验证机制

    Cognition 介绍了 Devin 的端到端云端智能体验证机制,重点是让 Devin 在异步开发中测试自己的改动并返回可审查结果。Devin 会在 test mode 中生成基于源码的测试计划,操作应用、记录截图和断言,并用测试技能中的确定性脚本减少登录等重复流程的耗时和不稳定性。

    推荐理由:原文给出 Devin 测试模式的计划、执行、报告和成本安排,可参考异步编码智能体的工程化路径。

5月28日周四
  1. Mistral AI81

    Mistral 发布统一 AI 智能体 Vibe,覆盖工作与编码任务

    Mistral 发布 Vibe,将 Le Chat 升级为一个覆盖工作与编码的统一 AI 智能体,原有对话、设置和计划会迁移保留。Vibe 提供 Work Mode 和 Code Mode,可处理邮箱与日历跟进、深度研究、文档起草、企业知识搜索、结构化数据分析,以及从功能开发到 pull request 的编码流程。

    推荐理由:原文同时覆盖工作与编码两条使用路径,可帮助判断统一智能体对企业流程和开发协作的影响范围。

  2. Mistral AI69

    Mistral AI 推出 Search Toolkit 公测版,用于构建 AI 应用搜索管线

    Mistral AI 发布 Search Toolkit 公开预览版,这是一个开源、可组合框架,用于为 AI 应用构建生产级搜索管线。它把摄取、检索和评估放在统一接口下,支持云端、本地和边缘运行,并包含文档解析、分块、嵌入生成、BM25、稠密嵌入检索、混合检索以及 recall、precision、MRR、NDCG 等评估指标。

    推荐理由:原文把摄取、检索和评估放进同一框架,适合对比企业 RAG 检索管线的工程取舍。

  3. Tessl66

    Tessl 解析 Agent 工具设计为什么不能只靠提示词约束

    Tessl 文章认为,Agent 可靠性不只取决于提示词,还取决于工具本身让 Agent 实际能够做什么。文章用 Gmail、CRM、Slack、数据库和云凭证等例子说明,应把审批、权限、校验和凭证范围做成 hard restrictions,而不是只依赖 system prompts、AGENTS.md 或 SKILL.md 等 soft guardrails。

    推荐理由:文章把提示词约束与工具权限边界分开讨论,提供了设计 Agent 工具接口的可迁移检查思路。

5月27日周三
  1. Cognition Blog77

    Cognition 完成超过 $1B 融资,估值达 $26B

    Cognition 宣布完成超过 $1B 融资,估值为 $26B,由 Lux Capital、General Catalyst 和 8VC 领投。公司称 Devin 企业使用量自今年初增长 >10x,run-rate revenue 达 $492M,客户包括 Citi、Mercedes-Benz、Goldman Sachs、U.S. Army 和 U.S. Navy。

    推荐理由:融资金额、收入增速和客户案例放在一起,呈现 Devin 从云端 Agent 工具走向企业级交付的商业进展。

5月23日周六
  1. stepfun-ai · Hugging Face 新模型79

    阶跃星辰发布 Step 3.7 Flash 198B MoE 视觉语言模型

    阶跃星辰发布 Step 3.7 Flash,这是一个 198B-parameter sparse MoE 视觉语言模型,结合 196B-parameter 语言骨干和 1.8B-parameter 视觉编码器,支持 256k context window。

    推荐理由:材料同时给出参数规模、基准成绩、价格和部署方式,便于评估多模态智能体工作流的接入成本。

5月22日周五
  1. Mistral AI75

    Mistral AI 在 Studio 发布 Connectors,支持内置连接器和自定义 MCP

    Mistral AI 发布 Studio 的 Connectors,内置连接器和自定义 MCP 现可通过 API/SDK 用于所有模型和 Agent 调用。新功能包括 direct tool calling、人类参与审批流程,以及创建、修改、列出、删除连接器和直接运行工具的编程访问;连接器会集中注册并可用于 LeChat、AI Studio,Vibe 即将支持。

    推荐理由:原文展示了连接器从注册到调用的开发路径,可参考其处理企业数据集成与工具治理的方式。

  2. Tessl60

    Tessl 创始人谈智能体开发安全应保护编码者而非代码

    Tessl 创始人 Guy Podjarny 认为,随着 AI 智能体高速创建和删除代码,安全工作的重点应从直接保护代码转向让智能体在构建时主动保障安全。他用 ElevenLabs 音乐 API 任务说明 evals 的必要性,并称加入技能后平均分从 50% 提升到 98%;在 CodeGuard 实验中,精简到认证和授权内容的技能也达到 98%。

    推荐理由:文章把智能体开发中的安全对象从代码转向技能和上下文,给出 eval 与治理框架供团队参考。

5月20日周三
5月19日周二
  1. Claude Blog78

    Claude Managed Agents 推出 dreaming 研究预览,开放 outcomes 与多智能体编排

    Claude Managed Agents 以研究预览推出 dreaming,并向开发者开放 outcomes、多智能体编排和 webhooks。dreaming 会定期回顾 agent sessions 和 memory stores,提取模式并整理记忆;outcomes 让开发者用 rubric 定义成功标准,由单独 grader 评估并推动智能体重试。

    推荐理由:原文列出 dreaming、outcomes 与多智能体编排的机制和测试数据,便于评估托管智能体的适用场景。

5月18日周一
  1. Cognition Blog73

    Cognition 推出 Devin Auto-Triage,用于自动调查告警并生成后续行动

    Cognition 推出 Devin Auto-Triage,Devin 现在可以监控新告警、自动调查,并返回调查结果、后续步骤甚至 PR。它可响应 Slack、Linear、GitHub、日程和 incoming webhooks,检查代码库、可观测性工具、相关 ticket 或 thread,并在需要人工时标记负责人。

    推荐理由:原文展示了 Devin 从告警检测延伸到调查和 PR 的流程,可帮助评估工程值班自动化的边界。

5月17日周日
5月13日周三
  1. Cognition Blog63

    Devin 现已支持 Android 模拟器

    Devin 现在可以启动 Android Virtual Device(AVD),支持面向 Android 应用的自主开发。此前 Devin 能处理 Android 代码,但不能在本地 Android 环境中运行和测试应用;新的 Android 模拟器支持让它能在自己的机器上构建和运行 Android 应用,打开应用、检查行为、复现问题并验证更改。

    推荐理由:原文说明了 Devin 从编写 Android 代码扩展到本地运行测试,对移动应用开发流程有直接参考。

5月12日周二
5月6日周三
4月30日周四
  1. Google DeepMind68

    Google DeepMind 公布 AI co-clinician 研究计划

    Google DeepMind 公布 AI co-clinician 研究计划,探索在医生临床监督下让 AI agent 与患者互动并辅助照护。研究称,在 98 个现实初级保健查询的客观分析中,AI co-clinician 有 97 个案例记录为零关键错误,并在 OpenFDA 的 RxQA 开放式用药问答上超过可用的前沿模型。

    推荐理由:材料同时覆盖证据检索和远程问诊模拟,可帮助理解医疗 AI 更适合辅助而非替代医生的边界。