Cognition 详解 Devin 的大规模智能体开发验证机制
Cognition 介绍了 Devin 的端到端云端智能体验证机制,重点是让 Devin 在异步开发中测试自己的改动并返回可审查结果。Devin 会在 test mode 中生成基于源码的测试计划,操作应用、记录截图和断言,并用测试技能中的确定性脚本减少登录等重复流程的耗时和不稳定性。
推荐理由:原文给出 Devin 测试模式的计划、执行、报告和成本安排,可参考异步编码智能体的工程化路径。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Cognition 介绍了 Devin 的端到端云端智能体验证机制,重点是让 Devin 在异步开发中测试自己的改动并返回可审查结果。Devin 会在 test mode 中生成基于源码的测试计划,操作应用、记录截图和断言,并用测试技能中的确定性脚本减少登录等重复流程的耗时和不稳定性。
推荐理由:原文给出 Devin 测试模式的计划、执行、报告和成本安排,可参考异步编码智能体的工程化路径。
Tessl 对 Cursor Composer 2.5 与 Composer 2.5 Fast 做了 11 项工程技能基准测试,结果 Fast 平均分 92.7%,高于 2.5 的 92.1%,平均耗时 59 秒对 87 秒。
推荐理由:这组测试把质量、耗时和订阅成本放在一起,便于比较两种 Composer 2.5 的默认选择。
Mistral 发布 Vibe,将 Le Chat 升级为一个覆盖工作与编码的统一 AI 智能体,原有对话、设置和计划会迁移保留。Vibe 提供 Work Mode 和 Code Mode,可处理邮箱与日历跟进、深度研究、文档起草、企业知识搜索、结构化数据分析,以及从功能开发到 pull request 的编码流程。
推荐理由:原文同时覆盖工作与编码两条使用路径,可帮助判断统一智能体对企业流程和开发协作的影响范围。
Mistral AI 发布 Search Toolkit 公开预览版,这是一个开源、可组合框架,用于为 AI 应用构建生产级搜索管线。它把摄取、检索和评估放在统一接口下,支持云端、本地和边缘运行,并包含文档解析、分块、嵌入生成、BM25、稠密嵌入检索、混合检索以及 recall、precision、MRR、NDCG 等评估指标。
推荐理由:原文把摄取、检索和评估放进同一框架,适合对比企业 RAG 检索管线的工程取舍。
Tessl 文章认为,Agent 可靠性不只取决于提示词,还取决于工具本身让 Agent 实际能够做什么。文章用 Gmail、CRM、Slack、数据库和云凭证等例子说明,应把审批、权限、校验和凭证范围做成 hard restrictions,而不是只依赖 system prompts、AGENTS.md 或 SKILL.md 等 soft guardrails。
推荐理由:文章把提示词约束与工具权限边界分开讨论,提供了设计 Agent 工具接口的可迁移检查思路。
Cognition 宣布完成超过 $1B 融资,估值为 $26B,由 Lux Capital、General Catalyst 和 8VC 领投。公司称 Devin 企业使用量自今年初增长 >10x,run-rate revenue 达 $492M,客户包括 Citi、Mercedes-Benz、Goldman Sachs、U.S. Army 和 U.S. Navy。
推荐理由:融资金额、收入增速和客户案例放在一起,呈现 Devin 从云端 Agent 工具走向企业级交付的商业进展。
阶跃星辰发布 Step 3.7 Flash,这是一个 198B-parameter sparse MoE 视觉语言模型,结合 196B-parameter 语言骨干和 1.8B-parameter 视觉编码器,支持 256k context window。
推荐理由:材料同时给出参数规模、基准成绩、价格和部署方式,便于评估多模态智能体工作流的接入成本。
Mistral 发布 Mistral Medium 3.5 public preview,这是一款 128B dense、256k context window 的开放权重模型,成为 Mistral Vibe 和 Le Chat 的默认模型。
推荐理由:原文把模型规格、远程编码会话和 Work mode 放在一起,便于评估云端智能体在开发与办公中的落点。
Mistral AI 发布 Studio 的 Connectors,内置连接器和自定义 MCP 现可通过 API/SDK 用于所有模型和 Agent 调用。新功能包括 direct tool calling、人类参与审批流程,以及创建、修改、列出、删除连接器和直接运行工具的编程访问;连接器会集中注册并可用于 LeChat、AI Studio,Vibe 即将支持。
推荐理由:原文展示了连接器从注册到调用的开发路径,可参考其处理企业数据集成与工具治理的方式。
Tessl 创始人 Guy Podjarny 认为,随着 AI 智能体高速创建和删除代码,安全工作的重点应从直接保护代码转向让智能体在构建时主动保障安全。他用 ElevenLabs 音乐 API 任务说明 evals 的必要性,并称加入技能后平均分从 50% 提升到 98%;在 CodeGuard 实验中,精简到认证和授权内容的技能也达到 98%。
推荐理由:文章把智能体开发中的安全对象从代码转向技能和上下文,给出 eval 与治理框架供团队参考。
Google Research 介绍了 Empirical Research Assistance(ERA)的 Nature 论文,并开始通过 Gemini for Science 更广泛推出基于 ERA 和 AlphaEvolve 的 Computational Discovery。
推荐理由:材料把 Nature 论文、跨学科基准和五类应用放在一起,便于评估科研编码工具在不同问题中的适用边界。
Anthropic 在 Claude Managed Agents 中推出 self-hosted sandboxes 和 MCP tunnels,让智能体可在企业控制的沙盒中运行工具,并连接私有网络内的 MCP servers。
推荐理由:材料说明了执行环境和私有服务连接的边界,适合评估企业智能体落地的安全架构。
Claude Managed Agents 以研究预览推出 dreaming,并向开发者开放 outcomes、多智能体编排和 webhooks。dreaming 会定期回顾 agent sessions 和 memory stores,提取模式并整理记忆;outcomes 让开发者用 rubric 定义成功标准,由单独 grader 评估并推动智能体重试。
推荐理由:原文列出 dreaming、outcomes 与多智能体编排的机制和测试数据,便于评估托管智能体的适用场景。
Cognition 推出 Devin Auto-Triage,Devin 现在可以监控新告警、自动调查,并返回调查结果、后续步骤甚至 PR。它可响应 Slack、Linear、GitHub、日程和 incoming webhooks,检查代码库、可观测性工具、相关 ticket 或 thread,并在需要人工时标记负责人。
推荐理由:原文展示了 Devin 从告警检测延伸到调查和 PR 的流程,可帮助评估工程值班自动化的边界。
Google DeepMind 在 Project Genie 中推出由 Street View 支持的新能力,让用户基于美国地点的实景图像生成并探索想象世界。
推荐理由:原文说明了 Genie 与 Street View 的结合方式,可观察世界模型从生成环境走向实景锚定的产品路径。
Google DeepMind 推出 Gemini for Science,这是面向科研探索的工具和实验集合,包括 Google Labs 上的 3 个实验原型和 Google Antigravity 中的 Science Skills。
推荐理由:原文列出三类实验工具和 Science Skills,可作为观察通用智能体进入科研流程的具体案例。
Devin 现在可以启动 Android Virtual Device(AVD),支持面向 Android 应用的自主开发。此前 Devin 能处理 Android 代码,但不能在本地 Android 环境中运行和测试应用;新的 Android 模拟器支持让它能在自己的机器上构建和运行 Android 应用,打开应用、检查行为、复现问题并验证更改。
推荐理由:原文说明了 Devin 从编写 Android 代码扩展到本地运行测试,对移动应用开发流程有直接参考。
Google DeepMind 在 Nature 发布 Co-Scientist 研究,并通过 Hypothesis Generation 向个人研究者开放这一基于 Gemini 的多智能体科研伙伴。
推荐理由:原文给出多智能体分工、想法锦标赛和开放方式,可参考其把科研假设生成拆成协作流程。
Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 过去一年的应用进展,覆盖科研、Google 基础设施和商业企业。
推荐理由:文章用医疗、能源、量子和企业案例串联 AlphaEvolve 从研究走向基础设施的路径。
Google DeepMind 公布 AI co-clinician 研究计划,探索在医生临床监督下让 AI agent 与患者互动并辅助照护。研究称,在 98 个现实初级保健查询的客观分析中,AI co-clinician 有 97 个案例记录为零关键错误,并在 OpenFDA 的 RxQA 开放式用药问答上超过可用的前沿模型。
推荐理由:材料同时覆盖证据检索和远程问诊模拟,可帮助理解医疗 AI 更适合辅助而非替代医生的边界。