Claude Managed Agents 内置记忆功能开放 public beta
Claude Managed Agents 的内置记忆功能已在 Claude Platform 开放 public beta,让 agents 可从每次会话中学习。
推荐理由:文章具体说明了文件化记忆、权限和审计设计,可用于评估企业智能体的跨会话学习方案。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Claude Managed Agents 的内置记忆功能已在 Claude Platform 开放 public beta,让 agents 可从每次会话中学习。
推荐理由:文章具体说明了文件化记忆、权限和审计设计,可用于评估企业智能体的跨会话学习方案。
Claude 扩展 connectors,新增连接 AllTrails、Instacart、Audible、Tripadvisor、Intuit TurboTax 等日常应用。
推荐理由:原文列出新增生活类应用和权限控制方式,可帮助判断 Claude 连接器从办公扩展到日常场景的影响。
Cognition 本周将更新 Devin 自助服务定价,停用旧 Core 和 Team 套餐,改为 Free、Pro、Max、Teams 和 Enterprise。
推荐理由:原文列出新旧套餐迁移和用量计费口径,可帮助团队预估 Devin 采用成本变化。
Moonshot AI 在 Hugging Face 发布 Kimi-K2.6,这是开源的原生多模态智能体模型。该模型采用 MoE 架构,Total Parameters 1T、Activated Parameters 32B、Context Length 256K,支持长周期编码、coding-driven design、Agent Swarm、图像和视频输入。
推荐理由:原文同时给出模型结构、评测表和部署入口,便于对比其在编码与智能体任务中的定位。
Cognition 说明 Devin 在过去八个月被多家 Fortune 500 公司用于 COBOL 现代化,覆盖数百万行代码文档、从 COBOL 到 AWS Lambda 的海关工作流迁移,以及跨数百个程序的税号逻辑重构。
推荐理由:文章把 COBOL 改造拆成文档、批处理迁移和重构三类,呈现 Agent 适用边界与落地条件。
Google DeepMind 发布 Gemma 4 开放模型家族,包含 E2B、E4B、26B MoE 和 31B Dense,面向高级推理和智能体工作流,并采用 Apache 2.0 license。
推荐理由:原文同时给出模型尺寸、端侧部署方式和生态入口,便于比较开放模型在硬件约束下的能力取舍。
Mistral AI 发布 Mistral Medium 3.5,这是 dense 128B 模型,支持 256k 上下文窗口,并将指令跟随、推理和编码能力合并到同一组权重中。
推荐理由:原文同时给出模型架构、替换范围和部署注意事项,便于评估其在聊天与编码场景的迁移成本。
Devin 现在可以将大型任务拆解并委派给一组并行工作的 managed Devins,由主 Devin 会话负责协调、监控进度、解决冲突并汇总结果。每个 managed Devin 都是完整 Devin,在独立虚拟机中拥有自己的 terminal、browser 和开发环境,可运行 shell 命令、执行测试并验证修改。
推荐理由:原文展示了多智能体并行协作的具体分工方式,可用于评估复杂开发任务的拆解路径。
阶跃星辰在 Hugging Face 开源 Step 3.5 Flash-Base,称其为具备推理和 Agent 能力的开源基础模型,并开源训练代码库 SteptronOss。
推荐理由:原文同时给出架构参数、吞吐和基准对比,便于评估开源 MoE 模型在 Agent 场景的取舍。
阶跃星辰在 Hugging Face 发布 Step-3.5-Flash-Base-Midtrain,称 Step 3.5 Flash 是其最强开源基础模型,并同步开源训练代码库 SteptronOss。
推荐理由:材料同时给出架构参数、吞吐、长上下文和基准成绩,便于比较开源 MoE 模型的效率取舍。
Cognition 分享了正在训练的 SWE-1.6 早期预览,当前 checkpoint 在 SWE-Bench Pro 上比 SWE-1.5 高 11%,速度同为 950 tok/s。
推荐理由:文章同时披露评测口径、训练提速和 Model UX 问题,可用于比较编码智能体模型的工程取舍。
Cognition 介绍了内部如何用 Devin 构建 Devin,上周将 659 个 Devin PR 合并进自家代码库,高于 2025 年最好一周的 154 个。
推荐理由:文章拆解了 Cognition 内部把 Devin 接入 PR、工单、日志和数据分析的工作流,可迁移到工程团队的智能体落地。
Cognition 发布 Devin 2.2,称这是 Devin 上线以来最大的更新之一,新增通过 computer use 测试、自验证和自动修复代码能力。Devin 现在可访问自己的 Linux desktop,用于启动和测试 desktop applications,并在创建 PR 后建议在桌面上测试,随后返回 screen recordings。
推荐理由:原文给出 Devin 从写代码到测试修复的闭环变化,可用于评估编码智能体接管 PR 前流程的边界。
Cognition 推出 Devin 自动修复 PR 审查评论功能,可配置 Devin 处理来自 Devin Review 和其他 review bots 的评论,并继续自动修复 lint 与 CI/CD 问题。
推荐理由:原文展示了编码智能体与审查机器人闭环的配置方式,可参考其把机械修复前置到人工评审前。
Mistral AI 在 Hugging Face 发布 Mistral Small 4 119B 混合模型,可同时作为通用指令模型和推理模型使用。
推荐理由:原文同时给出架构参数、模式切换和部署示例,便于评估开源通用模型的使用成本。
Cognition 推出 Devin Review,这是一个用 AI 和 UX 扩展人类理解复杂代码 diff 的代码审查工具,面向人类或智能体编写的 GitHub PR。
推荐理由:原文说明了 Devin Review 的使用入口和评审流程,可对比现有 GitHub PR 审查的痛点。
MiniMaxAI 将 MiniMax-M2.1 交给开源社区,称其面向编码、工具使用、指令遵循和长周期规划做了优化。MiniMax-M2.1 API 已在 MiniMax Open Platform 上线,基于该模型的 MiniMax Agent 已公开可用,模型权重已在 Hugging Face 开源并支持本地部署。
推荐理由:原文同时给出多项编码与工具使用评测及本地部署方式,便于比较开源 Agent 模型的工程适配。
Mistral 发布 Mistral Large 3 675B Base,这是从头训练的通用多模态 Granular MoE 基础预训练模型,拥有 41B active parameters 和 675B total parameters。
推荐理由:材料同时给出参数规模、上下文窗口、许可证和部署命令,便于评估自托管成本与适配场景。
Cognition 在 Devin 2025 绩效回顾中总结了其上线 18 个月后的真实工作表现,称 Devin 已在数千家公司工程团队工作并合并数十万个 PR。
推荐理由:这篇用客户场景和指标拆解 Devin 的适用边界,可为工程团队评估智能体部署提供参照。
Moonshot AI 发布 Kimi-K2-Thinking,称其为最新、能力最强的开源 thinking model,支持逐步推理并动态调用工具。该模型为 MoE 架构,总参数 1T、激活参数 32B、上下文长度 256K,原生 INT4 量化,称可在低延迟模式下实现无损 2x 加速,并在 200–300 次连续工具调用中保持稳定。
推荐理由:原文同时给出架构参数、评测设置和部署入口,便于比较开源推理模型的长程工具调用能力。