Claude 新增面向日常生活的 connectors
Claude 扩展 connectors,新增连接 AllTrails、Instacart、Audible、Tripadvisor、Intuit TurboTax 等日常应用。
推荐理由:原文列出新增生活类应用和权限控制方式,可帮助判断 Claude 连接器从办公扩展到日常场景的影响。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Claude 扩展 connectors,新增连接 AllTrails、Instacart、Audible、Tripadvisor、Intuit TurboTax 等日常应用。
推荐理由:原文列出新增生活类应用和权限控制方式,可帮助判断 Claude 连接器从办公扩展到日常场景的影响。
Cognition 本周将更新 Devin 自助服务定价,停用旧 Core 和 Team 套餐,改为 Free、Pro、Max、Teams 和 Enterprise。
推荐理由:原文列出新旧套餐迁移和用量计费口径,可帮助团队预估 Devin 采用成本变化。
Moonshot AI 在 Hugging Face 发布 Kimi-K2.6,这是开源的原生多模态智能体模型。该模型采用 MoE 架构,Total Parameters 1T、Activated Parameters 32B、Context Length 256K,支持长周期编码、coding-driven design、Agent Swarm、图像和视频输入。
推荐理由:原文同时给出模型结构、评测表和部署入口,便于对比其在编码与智能体任务中的定位。
Google DeepMind 发布 Gemma 4 开放模型家族,包含 E2B、E4B、26B MoE 和 31B Dense,面向高级推理和智能体工作流,并采用 Apache 2.0 license。
推荐理由:原文同时给出模型尺寸、端侧部署方式和生态入口,便于比较开放模型在硬件约束下的能力取舍。
Mistral AI 发布 Mistral Medium 3.5,这是 dense 128B 模型,支持 256k 上下文窗口,并将指令跟随、推理和编码能力合并到同一组权重中。
推荐理由:原文同时给出模型架构、替换范围和部署注意事项,便于评估其在聊天与编码场景的迁移成本。
Devin 现在可以将大型任务拆解并委派给一组并行工作的 managed Devins,由主 Devin 会话负责协调、监控进度、解决冲突并汇总结果。每个 managed Devin 都是完整 Devin,在独立虚拟机中拥有自己的 terminal、browser 和开发环境,可运行 shell 命令、执行测试并验证修改。
推荐理由:原文展示了多智能体并行协作的具体分工方式,可用于评估复杂开发任务的拆解路径。
阶跃星辰在 Hugging Face 开源 Step 3.5 Flash-Base,称其为具备推理和 Agent 能力的开源基础模型,并开源训练代码库 SteptronOss。
推荐理由:原文同时给出架构参数、吞吐和基准对比,便于评估开源 MoE 模型在 Agent 场景的取舍。
阶跃星辰在 Hugging Face 发布 Step-3.5-Flash-Base-Midtrain,称 Step 3.5 Flash 是其最强开源基础模型,并同步开源训练代码库 SteptronOss。
推荐理由:材料同时给出架构参数、吞吐、长上下文和基准成绩,便于比较开源 MoE 模型的效率取舍。
Cognition 分享了正在训练的 SWE-1.6 早期预览,当前 checkpoint 在 SWE-Bench Pro 上比 SWE-1.5 高 11%,速度同为 950 tok/s。
推荐理由:文章同时披露评测口径、训练提速和 Model UX 问题,可用于比较编码智能体模型的工程取舍。
Cognition 介绍了内部如何用 Devin 构建 Devin,上周将 659 个 Devin PR 合并进自家代码库,高于 2025 年最好一周的 154 个。
推荐理由:文章拆解了 Cognition 内部把 Devin 接入 PR、工单、日志和数据分析的工作流,可迁移到工程团队的智能体落地。
Cognition 发布 Devin 2.2,称这是 Devin 上线以来最大的更新之一,新增通过 computer use 测试、自验证和自动修复代码能力。Devin 现在可访问自己的 Linux desktop,用于启动和测试 desktop applications,并在创建 PR 后建议在桌面上测试,随后返回 screen recordings。
推荐理由:原文给出 Devin 从写代码到测试修复的闭环变化,可用于评估编码智能体接管 PR 前流程的边界。
Cognition 推出 Devin Review,这是一个用 AI 和 UX 扩展人类理解复杂代码 diff 的代码审查工具,面向人类或智能体编写的 GitHub PR。
推荐理由:原文说明了 Devin Review 的使用入口和评审流程,可对比现有 GitHub PR 审查的痛点。
Cognition 在 Devin 2025 绩效回顾中总结了其上线 18 个月后的真实工作表现,称 Devin 已在数千家公司工程团队工作并合并数十万个 PR。
推荐理由:这篇用客户场景和指标拆解 Devin 的适用边界,可为工程团队评估智能体部署提供参照。
Moonshot AI 发布 Kimi-K2-Thinking,称其为最新、能力最强的开源 thinking model,支持逐步推理并动态调用工具。该模型为 MoE 架构,总参数 1T、激活参数 32B、上下文长度 256K,原生 INT4 量化,称可在低延迟模式下实现无损 2x 加速,并在 200–300 次连续工具调用中保持稳定。
推荐理由:原文同时给出架构参数、评测设置和部署入口,便于比较开源推理模型的长程工具调用能力。
Cognition 训练并发布了 SWE-grep 和 SWE-grep-mini,两款面向高度并行上下文检索的快速智能体模型,已用于 Windsurf 的 Fast Context subagent。
推荐理由:原文披露了面向代码上下文检索的训练和评测设计,可用于比较快模型与通用编码模型的取舍。
月之暗面发布 Kimi K2-Instruct-0905,这是 Kimi K2 的最新版本,采用 MoE 架构,拥有 1T 总参数、32B 激活参数,上下文窗口从 128k 增至 256k tokens。
推荐理由:原文同时给出参数、评测和部署入口,可用于比较 K2 版本迭代、编码智能体表现和本地推理适配路径。
Mistral AI 为 Le Chat 推出 Memories beta,让助手自动保存有用信息,并在调用记忆时显示来源链接、相关性和正在使用的记忆。用户可以随时关闭 Memories、开启不使用记忆的隐身聊天、编辑或删除单条记忆,并导出或从其他地方导入记忆。
推荐理由:原文说明了 Le Chat 记忆功能的可见性和控制项,可帮助评估长期上下文如何进入助手工作流。
Mistral AI 发布 Codestral 25.08,并推出由 Codestral、Codestral Embed、Devstral 和 Mistral Code IDE 扩展组成的企业级完整编码栈。
推荐理由:原文把模型更新、嵌入检索、Agent 工作流和企业部署放在同一栈中说明,便于比较企业编码方案的组成。
Moonshot AI 发布 Kimi-K2-Instruct,这是 Kimi K2 的后训练版本,面向通用聊天和 agentic experiences。Kimi K2 是 MoE 语言模型,拥有 1T 总参数、32B 激活参数、128K 上下文窗口,并在 15.5T tokens 上预训练。
推荐理由:材料同时给出架构参数、基准对比和部署方式,便于评估 Kimi K2 的编码与工具调用定位。
Mistral 发布新的 Agents API,将其语言模型与代码执行、Web 搜索、图像生成、MCP tools、跨对话持久记忆和智能体编排能力结合。
推荐理由:原文列出内置连接器、持久记忆和多智能体编排,便于评估企业智能体工作流的接入方式。