Mistral AI 发布终端原生编码智能体 Mistral Vibe 2.0
Mistral AI 发布 Mistral Vibe 2.0,这是其终端原生编码智能体的一次重大升级,由 Devstral 2 模型家族驱动。
推荐理由:原文同时交代了 Vibe 2.0 的控制能力与付费入口,便于开发团队评估终端编码工作流的接入方式。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Mistral AI 发布 Mistral Vibe 2.0,这是其终端原生编码智能体的一次重大升级,由 Devstral 2 模型家族驱动。
推荐理由:原文同时交代了 Vibe 2.0 的控制能力与付费入口,便于开发团队评估终端编码工作流的接入方式。
Mistral AI 在 Hugging Face 发布 Mistral Small 4 119B 混合模型,可同时作为通用指令模型和推理模型使用。
推荐理由:原文同时给出架构参数、模式切换和部署示例,便于评估开源通用模型的使用成本。
Cognition 推出 Devin Review,这是一个用 AI 和 UX 扩展人类理解复杂代码 diff 的代码审查工具,面向人类或智能体编写的 GitHub PR。
推荐理由:原文说明了 Devin Review 的使用入口和评审流程,可对比现有 GitHub PR 审查的痛点。
月之暗面在 Hugging Face 发布 Kimi K2.5,这是基于 Kimi-K2-Base 继续预训练的开源原生多模态智能体模型,使用约 15 trillion 混合视觉与文本 token。
推荐理由:原文同时给出架构参数、评测表和部署方式,便于比较多模态智能体模型的能力边界。
MiniMaxAI 将 MiniMax-M2.1 交给开源社区,称其面向编码、工具使用、指令遵循和长周期规划做了优化。MiniMax-M2.1 API 已在 MiniMax Open Platform 上线,基于该模型的 MiniMax Agent 已公开可用,模型权重已在 Hugging Face 开源并支持本地部署。
推荐理由:原文同时给出多项编码与工具使用评测及本地部署方式,便于比较开源 Agent 模型的工程适配。
Mistral AI 发布 Devstral 2 编码模型族,包括 Devstral 2 (123B) 和 Devstral Small 2 (24B),并推出面向 Devstral 的开源命令行编码助手 Mistral Vibe CLI。
推荐理由:原文同时给出 SWE-bench、许可和部署要求,便于比较开放编码模型的性能与落地成本。
Mistral 发布 Mistral Large 3 675B Base,这是从头训练的通用多模态 Granular MoE 基础预训练模型,拥有 41B active parameters 和 675B total parameters。
推荐理由:材料同时给出参数规模、上下文窗口、许可证和部署命令,便于评估自托管成本与适配场景。
Cognition 在 Devin 2025 绩效回顾中总结了其上线 18 个月后的真实工作表现,称 Devin 已在数千家公司工程团队工作并合并数十万个 PR。
推荐理由:这篇用客户场景和指标拆解 Devin 的适用边界,可为工程团队评估智能体部署提供参照。
百度在 Hugging Face 发布 ERNIE-4.5-VL-28B-A3B-Thinking,基于 ERNIE-4.5-VL-28B-A3B 架构升级多模态推理能力。
推荐理由:原文同时给出训练思路、工具调用与部署命令,便于评估该多模态模型的落地路径。
Moonshot AI 发布 Kimi-K2-Thinking,称其为最新、能力最强的开源 thinking model,支持逐步推理并动态调用工具。该模型为 MoE 架构,总参数 1T、激活参数 32B、上下文长度 256K,原生 INT4 量化,称可在低延迟模式下实现无损 2x 加速,并在 200–300 次连续工具调用中保持稳定。
推荐理由:原文同时给出架构参数、评测设置和部署入口,便于比较开源推理模型的长程工具调用能力。
Cognition 宣布 Windsurf Codemaps,这是一种由 SWE-1.5 和 Claude Sonnet 4.5 驱动的 AI 标注结构化代码地图,用于在编码前理解代码库。
推荐理由:原文展示了把代码理解做成可导航地图的工作流,可作为团队梳理大型代码库和调试路径的参考。
Cognition 发布 SWE-1.5,称其是面向软件工程优化、拥有数千亿参数的 frontier-size 模型,达到 near-SOTA 编码性能,并已在 Windsurf 可用。
推荐理由:原文披露了模型、推理与 agent harness 的协同优化路径,可用于理解编码 Agent 的速度取舍。
Cognition 训练并发布了 SWE-grep 和 SWE-grep-mini,两款面向高度并行上下文检索的快速智能体模型,已用于 Windsurf 的 Fast Context subagent。
推荐理由:原文披露了面向代码上下文检索的训练和评测设计,可用于比较快模型与通用编码模型的取舍。
Cognition 宣布 Devin Agent Preview 接入 Claude Sonnet 4.5,并称该模型从今天起可在 Devin 中使用。Cognition 表示,在 Devin 上 Claude Sonnet 4.5 将规划性能提高 18%、端到端评测分数提高 12%,是自 Claude Sonnet 3.6 发布以来该团队看到的最大提升。
推荐理由:原文披露了 Sonnet 4.5 接入 Devin 后的评测变化,可用于观察编码模型对智能体工作流的影响。
Cognition 为 Claude Sonnet 4.5 重建了 Devin,新版本速度提升 2x,在 Junior Developer Evals 上提升 12%,现已在 Agent Preview 可用,旧版 Devin 仍可选择。
推荐理由:文章披露了 Devin 适配 Sonnet 4.5 的工程取舍,可参考其上下文管理和并行工具调用经验。
月之暗面发布 Kimi K2-Instruct-0905,这是 Kimi K2 的最新版本,采用 MoE 架构,拥有 1T 总参数、32B 激活参数,上下文窗口从 128k 增至 256k tokens。
推荐理由:原文同时给出参数、评测和部署入口,可用于比较 K2 版本迭代、编码智能体表现和本地推理适配路径。
Mistral AI 为 Le Chat 推出 Memories beta,让助手自动保存有用信息,并在调用记忆时显示来源链接、相关性和正在使用的记忆。用户可以随时关闭 Memories、开启不使用记忆的隐身聊天、编辑或删除单条记忆,并导出或从其他地方导入记忆。
推荐理由:原文说明了 Le Chat 记忆功能的可见性和控制项,可帮助评估长期上下文如何进入助手工作流。
Mistral AI 在 Le Chat 中发布 20+ 个安全的 MCP-powered connectors,并推出 Memories(beta),两项功能面向所有 Le Chat 用户开放。
推荐理由:原文列出连接器范围、部署方式和记忆控制,便于评估 Le Chat 在企业流程中的适配空间。
OpenAI 发布 gpt-oss 系列开放权重模型,gpt-oss-20b 面向低延迟、本地或专用场景,拥有 21B parameters 和 3.6B active parameters。
推荐理由:材料同时给出参数规模、许可、硬件需求和多种推理部署方式,便于评估开源权重落地成本。
OpenAI 在 Hugging Face 发布 gpt-oss 系列开放权重模型,包括 gpt-oss-120b 和 gpt-oss-20b,面向推理、智能体任务和开发者用例。
推荐理由:原文同时列出许可、显存需求、量化方式和多种推理接入路径,便于评估开放权重模型的部署成本。