Mistral 发布 Mistral Large 3 675B Base 多模态 MoE 模型
Mistral 发布 Mistral Large 3 675B Base,这是从头训练的通用多模态 Granular MoE 基础预训练模型,拥有 41B active parameters 和 675B total parameters。
推荐理由:材料同时给出参数规模、上下文窗口、许可证和部署命令,便于评估自托管成本与适配场景。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Mistral 发布 Mistral Large 3 675B Base,这是从头训练的通用多模态 Granular MoE 基础预训练模型,拥有 41B active parameters 和 675B total parameters。
推荐理由:材料同时给出参数规模、上下文窗口、许可证和部署命令,便于评估自托管成本与适配场景。
Cognition 在 Devin 2025 绩效回顾中总结了其上线 18 个月后的真实工作表现,称 Devin 已在数千家公司工程团队工作并合并数十万个 PR。
推荐理由:这篇用客户场景和指标拆解 Devin 的适用边界,可为工程团队评估智能体部署提供参照。
百度在 Hugging Face 发布 ERNIE-4.5-VL-28B-A3B-Thinking,基于 ERNIE-4.5-VL-28B-A3B 架构升级多模态推理能力。
推荐理由:原文同时给出训练思路、工具调用与部署命令,便于评估该多模态模型的落地路径。
Moonshot AI 发布 Kimi-K2-Thinking,称其为最新、能力最强的开源 thinking model,支持逐步推理并动态调用工具。该模型为 MoE 架构,总参数 1T、激活参数 32B、上下文长度 256K,原生 INT4 量化,称可在低延迟模式下实现无损 2x 加速,并在 200–300 次连续工具调用中保持稳定。
推荐理由:原文同时给出架构参数、评测设置和部署入口,便于比较开源推理模型的长程工具调用能力。
Cognition 宣布 Windsurf Codemaps,这是一种由 SWE-1.5 和 Claude Sonnet 4.5 驱动的 AI 标注结构化代码地图,用于在编码前理解代码库。
推荐理由:原文展示了把代码理解做成可导航地图的工作流,可作为团队梳理大型代码库和调试路径的参考。
Cognition 发布 SWE-1.5,称其是面向软件工程优化、拥有数千亿参数的 frontier-size 模型,达到 near-SOTA 编码性能,并已在 Windsurf 可用。
推荐理由:原文披露了模型、推理与 agent harness 的协同优化路径,可用于理解编码 Agent 的速度取舍。
Cognition 训练并发布了 SWE-grep 和 SWE-grep-mini,两款面向高度并行上下文检索的快速智能体模型,已用于 Windsurf 的 Fast Context subagent。
推荐理由:原文披露了面向代码上下文检索的训练和评测设计,可用于比较快模型与通用编码模型的取舍。
Cognition 宣布 Devin Agent Preview 接入 Claude Sonnet 4.5,并称该模型从今天起可在 Devin 中使用。Cognition 表示,在 Devin 上 Claude Sonnet 4.5 将规划性能提高 18%、端到端评测分数提高 12%,是自 Claude Sonnet 3.6 发布以来该团队看到的最大提升。
推荐理由:原文披露了 Sonnet 4.5 接入 Devin 后的评测变化,可用于观察编码模型对智能体工作流的影响。
Cognition 为 Claude Sonnet 4.5 重建了 Devin,新版本速度提升 2x,在 Junior Developer Evals 上提升 12%,现已在 Agent Preview 可用,旧版 Devin 仍可选择。
推荐理由:文章披露了 Devin 适配 Sonnet 4.5 的工程取舍,可参考其上下文管理和并行工具调用经验。
月之暗面发布 Kimi K2-Instruct-0905,这是 Kimi K2 的最新版本,采用 MoE 架构,拥有 1T 总参数、32B 激活参数,上下文窗口从 128k 增至 256k tokens。
推荐理由:原文同时给出参数、评测和部署入口,可用于比较 K2 版本迭代、编码智能体表现和本地推理适配路径。
Mistral AI 为 Le Chat 推出 Memories beta,让助手自动保存有用信息,并在调用记忆时显示来源链接、相关性和正在使用的记忆。用户可以随时关闭 Memories、开启不使用记忆的隐身聊天、编辑或删除单条记忆,并导出或从其他地方导入记忆。
推荐理由:原文说明了 Le Chat 记忆功能的可见性和控制项,可帮助评估长期上下文如何进入助手工作流。
Mistral AI 在 Le Chat 中发布 20+ 个安全的 MCP-powered connectors,并推出 Memories(beta),两项功能面向所有 Le Chat 用户开放。
推荐理由:原文列出连接器范围、部署方式和记忆控制,便于评估 Le Chat 在企业流程中的适配空间。
OpenAI 发布 gpt-oss 系列开放权重模型,gpt-oss-20b 面向低延迟、本地或专用场景,拥有 21B parameters 和 3.6B active parameters。
推荐理由:材料同时给出参数规模、许可、硬件需求和多种推理部署方式,便于评估开源权重落地成本。
OpenAI 在 Hugging Face 发布 gpt-oss 系列开放权重模型,包括 gpt-oss-120b 和 gpt-oss-20b,面向推理、智能体任务和开发者用例。
推荐理由:原文同时列出许可、显存需求、量化方式和多种推理接入路径,便于评估开放权重模型的部署成本。
Mistral AI 发布 Codestral 25.08,并推出由 Codestral、Codestral Embed、Devstral 和 Mistral Code IDE 扩展组成的企业级完整编码栈。
推荐理由:原文把模型更新、嵌入检索、Agent 工作流和企业部署放在同一栈中说明,便于比较企业编码方案的组成。
Mistral AI 为 Le Chat 推出一组新功能,包括 Deep Research (Preview)、Voice mode、原生多语言推理、Projects 和高级图像编辑。
推荐理由:原文集中列出 Le Chat 的研究、语音、项目和图像编辑入口,便于比较其助手形态的扩展方向。
Moonshot AI 发布 Kimi-K2-Instruct,这是 Kimi K2 的后训练版本,面向通用聊天和 agentic experiences。Kimi K2 是 MoE 语言模型,拥有 1T 总参数、32B 激活参数、128K 上下文窗口,并在 15.5T tokens 上预训练。
推荐理由:材料同时给出架构参数、基准对比和部署方式,便于评估 Kimi K2 的编码与工具调用定位。
Mistral AI 与 All Hands AI 推出 Devstral Medium,并将 Devstral Small 升级到 Devstral Small 1.1,面向代码智能体和不同提示词、agentic scaffolds 的泛化。
推荐理由:原文同时给出开源许可、API价格和SWE-Bench Verified成绩,便于比较代码智能体模型取舍。
Moonshot AI 发布 Kimi K2,这是一款 MoE 语言模型,拥有 1T 总参数、32B 激活参数,并用 Muon optimizer 在 15.5T tokens 上预训练。
推荐理由:原文同时给出参数规模、训练 token、评测表和部署入口,便于比较 Kimi K2 在 Agent 与编码任务中的定位。
Mistral AI 发布 Codestral Embed,这是其首个专门面向代码的嵌入模型,主打真实代码数据上的检索场景。官方称它优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的 large embedding model,并支持不同维度和精度输出,256 维 int8 精度仍优于竞品模型。
推荐理由:原文同时给出检索基准、维度取舍和 API 价格,便于评估代码 RAG 的接入成本。