StepFun 发布开源模型 Step 3.5 Flash,196B 参数每 token 激活 11B
StepFun 发布 Step 3.5 Flash 开源基础模型,采用稀疏 MoE 架构,196B 总参数中每 token 激活 11B,并支持 256K 上下文窗口。
推荐理由:材料同时给出架构参数、基准成绩、成本估算和部署路径,便于比较开源 MoE 模型的效率取舍。
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
StepFun 发布 Step 3.5 Flash 开源基础模型,采用稀疏 MoE 架构,196B 总参数中每 token 激活 11B,并支持 256K 上下文窗口。
推荐理由:材料同时给出架构参数、基准成绩、成本估算和部署路径,便于比较开源 MoE 模型的效率取舍。
阶跃星辰在 Hugging Face 发布 Step-3.5-Flash-GGUF-Q4_K_S,介绍 Step 3.5 Flash 的 INT4 量化 GGUF 权重和本地部署方案。
推荐理由:原文同时给出架构参数、基准对比和本地部署路径,便于评估开源模型在编码与智能体场景的成本表现。
Mistral AI 发布 Mistral Vibe 2.0,这是其终端原生编码智能体的一次重大升级,由 Devstral 2 模型家族驱动。
推荐理由:原文同时交代了 Vibe 2.0 的控制能力与付费入口,便于开发团队评估终端编码工作流的接入方式。
Mistral AI 在 Hugging Face 发布 Mistral Small 4 119B 混合模型,可同时作为通用指令模型和推理模型使用。
推荐理由:原文同时给出架构参数、模式切换和部署示例,便于评估开源通用模型的使用成本。
Cognition 推出 Devin Review,这是一个用 AI 和 UX 扩展人类理解复杂代码 diff 的代码审查工具,面向人类或智能体编写的 GitHub PR。
推荐理由:原文说明了 Devin Review 的使用入口和评审流程,可对比现有 GitHub PR 审查的痛点。
月之暗面在 Hugging Face 发布 Kimi K2.5,这是基于 Kimi-K2-Base 继续预训练的开源原生多模态智能体模型,使用约 15 trillion 混合视觉与文本 token。
推荐理由:原文同时给出架构参数、评测表和部署方式,便于比较多模态智能体模型的能力边界。
MiniMaxAI 将 MiniMax-M2.1 交给开源社区,称其面向编码、工具使用、指令遵循和长周期规划做了优化。MiniMax-M2.1 API 已在 MiniMax Open Platform 上线,基于该模型的 MiniMax Agent 已公开可用,模型权重已在 Hugging Face 开源并支持本地部署。
推荐理由:原文同时给出多项编码与工具使用评测及本地部署方式,便于比较开源 Agent 模型的工程适配。
Mistral AI 发布 Devstral 2 编码模型族,包括 Devstral 2 (123B) 和 Devstral Small 2 (24B),并推出面向 Devstral 的开源命令行编码助手 Mistral Vibe CLI。
推荐理由:原文同时给出 SWE-bench、许可和部署要求,便于比较开放编码模型的性能与落地成本。
Mistral 发布 Mistral Large 3 675B Base,这是从头训练的通用多模态 Granular MoE 基础预训练模型,拥有 41B active parameters 和 675B total parameters。
推荐理由:材料同时给出参数规模、上下文窗口、许可证和部署命令,便于评估自托管成本与适配场景。
Cognition 在 Devin 2025 绩效回顾中总结了其上线 18 个月后的真实工作表现,称 Devin 已在数千家公司工程团队工作并合并数十万个 PR。
推荐理由:这篇用客户场景和指标拆解 Devin 的适用边界,可为工程团队评估智能体部署提供参照。
Moonshot AI 发布 Kimi-K2-Thinking,称其为最新、能力最强的开源 thinking model,支持逐步推理并动态调用工具。该模型为 MoE 架构,总参数 1T、激活参数 32B、上下文长度 256K,原生 INT4 量化,称可在低延迟模式下实现无损 2x 加速,并在 200–300 次连续工具调用中保持稳定。
推荐理由:原文同时给出架构参数、评测设置和部署入口,便于比较开源推理模型的长程工具调用能力。
Cognition 宣布 Windsurf Codemaps,这是一种由 SWE-1.5 和 Claude Sonnet 4.5 驱动的 AI 标注结构化代码地图,用于在编码前理解代码库。
推荐理由:原文展示了把代码理解做成可导航地图的工作流,可作为团队梳理大型代码库和调试路径的参考。
Cognition 发布 SWE-1.5,称其是面向软件工程优化、拥有数千亿参数的 frontier-size 模型,达到 near-SOTA 编码性能,并已在 Windsurf 可用。
推荐理由:原文披露了模型、推理与 agent harness 的协同优化路径,可用于理解编码 Agent 的速度取舍。
Cognition 训练并发布了 SWE-grep 和 SWE-grep-mini,两款面向高度并行上下文检索的快速智能体模型,已用于 Windsurf 的 Fast Context subagent。
推荐理由:原文披露了面向代码上下文检索的训练和评测设计,可用于比较快模型与通用编码模型的取舍。
Cognition 宣布 Devin Agent Preview 接入 Claude Sonnet 4.5,并称该模型从今天起可在 Devin 中使用。Cognition 表示,在 Devin 上 Claude Sonnet 4.5 将规划性能提高 18%、端到端评测分数提高 12%,是自 Claude Sonnet 3.6 发布以来该团队看到的最大提升。
推荐理由:原文披露了 Sonnet 4.5 接入 Devin 后的评测变化,可用于观察编码模型对智能体工作流的影响。
Cognition 为 Claude Sonnet 4.5 重建了 Devin,新版本速度提升 2x,在 Junior Developer Evals 上提升 12%,现已在 Agent Preview 可用,旧版 Devin 仍可选择。
推荐理由:文章披露了 Devin 适配 Sonnet 4.5 的工程取舍,可参考其上下文管理和并行工具调用经验。
月之暗面发布 Kimi K2-Instruct-0905,这是 Kimi K2 的最新版本,采用 MoE 架构,拥有 1T 总参数、32B 激活参数,上下文窗口从 128k 增至 256k tokens。
推荐理由:原文同时给出参数、评测和部署入口,可用于比较 K2 版本迭代、编码智能体表现和本地推理适配路径。
Mistral AI 发布 Codestral 25.08,并推出由 Codestral、Codestral Embed、Devstral 和 Mistral Code IDE 扩展组成的企业级完整编码栈。
推荐理由:原文把模型更新、嵌入检索、Agent 工作流和企业部署放在同一栈中说明,便于比较企业编码方案的组成。
Moonshot AI 发布 Kimi-K2-Instruct,这是 Kimi K2 的后训练版本,面向通用聊天和 agentic experiences。Kimi K2 是 MoE 语言模型,拥有 1T 总参数、32B 激活参数、128K 上下文窗口,并在 15.5T tokens 上预训练。
推荐理由:材料同时给出架构参数、基准对比和部署方式,便于评估 Kimi K2 的编码与工具调用定位。
Mistral AI 与 All Hands AI 推出 Devstral Medium,并将 Devstral Small 升级到 Devstral Small 1.1,面向代码智能体和不同提示词、agentic scaffolds 的泛化。
推荐理由:原文同时给出开源许可、API价格和SWE-Bench Verified成绩,便于比较代码智能体模型取舍。