Mistral 发布 Mistral-Medium-3.5-128B-EAGLE 推测解码模型
Mistral 发布 Mistral-Medium-3.5-128B-EAGLE,用于为 Mistral Medium 3.5 执行推测解码。
推荐理由:原文同时给出模型规格、替代关系和 vLLM/SGLang 部署方式,便于评估统一模型的接入成本。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Mistral 发布 Mistral-Medium-3.5-128B-EAGLE,用于为 Mistral Medium 3.5 执行推测解码。
推荐理由:原文同时给出模型规格、替代关系和 vLLM/SGLang 部署方式,便于评估统一模型的接入成本。
Mistral AI 发布 Workflows 公共预览版,这是面向企业 AI 的编排层,用于把 AI 驱动流程更可靠地从概念验证推进到生产。Workflows 属于 Studio,开发者用 Python 编写 workflow,可发布到 Le Chat 供组织内触发,并在 Studio 中跟踪和审计每一步。
推荐理由:原文展示了企业 AI 流程从概念验证到生产部署时,对持久执行、审计和人工审批的工程需求。
Cognition 发布 Devin CLI,可在本地 shell 运行编码智能体,并在任务超出本机能力时把同一会话交给云端 Devin。它可访问代码库、工具和环境,支持选择 Opus 4.7、GPT-5.5 和 SWE-1.6,并用 Rust 编写自定义终端渲染库。
推荐理由:原文说明了本地终端与云端接力的边界,便于评估编码智能体在长任务中的工作流变化。
Claude Managed Agents 的内置记忆功能已在 Claude Platform 开放 public beta,让 agents 可从每次会话中学习。
推荐理由:文章具体说明了文件化记忆、权限和审计设计,可用于评估企业智能体的跨会话学习方案。
Cognition 总结了为 Devin 构建云端 Agent 两年多的经验,认为企业自建需要同时投入安全自主运行的技术基础设施和工程组织变革。
推荐理由:文章把云端 Agent 的隔离、持久化、编排和组织改造拆开说明,可作为企业评估自建成本的参照。
Claude 扩展 connectors,新增连接 AllTrails、Instacart、Audible、Tripadvisor、Intuit TurboTax 等日常应用。
推荐理由:原文列出新增生活类应用和权限控制方式,可帮助判断 Claude 连接器从办公扩展到日常场景的影响。
Cognition 总结其多智能体实践,认为当前较有效的形态是保持写入单线程,让其他 agents 贡献智能而不是并行改动。文中称 Devin Review 在 Devin 编写的 PR 上平均发现 2 个 bug,其中约 58% 属于严重问题,干净上下文的审查 agent 能发现编码 agent 忽略的问题。
推荐理由:文章用 Devin 的代码审查循环和 smart friend 实验,归纳了多智能体在软件开发中的可行边界。
Cognition 宣布 Devin 接入 Windsurf 2.0,用户可在 Windsurf 本地理解代码库并制定计划,再一键发送给 Devin 执行实现。
推荐理由:原文具体说明了本地 Agent 与云端 Agent 的分工,可作为编码工作流协作设计参考。
Cognition 本周将更新 Devin 自助服务定价,停用旧 Core 和 Team 套餐,改为 Free、Pro、Max、Teams 和 Enterprise。
推荐理由:原文列出新旧套餐迁移和用量计费口径,可帮助团队预估 Devin 采用成本变化。
Cognition 与 Applied Compute 合作 RL 训练了 bug 检测模型 SWE-Check,用于分析当前 diff 并标记变更可能引入的 bug。
推荐理由:原文披露了专用模型训练流程与延迟取舍,可参考其把生产反馈转成样本级奖励的方法。
Moonshot AI 在 Hugging Face 发布 Kimi-K2.6,这是开源的原生多模态智能体模型。该模型采用 MoE 架构,Total Parameters 1T、Activated Parameters 32B、Context Length 256K,支持长周期编码、coding-driven design、Agent Swarm、图像和视频输入。
推荐理由:原文同时给出模型结构、评测表和部署入口,便于对比其在编码与智能体任务中的定位。
MiniMax 在 Hugging Face 发布 MiniMax-M2.7,称其为首个深度参与自身演进的模型,可构建复杂 Agent harnesses、使用 Agent Teams、复杂 Skills 和动态工具搜索完成生产力任务。
推荐理由:材料同时列出自进化流程、工程基准和部署入口,便于比较开源权重模型的智能体能力。
Cognition 说明 Devin 在过去八个月被多家 Fortune 500 公司用于 COBOL 现代化,覆盖数百万行代码文档、从 COBOL 到 AWS Lambda 的海关工作流迁移,以及跨数百个程序的税号逻辑重构。
推荐理由:文章把 COBOL 改造拆成文档、批处理迁移和重构三类,呈现 Agent 适用边界与落地条件。
Cognition 发布 SWE-1.6,这是面向软件工程智能体的最新模型,并已在 Windsurf 面向所有人开放。SWE-1.6 在 SWE-Bench Pro 等基准上与 Preview 模型表现相近,但更强调 Model UX,减少过度思考、循环行为和不当终端依赖,更多使用并行工具调用。
推荐理由:原文披露了从预览版到正式版的行为改进,可用于理解编码智能体体验优化的取舍。
zai-org 在 Hugging Face 发布 GLM-5.1-FP8,称 GLM-5.1 是面向 agentic engineering 的下一代旗舰模型,编码能力较前代显著增强。
推荐理由:材料同时给出多项编码与工具任务基准和本地部署框架,便于比较 GLM-5.1 与前代差异。
Google DeepMind 发布 Gemma 4 开放模型家族,包含 E2B、E4B、26B MoE 和 31B Dense,面向高级推理和智能体工作流,并采用 Apache 2.0 license。
推荐理由:原文同时给出模型尺寸、端侧部署方式和生态入口,便于比较开放模型在硬件约束下的能力取舍。
Mistral AI 介绍了 Spaces CLI,这是其内部用于脚手架项目、启动开发环境、生成配置并部署到 staging 的平台工具。
推荐理由:文章把 CLI 设计拆成可复用原则,展示面向 Agent 的接口如何同时改善脚本化和测试。
Mistral AI 发布 Mistral Medium 3.5,这是 dense 128B 模型,支持 256k 上下文窗口,并将指令跟随、推理和编码能力合并到同一组权重中。
推荐理由:原文同时给出模型架构、替换范围和部署注意事项,便于评估其在聊天与编码场景的迁移成本。
Google Research 宣布 Vibe Coding XR,将 Gemini 与 WebXR-based XR Blocks framework 结合,把自然语言转换为功能性、具备物理感知的 Android XR apps,生成时间可低于 60 seconds。
推荐理由:原文展示了从自然语言到 Android XR 原型的具体流程,便于比较 XR 开发中抽象层的变化。
Mistral AI 发布 Voxtral TTS,这是其首个文本转语音模型,参数量 4B,面向多语言语音生成和企业语音智能体。它支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语,可用 3s 参考音频适配自定义声音,并在典型 10 秒语音样本和 500 characters 输入下模型延迟 70ms、RTF ≈9.7x。
推荐理由:原文同时给出语言覆盖、延迟、价格和架构细节,便于比较企业语音智能体的接入成本。