zai-org 发布 GLM-5.1-FP8,主打 agentic engineering 与编码能力
zai-org 在 Hugging Face 发布 GLM-5.1-FP8,称 GLM-5.1 是面向 agentic engineering 的下一代旗舰模型,编码能力较前代显著增强。
推荐理由:材料同时给出多项编码与工具任务基准和本地部署框架,便于比较 GLM-5.1 与前代差异。
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
zai-org 在 Hugging Face 发布 GLM-5.1-FP8,称 GLM-5.1 是面向 agentic engineering 的下一代旗舰模型,编码能力较前代显著增强。
推荐理由:材料同时给出多项编码与工具任务基准和本地部署框架,便于比较 GLM-5.1 与前代差异。
Mistral AI 介绍了 Spaces CLI,这是其内部用于脚手架项目、启动开发环境、生成配置并部署到 staging 的平台工具。
推荐理由:文章把 CLI 设计拆成可复用原则,展示面向 Agent 的接口如何同时改善脚本化和测试。
Mistral AI 发布 Mistral Medium 3.5,这是 dense 128B 模型,支持 256k 上下文窗口,并将指令跟随、推理和编码能力合并到同一组权重中。
推荐理由:原文同时给出模型架构、替换范围和部署注意事项,便于评估其在聊天与编码场景的迁移成本。
Google Research 宣布 Vibe Coding XR,将 Gemini 与 WebXR-based XR Blocks framework 结合,把自然语言转换为功能性、具备物理感知的 Android XR apps,生成时间可低于 60 seconds。
推荐理由:原文展示了从自然语言到 Android XR 原型的具体流程,便于比较 XR 开发中抽象层的变化。
Cognition 宣布 Devin 现在可以调度自己的会话,用户只需描述要定期执行的工作,Devin 会确定节奏、设置日程并自动运行。Scheduled Devins 会在多次运行之间读写自己的 notes,用于避免重复处理已覆盖的 PR 或已处理的消息。该功能可与本周早些时候发布的 Managed Devins 组合,例如每周并行测试应用页面、汇总结果并发布到团队 Slack。
推荐理由:原文展示了递归任务、跨会话状态和并行智能体组合方式,可参考其自动化工程例行工作的设计。
Devin 现在可以将大型任务拆解并委派给一组并行工作的 managed Devins,由主 Devin 会话负责协调、监控进度、解决冲突并汇总结果。每个 managed Devin 都是完整 Devin,在独立虚拟机中拥有自己的 terminal、browser 和开发环境,可运行 shell 命令、执行测试并验证修改。
推荐理由:原文展示了多智能体并行协作的具体分工方式,可用于评估复杂开发任务的拆解路径。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一次主要版本,把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力整合到一个模型中。
推荐理由:原文同时给出架构参数、性能对比和部署入口,便于评估开放模型在多任务场景的取舍。
Mistral AI 发布 Leanstral,称其为面向 Lean 4 的开源代码智能体,用于在严格规格下生成并证明实现。Leanstral 采用高度稀疏架构,拥有 6B active parameters,权重以 Apache 2.0 许可发布,并集成到 Mistral Vibe、提供 labs-leanstral-2603 API endpoint。
推荐理由:原文把形式化证明场景、FLTEval 对比和开放入口放在一起,便于评估可信编码智能体的工程取舍。
Mistral 在 Hugging Face 发布 Leanstral-2603(Leanstral 119B A6B),称其是首个面向 Lean 4 的开源代码智能体模型,用于证明工程场景。
推荐理由:材料同时给出架构参数与部署方式,便于评估 Lean 4 证明工程中的使用成本和接入路径。
Mistral AI 构建了一个自主 Agent,可读取 Rails 源文件,生成或改进 RSpec 测试,按样式规则和覆盖率目标验证,并在 CI/CD pipeline 中无人干预运行。
推荐理由:文章把 Rails 测试生成拆成 AGENTS.md、分类型技能和验证工具,提供了可迁移的编码 Agent 搭建路径。
Mistral AI 在 Hugging Face 发布 Mistral Small 4 119B 2603 Eagle,这是一个混合模型,可同时作为通用指令模型和推理模型使用,并统一 Instruct、Reasoning 和 Devstral 三类模型能力。
推荐理由:材料同时给出架构参数、模式切换和 vLLM 部署示例,便于评估其在推理与智能体场景的适配。
mistralai 发布 Mistral-Small-4-119B-2603-NVFP4,这是 Mistral Small 4 的 post-training-activation quantized 版本。
推荐理由:原文同时给出架构参数、量化来源和 vLLM 部署示例,便于评估推理模式与吞吐取舍。
阶跃星辰在 Hugging Face 开源 Step 3.5 Flash-Base,称其为具备推理和 Agent 能力的开源基础模型,并开源训练代码库 SteptronOss。
推荐理由:原文同时给出架构参数、吞吐和基准对比,便于评估开源 MoE 模型在 Agent 场景的取舍。
阶跃星辰在 Hugging Face 发布 Step-3.5-Flash-Base-Midtrain,称 Step 3.5 Flash 是其最强开源基础模型,并同步开源训练代码库 SteptronOss。
推荐理由:材料同时给出架构参数、吞吐、长上下文和基准成绩,便于比较开源 MoE 模型的效率取舍。
Cognition 分享了正在训练的 SWE-1.6 早期预览,当前 checkpoint 在 SWE-Bench Pro 上比 SWE-1.5 高 11%,速度同为 950 tok/s。
推荐理由:文章同时披露评测口径、训练提速和 Model UX 问题,可用于比较编码智能体模型的工程取舍。
Cognition 介绍了内部如何用 Devin 构建 Devin,上周将 659 个 Devin PR 合并进自家代码库,高于 2025 年最好一周的 154 个。
推荐理由:文章拆解了 Cognition 内部把 Devin 接入 PR、工单、日志和数据分析的工作流,可迁移到工程团队的智能体落地。
Cognition 发布 Devin 2.2,称这是 Devin 上线以来最大的更新之一,新增通过 computer use 测试、自验证和自动修复代码能力。Devin 现在可访问自己的 Linux desktop,用于启动和测试 desktop applications,并在创建 PR 后建议在桌面上测试,随后返回 screen recordings。
推荐理由:原文给出 Devin 从写代码到测试修复的闭环变化,可用于评估编码智能体接管 PR 前流程的边界。
MiniMax 发布最新模型 MiniMax-M2.5,主打编码、智能体工具调用、搜索和办公任务。M2.5 在 SWE-Bench Verified 得分 80.2%,Multi-SWE-Bench 得分 51.3%,BrowseComp 得分 76.3%,完成 SWE-Bench Verified 比 M2.1 快 37%。
推荐理由:原文同时给出基准、成本和部署入口,可用于比较智能体任务中的速度与价格取舍。
zai-org 在 Hugging Face 发布 GLM-5,面向复杂系统工程和长周期 Agent 任务。
推荐理由:材料同时给出参数、训练数据、评测和部署命令,便于比较开放模型在 Agent 与编码任务上的定位。
Cognition 推出 Devin 自动修复 PR 审查评论功能,可配置 Devin 处理来自 Devin Review 和其他 review bots 的评论,并继续自动修复 lint 与 CI/CD 问题。
推荐理由:原文展示了编码智能体与审查机器人闭环的配置方式,可参考其把机械修复前置到人工评审前。