Devin 如何帮助 Fortune 500 公司现代化 COBOL
Cognition 说明 Devin 在过去八个月被多家 Fortune 500 公司用于 COBOL 现代化,覆盖数百万行代码文档、从 COBOL 到 AWS Lambda 的海关工作流迁移,以及跨数百个程序的税号逻辑重构。
推荐理由:文章把 COBOL 改造拆成文档、批处理迁移和重构三类,呈现 Agent 适用边界与落地条件。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
Cognition 说明 Devin 在过去八个月被多家 Fortune 500 公司用于 COBOL 现代化,覆盖数百万行代码文档、从 COBOL 到 AWS Lambda 的海关工作流迁移,以及跨数百个程序的税号逻辑重构。
推荐理由:文章把 COBOL 改造拆成文档、批处理迁移和重构三类,呈现 Agent 适用边界与落地条件。
zai-org 在 Hugging Face 发布 GLM-5.1-FP8,称 GLM-5.1 是面向 agentic engineering 的下一代旗舰模型,编码能力较前代显著增强。
推荐理由:材料同时给出多项编码与工具任务基准和本地部署框架,便于比较 GLM-5.1 与前代差异。
百度在 Hugging Face 发布 ERNIE-Image-Turbo,这是 ERNIE-Image 的蒸馏版开源文生图模型,基于同一单流 Diffusion Transformer(DiT)家族。
推荐理由:材料同时给出8步生成、24G VRAM部署和多项基准,便于评估图像生成落地成本。
Mistral AI 介绍了 Spaces CLI,这是其内部用于脚手架项目、启动开发环境、生成配置并部署到 staging 的平台工具。
推荐理由:文章把 CLI 设计拆成可复用原则,展示面向 Agent 的接口如何同时改善脚本化和测试。
美团 LongCat 发布 LongCat-Flash-Prover,一个面向 Lean4 原生形式化推理的 560-billion-parameter 开源 MoE 模型。
推荐理由:材料同时披露训练框架、Lean4 工具接入和多项基准结果,便于比较开源定理推理模型的能力边界与工程路线。
Google Research 与多家 NHS 组织在 AIMS 研究中发布两项 Nature Cancer 配套研究,评估 AI 乳腺癌检测系统在英国乳腺筛查中的独立性能、部署可行性和双读流程整合效果。
推荐理由:两项 Nature Cancer 研究把独立性能与双读流程放在一起比较,呈现医疗 AI 落地的工作量影响。
Mistral 在 Hugging Face 发布 Leanstral-2603(Leanstral 119B A6B),称其是首个面向 Lean 4 的开源代码智能体模型,用于证明工程场景。
推荐理由:材料同时给出架构参数与部署方式,便于评估 Lean 4 证明工程中的使用成本和接入路径。
Mistral AI 在 Hugging Face 发布 Mistral Small 4 119B 2603 Eagle,这是一个混合模型,可同时作为通用指令模型和推理模型使用,并统一 Instruct、Reasoning 和 Devstral 三类模型能力。
推荐理由:材料同时给出架构参数、模式切换和 vLLM 部署示例,便于评估其在推理与智能体场景的适配。
mistralai 发布 Mistral-Small-4-119B-2603-NVFP4,这是 Mistral Small 4 的 post-training-activation quantized 版本。
推荐理由:原文同时给出架构参数、量化来源和 vLLM 部署示例,便于评估推理模式与吞吐取舍。
Cognition 介绍了内部如何用 Devin 构建 Devin,上周将 659 个 Devin PR 合并进自家代码库,高于 2025 年最好一周的 154 个。
推荐理由:文章拆解了 Cognition 内部把 Devin 接入 PR、工单、日志和数据分析的工作流,可迁移到工程团队的智能体落地。
MiniMax 发布最新模型 MiniMax-M2.5,主打编码、智能体工具调用、搜索和办公任务。M2.5 在 SWE-Bench Verified 得分 80.2%,Multi-SWE-Bench 得分 51.3%,BrowseComp 得分 76.3%,完成 SWE-Bench Verified 比 M2.1 快 37%。
推荐理由:原文同时给出基准、成本和部署入口,可用于比较智能体任务中的速度与价格取舍。
zai-org 在 Hugging Face 发布 GLM-5,面向复杂系统工程和长周期 Agent 任务。
推荐理由:材料同时给出参数、训练数据、评测和部署命令,便于比较开放模型在 Agent 与编码任务上的定位。
StepFun 发布 Step 3.5 Flash 开源基础模型,采用稀疏 MoE 架构,196B 总参数中每 token 激活 11B,并支持 256K 上下文窗口。
推荐理由:材料同时给出架构参数、基准成绩、成本估算和部署路径,便于比较开源 MoE 模型的效率取舍。
stepfun-ai 在 Hugging Face 发布 Step3-VL-10B-FP8,并提供 Step3-VL-10B 的在线 Demo、FP8 量化权重和官方 vLLM 支持。
推荐理由:材料同时给出权重、量化、推理框架和训练细节,便于评估小尺寸多模态模型的部署取舍。
阶跃星辰在 Hugging Face 发布 Step-3.5-Flash-GGUF-Q4_K_S,介绍 Step 3.5 Flash 的 INT4 量化 GGUF 权重和本地部署方案。
推荐理由:原文同时给出架构参数、基准对比和本地部署路径,便于评估开源模型在编码与智能体场景的成本表现。
Mistral 发布 Voxtral Mini 4B Realtime 2602,这是一个多语言实时语音转写模型,支持 13 种语言,延迟可配置,面向语音助手和实时字幕等场景。
推荐理由:材料给出延迟、语言覆盖、基准和部署参数,便于评估实时语音转写在端侧场景的可用性。
World Labs 发布 World API,这是一个公共接口,可用 Marble 从文本、图像、360° panoramas、多视角输入和视频生成可探索的 3D 世界。
推荐理由:原文展示了 API 输入、输出和早期场景,可用于评估 3D 世界生成接入产品工作流的成本与边界。
MiniMaxAI 将 MiniMax-M2.1 交给开源社区,称其面向编码、工具使用、指令遵循和长周期规划做了优化。MiniMax-M2.1 API 已在 MiniMax Open Platform 上线,基于该模型的 MiniMax Agent 已公开可用,模型权重已在 Hugging Face 开源并支持本地部署。
推荐理由:原文同时给出多项编码与工具使用评测及本地部署方式,便于比较开源 Agent 模型的工程适配。
Mistral AI 发布 Mistral OCR 3,用于从多类文档中高保真提取文本和嵌入图片,并在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 获得 74% overall win rate。
推荐理由:原文同时给出胜率、价格、API 和自托管选项,便于评估企业文档解析管线的迁移成本。
Mistral AI 发布 Devstral 2 编码模型族,包括 Devstral 2 (123B) 和 Devstral Small 2 (24B),并推出面向 Devstral 的开源命令行编码助手 Mistral Vibe CLI。
推荐理由:原文同时给出 SWE-bench、许可和部署要求,便于比较开放编码模型的性能与落地成本。