Cognition 如何用 Devin 构建 Devin
Cognition 介绍了内部如何用 Devin 构建 Devin,上周将 659 个 Devin PR 合并进自家代码库,高于 2025 年最好一周的 154 个。
推荐理由:文章拆解了 Cognition 内部把 Devin 接入 PR、工单、日志和数据分析的工作流,可迁移到工程团队的智能体落地。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
Cognition 介绍了内部如何用 Devin 构建 Devin,上周将 659 个 Devin PR 合并进自家代码库,高于 2025 年最好一周的 154 个。
推荐理由:文章拆解了 Cognition 内部把 Devin 接入 PR、工单、日志和数据分析的工作流,可迁移到工程团队的智能体落地。
MiniMaxAI 将 MiniMax-M2.1 交给开源社区,称其面向编码、工具使用、指令遵循和长周期规划做了优化。MiniMax-M2.1 API 已在 MiniMax Open Platform 上线,基于该模型的 MiniMax Agent 已公开可用,模型权重已在 Hugging Face 开源并支持本地部署。
推荐理由:原文同时给出多项编码与工具使用评测及本地部署方式,便于比较开源 Agent 模型的工程适配。
Moonshot AI 在 Hugging Face 发布 Kimi-Linear-48B-A3B-Instruct,并介绍 Kimi Linear 混合线性注意力架构及 KDA kernel 开源信息。
推荐理由:材料同时给出架构、长上下文指标和部署命令,可用于比较线性注意力在长序列中的效率取舍。
Cognition 发布 SWE-1.5,称其是面向软件工程优化、拥有数千亿参数的 frontier-size 模型,达到 near-SOTA 编码性能,并已在 Windsurf 可用。
推荐理由:原文披露了模型、推理与 agent harness 的协同优化路径,可用于理解编码 Agent 的速度取舍。
World Labs 分享了 RTFM(Real-Time Frame Model),一个可在交互时实时生成视频的生成式世界模型,今天以研究预览版开放。RTFM 可用于探索生成的 3D 世界和真实地点,并可在浏览器中 demo;其目标是在单个 H100 GPU 上以交互帧率推理。
推荐理由:原文披露了单 H100 实时生成持久 3D 世界的架构思路,可作为世界模型工程取舍参考。
百度在 Hugging Face 发布 Qianfan-VL-3B,属于 Qianfan-VL 通用视觉语言模型系列,面向企业级多模态应用并强化 OCR、文档理解等场景。
推荐理由:模型卡列出3B到70B规格、训练阶段、基准和部署示例,便于比较企业多模态场景适配。
月之暗面发布 Kimi K2-Instruct-0905,这是 Kimi K2 的最新版本,采用 MoE 架构,拥有 1T 总参数、32B 激活参数,上下文窗口从 128k 增至 256k tokens。
推荐理由:原文同时给出参数、评测和部署入口,可用于比较 K2 版本迭代、编码智能体表现和本地推理适配路径。
Sebastian Raschka 分析 OpenAI 本周发布的 gpt-oss-120b 和 gpt-oss-20b,称这是自 GPT-2 以来 OpenAI 再次共享大型完全开权重模型。
推荐理由:文章把 gpt-oss 与 GPT-2、Qwen3 的结构差异逐项拆开,便于理解开权重模型的工程取舍。
OpenAI 发布 gpt-oss 系列开放权重模型,gpt-oss-20b 面向低延迟、本地或专用场景,拥有 21B parameters 和 3.6B active parameters。
推荐理由:材料同时给出参数规模、许可、硬件需求和多种推理部署方式,便于评估开源权重落地成本。
Moonshot AI 发布 Kimi-K2-Instruct,这是 Kimi K2 的后训练版本,面向通用聊天和 agentic experiences。Kimi K2 是 MoE 语言模型,拥有 1T 总参数、32B 激活参数、128K 上下文窗口,并在 15.5T tokens 上预训练。
推荐理由:材料同时给出架构参数、基准对比和部署方式,便于评估 Kimi K2 的编码与工具调用定位。
OpenAI 在 Hugging Face 发布 Whisper large-v3-turbo,它是 Whisper large-v3 的剪枝微调版本。模型将解码层从 32 层减少到 4 层,因此速度更快,但会有轻微质量下降;参数量为 809 M,支持在 Hugging Face Transformers 中用于自动语音识别、语音翻译和时间戳预测。
推荐理由:模型卡同时给出结构变化与部署示例,便于评估语音转写场景中的速度和质量取舍。