DeepSeek V3 到 V3.2 的架构、稀疏注意力和 RL 更新解析
Sebastian Raschka 解析 DeepSeek 从 V3 到 V3.2 的技术演进,重点包括 DeepSeek Sparse Attention、混合推理模型和 RL 训练更新。
推荐理由:文章把 V3.2 的稀疏注意力、RL 奖励和 GRPO 改动放进 DeepSeek 演进脉络中比较,便于理解技术取舍。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
Sebastian Raschka 解析 DeepSeek 从 V3 到 V3.2 的技术演进,重点包括 DeepSeek Sparse Attention、混合推理模型和 RL 训练更新。
推荐理由:文章把 V3.2 的稀疏注意力、RL 奖励和 GRPO 改动放进 DeepSeek 演进脉络中比较,便于理解技术取舍。
Mistral AI 发布 Mistral 3,包括 14B、8B、3B 三个小型 dense 模型,以及 Mistral Large 3 这一 41B active、675B total parameters 的 sparse MoE 模型,全部采用 Apache 2.0 license。
推荐理由:原文同时给出模型规模、许可证和部署入口,便于比较开源模型的落地成本与覆盖场景选择。
百度在 Hugging Face 发布 ERNIE-4.5-VL-28B-A3B-Thinking,基于 ERNIE-4.5-VL-28B-A3B 架构升级多模态推理能力。
推荐理由:原文同时给出训练思路、工具调用与部署命令,便于评估该多模态模型的落地路径。
Moonshot AI 发布 Kimi Linear 混合线性注意力架构,开放 KDA kernel,并提供 48B total params、3B activated params、1M context 的 Base 与 Instruct 检查点。
推荐理由:材料同时给出架构、速度与部署命令,便于比较线性注意力在长上下文中的工程取舍。
Moonshot AI 在 Hugging Face 发布 Kimi-Linear-48B-A3B-Instruct,并介绍 Kimi Linear 混合线性注意力架构及 KDA kernel 开源信息。
推荐理由:材料同时给出架构、长上下文指标和部署命令,可用于比较线性注意力在长序列中的效率取舍。
Cognition 发布 SWE-1.5,称其是面向软件工程优化、拥有数千亿参数的 frontier-size 模型,达到 near-SOTA 编码性能,并已在 Windsurf 可用。
推荐理由:原文披露了模型、推理与 agent harness 的协同优化路径,可用于理解编码 Agent 的速度取舍。
World Labs 分享了 RTFM(Real-Time Frame Model),一个可在交互时实时生成视频的生成式世界模型,今天以研究预览版开放。RTFM 可用于探索生成的 3D 世界和真实地点,并可在浏览器中 demo;其目标是在单个 H100 GPU 上以交互帧率推理。
推荐理由:原文披露了单 H100 实时生成持久 3D 世界的架构思路,可作为世界模型工程取舍参考。
百度在 Hugging Face 发布 Qianfan-VL-3B,属于 Qianfan-VL 通用视觉语言模型系列,面向企业级多模态应用并强化 OCR、文档理解等场景。
推荐理由:模型卡列出3B到70B规格、训练阶段、基准和部署示例,便于比较企业多模态场景适配。
SemiAnalysis 认为,AWS 可能通过 Anthropic 合作和多 GW Trainium 数据中心扩张迎来 AI 复苏。文章称 Anthropic 年化收入在 2025 年内增长 5 倍至 $5B,AWS 有 3 个园区处于建设最后阶段,合计超过 1.3GW IT capacity,专门服务 Anthropic 训练需求。
推荐理由:文章把云收入、数据中心建设和芯片 TCO 放在一起,提供了理解 AWS 押注 Anthropic 的背景。
月之暗面发布 Kimi K2-Instruct-0905,这是 Kimi K2 的最新版本,采用 MoE 架构,拥有 1T 总参数、32B 激活参数,上下文窗口从 128k 增至 256k tokens。
推荐理由:原文同时给出参数、评测和部署入口,可用于比较 K2 版本迭代、编码智能体表现和本地推理适配路径。
Sebastian Raschka 分析 OpenAI 本周发布的 gpt-oss-120b 和 gpt-oss-20b,称这是自 GPT-2 以来 OpenAI 再次共享大型完全开权重模型。
推荐理由:文章把 gpt-oss 与 GPT-2、Qwen3 的结构差异逐项拆开,便于理解开权重模型的工程取舍。
OpenAI 发布 gpt-oss 系列开放权重模型,gpt-oss-20b 面向低延迟、本地或专用场景,拥有 21B parameters 和 3.6B active parameters。
推荐理由:材料同时给出参数规模、许可、硬件需求和多种推理部署方式,便于评估开源权重落地成本。
OpenAI 在 Hugging Face 发布 gpt-oss 系列开放权重模型,包括 gpt-oss-120b 和 gpt-oss-20b,面向推理、智能体任务和开发者用例。
推荐理由:原文同时列出许可、显存需求、量化方式和多种推理接入路径,便于评估开放权重模型的部署成本。
Meta 正以新 Superintelligence 团队、激进挖角和大规模 AI 训练集群重建其 GenAI 战略,以追赶 OpenAI、DeepSeek 等基础模型实验室。
推荐理由:文章把人才挖角、数据问题和集群建设放在同一框架下,提供了理解 Meta 追赶策略的背景。
Moonshot AI 发布 Kimi-K2-Instruct,这是 Kimi K2 的后训练版本,面向通用聊天和 agentic experiences。Kimi K2 是 MoE 语言模型,拥有 1T 总参数、32B 激活参数、128K 上下文窗口,并在 15.5T tokens 上预训练。
推荐理由:材料同时给出架构参数、基准对比和部署方式,便于评估 Kimi K2 的编码与工具调用定位。
Mistral AI 与 All Hands AI 推出 Devstral Medium,并将 Devstral Small 升级到 Devstral Small 1.1,面向代码智能体和不同提示词、agentic scaffolds 的泛化。
推荐理由:原文同时给出开源许可、API价格和SWE-Bench Verified成绩,便于比较代码智能体模型取舍。
Mistral AI 发布 Devstral,这是一款面向软件工程任务的智能体式 LLM,并以 Apache 2.0 许可开放。
推荐理由:原文同时给出基准成绩、部署门槛和开放渠道,便于比较它在编码智能体中的适用场景。
Mistral AI 发布 Mistral Medium 3,称其在 SOTA 性能、8X lower cost 和更简单部署之间取得平衡,面向企业使用。Mistral 称该模型在全套基准上达到或超过 Claude Sonnet 3.7 的 90%,价格为 $0.4 input / $2 output per M token,并在编码和多模态理解等专业场景表现突出。
推荐理由:原文同时给出价格、部署方式和对比基准,便于评估中型模型在企业场景的取舍。
OpenAI 在 Hugging Face 发布 Whisper large-v3-turbo,它是 Whisper large-v3 的剪枝微调版本。模型将解码层从 32 层减少到 4 层,因此速度更快,但会有轻微质量下降;参数量为 809 M,支持在 Hugging Face Transformers 中用于自动语音识别、语音翻译和时间戳预测。
推荐理由:模型卡同时给出结构变化与部署示例,便于评估语音转写场景中的速度和质量取舍。