zai-org 发布 GLM-5:744B 参数模型面向复杂系统工程与长周期 Agent 任务
zai-org 在 Hugging Face 发布 GLM-5,面向复杂系统工程和长周期 Agent 任务。
推荐理由:材料同时给出参数、训练数据、评测和部署命令,便于比较开放模型在 Agent 与编码任务上的定位。
模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
zai-org 在 Hugging Face 发布 GLM-5,面向复杂系统工程和长周期 Agent 任务。
推荐理由:材料同时给出参数、训练数据、评测和部署命令,便于比较开放模型在 Agent 与编码任务上的定位。
StepFun 发布 Step 3.5 Flash 开源基础模型,采用稀疏 MoE 架构,196B 总参数中每 token 激活 11B,并支持 256K 上下文窗口。
推荐理由:材料同时给出架构参数、基准成绩、成本估算和部署路径,便于比较开源 MoE 模型的效率取舍。
stepfun-ai 在 Hugging Face 发布 Step3-VL-10B-FP8,并提供 Step3-VL-10B 的在线 Demo、FP8 量化权重和官方 vLLM 支持。
推荐理由:材料同时给出权重、量化、推理框架和训练细节,便于评估小尺寸多模态模型的部署取舍。
阶跃星辰在 Hugging Face 发布 Step-3.5-Flash-GGUF-Q4_K_S,介绍 Step 3.5 Flash 的 INT4 量化 GGUF 权重和本地部署方案。
推荐理由:原文同时给出架构参数、基准对比和本地部署路径,便于评估开源模型在编码与智能体场景的成本表现。
Mistral AI 在 Hugging Face 发布 Mistral Small 4 119B 混合模型,可同时作为通用指令模型和推理模型使用。
推荐理由:原文同时给出架构参数、模式切换和部署示例,便于评估开源通用模型的使用成本。
月之暗面在 Hugging Face 发布 Kimi K2.5,这是基于 Kimi-K2-Base 继续预训练的开源原生多模态智能体模型,使用约 15 trillion 混合视觉与文本 token。
推荐理由:原文同时给出架构参数、评测表和部署方式,便于比较多模态智能体模型的能力边界。
Sebastian Raschka 解析 DeepSeek 从 V3 到 V3.2 的技术演进,重点包括 DeepSeek Sparse Attention、混合推理模型和 RL 训练更新。
推荐理由:文章把 V3.2 的稀疏注意力、RL 奖励和 GRPO 改动放进 DeepSeek 演进脉络中比较,便于理解技术取舍。
Mistral AI 发布 Mistral 3,包括 14B、8B、3B 三个小型 dense 模型,以及 Mistral Large 3 这一 41B active、675B total parameters 的 sparse MoE 模型,全部采用 Apache 2.0 license。
推荐理由:原文同时给出模型规模、许可证和部署入口,便于比较开源模型的落地成本与覆盖场景选择。
百度在 Hugging Face 发布 ERNIE-4.5-VL-28B-A3B-Thinking,基于 ERNIE-4.5-VL-28B-A3B 架构升级多模态推理能力。
推荐理由:原文同时给出训练思路、工具调用与部署命令,便于评估该多模态模型的落地路径。
Moonshot AI 发布 Kimi-K2-Thinking,称其为最新、能力最强的开源 thinking model,支持逐步推理并动态调用工具。该模型为 MoE 架构,总参数 1T、激活参数 32B、上下文长度 256K,原生 INT4 量化,称可在低延迟模式下实现无损 2x 加速,并在 200–300 次连续工具调用中保持稳定。
推荐理由:原文同时给出架构参数、评测设置和部署入口,便于比较开源推理模型的长程工具调用能力。
Moonshot AI 发布 Kimi Linear 混合线性注意力架构,开放 KDA kernel,并提供 48B total params、3B activated params、1M context 的 Base 与 Instruct 检查点。
推荐理由:材料同时给出架构、速度与部署命令,便于比较线性注意力在长上下文中的工程取舍。
Cognition 发布 SWE-1.5,称其是面向软件工程优化、拥有数千亿参数的 frontier-size 模型,达到 near-SOTA 编码性能,并已在 Windsurf 可用。
推荐理由:原文披露了模型、推理与 agent harness 的协同优化路径,可用于理解编码 Agent 的速度取舍。
OpenAI 在 Hugging Face 发布 gpt-oss-safeguard-20b,这是基于 gpt-oss 构建的安全推理模型,可按用户提供的安全政策对文本内容分类并执行基础安全任务。
推荐理由:原文说明了自带策略分类和可调推理强度,便于评估开源安全模型在内容审核中的适配方式。
OpenAI 在 Hugging Face 发布 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b,两者是基于 gpt-oss 构建的安全推理模型。
推荐理由:原文给出参数规模、许可和安全推理用法,便于评估开源安全分类模型的部署条件。
百度在 Hugging Face 上发布 Qianfan-VL-70B,属于 Qianfan-VL 通用多模态大语言模型系列,面向企业级多模态应用。该系列包含 Qianfan-VL-3B、Qianfan-VL-8B 和 Qianfan-VL-70B,均为 32k 上下文,其中 8B 和 70B 支持 CoT,70B 面向复杂推理和数据合成。
推荐理由:材料同时列出3B、8B、70B差异与训练流程,便于比较文档理解场景的部署取舍。
百度在 Hugging Face 发布 Qianfan-VL-8B,属于 Qianfan-VL 系列通用多模态大语言模型,面向企业级多模态应用并强化 OCR 与文档理解。
推荐理由:原文同时给出模型规格、训练流程和基准对比,便于评估其在 OCR 与文档理解场景的适配度。
百度在 Hugging Face 发布 Qianfan-VL-3B,属于 Qianfan-VL 通用视觉语言模型系列,面向企业级多模态应用并强化 OCR、文档理解等场景。
推荐理由:模型卡列出3B到70B规格、训练阶段、基准和部署示例,便于比较企业多模态场景适配。
Sebastian Raschka 分析 OpenAI 本周发布的 gpt-oss-120b 和 gpt-oss-20b,称这是自 GPT-2 以来 OpenAI 再次共享大型完全开权重模型。
推荐理由:文章把 gpt-oss 与 GPT-2、Qwen3 的结构差异逐项拆开,便于理解开权重模型的工程取舍。
OpenAI 发布 gpt-oss 系列开放权重模型,gpt-oss-20b 面向低延迟、本地或专用场景,拥有 21B parameters 和 3.6B active parameters。
推荐理由:材料同时给出参数规模、许可、硬件需求和多种推理部署方式,便于评估开源权重落地成本。
OpenAI 在 Hugging Face 发布 gpt-oss 系列开放权重模型,包括 gpt-oss-120b 和 gpt-oss-20b,面向推理、智能体任务和开发者用例。
推荐理由:原文同时列出许可、显存需求、量化方式和多种推理接入路径,便于评估开放权重模型的部署成本。