Mistral 发布 Voxtral Mini 4B Realtime 2602 实时语音转写模型
Mistral 发布 Voxtral Mini 4B Realtime 2602,这是一个多语言实时语音转写模型,支持 13 种语言,延迟可配置,面向语音助手和实时字幕等场景。
推荐理由:材料给出延迟、语言覆盖、基准和部署参数,便于评估实时语音转写在端侧场景的可用性。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Mistral 发布 Voxtral Mini 4B Realtime 2602,这是一个多语言实时语音转写模型,支持 13 种语言,延迟可配置,面向语音助手和实时字幕等场景。
推荐理由:材料给出延迟、语言覆盖、基准和部署参数,便于评估实时语音转写在端侧场景的可用性。
月之暗面在 Hugging Face 发布 Kimi K2.5,这是基于 Kimi-K2-Base 继续预训练的开源原生多模态智能体模型,使用约 15 trillion 混合视觉与文本 token。
推荐理由:原文同时给出架构参数、评测表和部署方式,便于比较多模态智能体模型的能力边界。
MiniMaxAI 将 MiniMax-M2.1 交给开源社区,称其面向编码、工具使用、指令遵循和长周期规划做了优化。MiniMax-M2.1 API 已在 MiniMax Open Platform 上线,基于该模型的 MiniMax Agent 已公开可用,模型权重已在 Hugging Face 开源并支持本地部署。
推荐理由:原文同时给出多项编码与工具使用评测及本地部署方式,便于比较开源 Agent 模型的工程适配。
Mistral AI 发布 Mistral OCR 3,用于从多类文档中高保真提取文本和嵌入图片,并在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 获得 74% overall win rate。
推荐理由:原文同时给出胜率、价格、API 和自托管选项,便于评估企业文档解析管线的迁移成本。
Mistral AI 发布 Devstral 2 编码模型族,包括 Devstral 2 (123B) 和 Devstral Small 2 (24B),并推出面向 Devstral 的开源命令行编码助手 Mistral Vibe CLI。
推荐理由:原文同时给出 SWE-bench、许可和部署要求,便于比较开放编码模型的性能与落地成本。
Mistral AI 发布 Mistral 3,包括 14B、8B、3B 三个小型 dense 模型,以及 Mistral Large 3 这一 41B active、675B total parameters 的 sparse MoE 模型,全部采用 Apache 2.0 license。
推荐理由:原文同时给出模型规模、许可证和部署入口,便于比较开源模型的落地成本与覆盖场景选择。
Mistral 发布 Mistral Large 3 675B Base,这是从头训练的通用多模态 Granular MoE 基础预训练模型,拥有 41B active parameters 和 675B total parameters。
推荐理由:材料同时给出参数规模、上下文窗口、许可证和部署命令,便于评估自托管成本与适配场景。
World Labs 今天将多模态世界模型 Marble 面向所有用户开放,并扩展其从文本、图像、视频或粗略3D布局创建3D世界的能力。Marble 支持交互式编辑、扩展和组合世界,生成后可导出为 Gaussian splats、meshes 或视频。
推荐理由:原文列出从文本、图像、视频到粗略3D布局的生成路径,便于比较世界模型工作流。
百度在 Hugging Face 发布 ERNIE-4.5-VL-28B-A3B-Thinking,基于 ERNIE-4.5-VL-28B-A3B 架构升级多模态推理能力。
推荐理由:原文同时给出训练思路、工具调用与部署命令,便于评估该多模态模型的落地路径。
Moonshot AI 发布 Kimi-K2-Thinking,称其为最新、能力最强的开源 thinking model,支持逐步推理并动态调用工具。该模型为 MoE 架构,总参数 1T、激活参数 32B、上下文长度 256K,原生 INT4 量化,称可在低延迟模式下实现无损 2x 加速,并在 200–300 次连续工具调用中保持稳定。
推荐理由:原文同时给出架构参数、评测设置和部署入口,便于比较开源推理模型的长程工具调用能力。
Moonshot AI 发布 Kimi Linear 混合线性注意力架构,开放 KDA kernel,并提供 48B total params、3B activated params、1M context 的 Base 与 Instruct 检查点。
推荐理由:材料同时给出架构、速度与部署命令,便于比较线性注意力在长上下文中的工程取舍。
Moonshot AI 在 Hugging Face 发布 Kimi-Linear-48B-A3B-Instruct,并介绍 Kimi Linear 混合线性注意力架构及 KDA kernel 开源信息。
推荐理由:材料同时给出架构、长上下文指标和部署命令,可用于比较线性注意力在长序列中的效率取舍。
Cognition 发布 SWE-1.5,称其是面向软件工程优化、拥有数千亿参数的 frontier-size 模型,达到 near-SOTA 编码性能,并已在 Windsurf 可用。
推荐理由:原文披露了模型、推理与 agent harness 的协同优化路径,可用于理解编码 Agent 的速度取舍。
World Labs 分享了 RTFM(Real-Time Frame Model),一个可在交互时实时生成视频的生成式世界模型,今天以研究预览版开放。RTFM 可用于探索生成的 3D 世界和真实地点,并可在浏览器中 demo;其目标是在单个 H100 GPU 上以交互帧率推理。
推荐理由:原文披露了单 H100 实时生成持久 3D 世界的架构思路,可作为世界模型工程取舍参考。
Cognition 训练并发布了 SWE-grep 和 SWE-grep-mini,两款面向高度并行上下文检索的快速智能体模型,已用于 Windsurf 的 Fast Context subagent。
推荐理由:原文披露了面向代码上下文检索的训练和评测设计,可用于比较快模型与通用编码模型的取舍。
OpenAI 在 Hugging Face 发布 gpt-oss-safeguard-20b,这是基于 gpt-oss 构建的安全推理模型,可按用户提供的安全政策对文本内容分类并执行基础安全任务。
推荐理由:原文说明了自带策略分类和可调推理强度,便于评估开源安全模型在内容审核中的适配方式。
OpenAI 在 Hugging Face 发布 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b,两者是基于 gpt-oss 构建的安全推理模型。
推荐理由:原文给出参数规模、许可和安全推理用法,便于评估开源安全分类模型的部署条件。
百度在 Hugging Face 上发布 Qianfan-VL-70B,属于 Qianfan-VL 通用多模态大语言模型系列,面向企业级多模态应用。该系列包含 Qianfan-VL-3B、Qianfan-VL-8B 和 Qianfan-VL-70B,均为 32k 上下文,其中 8B 和 70B 支持 CoT,70B 面向复杂推理和数据合成。
推荐理由:材料同时列出3B、8B、70B差异与训练流程,便于比较文档理解场景的部署取舍。
百度在 Hugging Face 发布 Qianfan-VL-8B,属于 Qianfan-VL 系列通用多模态大语言模型,面向企业级多模态应用并强化 OCR 与文档理解。
推荐理由:原文同时给出模型规格、训练流程和基准对比,便于评估其在 OCR 与文档理解场景的适配度。
百度在 Hugging Face 发布 Qianfan-VL-3B,属于 Qianfan-VL 通用视觉语言模型系列,面向企业级多模态应用并强化 OCR、文档理解等场景。
推荐理由:模型卡列出3B到70B规格、训练阶段、基准和部署示例,便于比较企业多模态场景适配。