美团 LongCat 发布 LongCat-Flash-Lite-Sparse 稀疏 MoE 模型
美团 LongCat 在 Hugging Face 发布 LongCat-Flash-Lite-Sparse,这是基于 LongCat-Flash-Lite 的非思考 MoE 模型,拥有 69B 总参数、每 token 约 3B 激活参数,并原生支持最高 1M tokens 上下文。
推荐理由:原文同时给出架构改动、长上下文设定和多项基准,便于比较稀疏版与密集前代的取舍。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
美团 LongCat 在 Hugging Face 发布 LongCat-Flash-Lite-Sparse,这是基于 LongCat-Flash-Lite 的非思考 MoE 模型,拥有 69B 总参数、每 token 约 3B 激活参数,并原生支持最高 1M tokens 上下文。
推荐理由:原文同时给出架构改动、长上下文设定和多项基准,便于比较稀疏版与密集前代的取舍。
MiniMaxAI 在 Hugging Face 发布 MiniMax-H3,这是一个通用全模态生成系统,支持文本、图像、视频和音频组成的多模态上下文理解,并可生成带原生立体声音频的视频。
推荐理由:原文披露了模块拆分、输入规格和本地部署路径,可帮助开发者评估接入成本与适用场景。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是用于近实时语音到语音翻译的最新音频模型,可自动检测 70+ 种语言并生成自然的译后语音。
推荐理由:原文同时说明模型能力、API入口和产品落地范围,便于评估实时语音翻译接入场景。
Google DeepMind 发布 Gemma 4 12B,称其是面向笔记本电脑的统一、无编码器多模态模型,支持视觉和音频输入直接进入 LLM backbone。
推荐理由:原文同时交代架构取舍、16GB 本地运行门槛和生态入口,便于评估多模态应用的适配成本。
Google Research 已在 GitHub 开源其水文建模框架,用于帮助国家气象和水文服务机构把 AI 洪水预测整合进自身工作流。该 Python 包基于 PyTorch,实现了驱动 Google Flood Hub 的河流预测模型,包含基于 LSTM 的模型架构和可用 Caravan 数据集训练的训练流程,并支持加入本地数据进行训练或微调。
推荐理由:开源内容覆盖模型架构和训练流程,便于气象水文机构结合本地数据改造预测工作流和评估接入边界。
Google DeepMind 推出 Gemini Omni,首款模型 Gemini Omni Flash 可将图像、音频、视频和文本作为输入,生成基于 Gemini 世界知识的高质量视频。
推荐理由:原文列出多输入生成、对话编辑、安全水印和上线渠道,可用于比较视频生成模型的产品化路径。
Mistral 发布 Mistral-Medium-3.5-128B-EAGLE,用于为 Mistral Medium 3.5 执行推测解码。
推荐理由:原文同时给出模型规格、替代关系和 vLLM/SGLang 部署方式,便于评估统一模型的接入成本。
Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,提升可控性、表现力和语音质量。3.1 Flash TTS 从今天起通过 Gemini API 和 Google AI Studio 面向开发者预览,通过 Vertex AI 面向企业预览,并通过 Google Vids 面向 Workspace 用户推出。
推荐理由:原文同时给出开放入口、音频标签控制方式和70+语言支持,便于评估语音生成应用适配空间。
Moonshot AI 在 Hugging Face 发布 Kimi-K2.6,这是开源的原生多模态智能体模型。该模型采用 MoE 架构,Total Parameters 1T、Activated Parameters 32B、Context Length 256K,支持长周期编码、coding-driven design、Agent Swarm、图像和视频输入。
推荐理由:原文同时给出模型结构、评测表和部署入口,便于对比其在编码与智能体任务中的定位。
Google DeepMind 推出 Gemini Robotics-ER 1.6,这是其面向机器人具身推理模型的重要升级,增强了空间推理和多视角理解能力。
推荐理由:原文给出与 1.5 和 Gemini 3.0 Flash 的对比,可看出具身推理在读表和安全约束上的进展。
Google DeepMind 发布 Gemma 4 开放模型家族,包含 E2B、E4B、26B MoE 和 31B Dense,面向高级推理和智能体工作流,并采用 Apache 2.0 license。
推荐理由:原文同时给出模型尺寸、端侧部署方式和生态入口,便于比较开放模型在硬件约束下的能力取舍。
Moonshot AI 发布 Kimi-K2-Thinking,称其为最新、能力最强的开源 thinking model,支持逐步推理并动态调用工具。该模型为 MoE 架构,总参数 1T、激活参数 32B、上下文长度 256K,原生 INT4 量化,称可在低延迟模式下实现无损 2x 加速,并在 200–300 次连续工具调用中保持稳定。
推荐理由:原文同时给出架构参数、评测设置和部署入口,便于比较开源推理模型的长程工具调用能力。
World Labs 分享了 RTFM(Real-Time Frame Model),一个可在交互时实时生成视频的生成式世界模型,今天以研究预览版开放。RTFM 可用于探索生成的 3D 世界和真实地点,并可在浏览器中 demo;其目标是在单个 H100 GPU 上以交互帧率推理。
推荐理由:原文披露了单 H100 实时生成持久 3D 世界的架构思路,可作为世界模型工程取舍参考。
Moonshot AI 发布 Kimi-K2-Instruct,这是 Kimi K2 的后训练版本,面向通用聊天和 agentic experiences。Kimi K2 是 MoE 语言模型,拥有 1T 总参数、32B 激活参数、128K 上下文窗口,并在 15.5T tokens 上预训练。
推荐理由:材料同时给出架构参数、基准对比和部署方式,便于评估 Kimi K2 的编码与工具调用定位。
Suno 发布 v4.5,称其为最新且最具表现力的模型,提升动态音乐、曲风多样性与准确性,并带来更丰富的人声。v4.5 支持更具表现力的描述和新的 prompt enhancement helper,并增强 Covers、Personas、Extend 等工具组合。新版本还提升生成速度,歌曲最长可达 8 minutes,并改善混音平衡、音频退化和 shimmer effects。
推荐理由:原文列出 v4.5 在曲风、声线、提示词理解和生成速度上的变化,便于对比音乐生成体验。
Suno 推出 v4,这一大版本更新带来更清晰的音频、更锐利的歌词和更动态的歌曲结构。v4 新增 Remaster、Lyrics by ReMi 和 Cover Art,并升级 Covers [v4] 与 Personas [v4]。v4 现已以 beta 形式面向 Pro 和 Premier 开放,可在 suno.com 和 iOS 体验。
推荐理由:原文列出 v4 在音频、歌词和歌曲结构上的改进,并说明 Pro 和 Premier 的 beta 可用范围。
Suno 发布 v3,这是其第一个能够生成广播级音乐的模型,现已面向所有用户在 https://app.suno.ai 开放。v3 可用几句短文本在数秒内生成完整的两分钟歌曲,并改进音频质量、风格和流派数量、提示词遵循能力,减少模型幻觉并带来更自然的结尾。Suno 还表示其模型不会识别对其他艺术家的引用,并开发了专有的不可听水印技术,用于检测歌曲是否由 Suno 创建。
推荐理由:材料同时交代了 v3 的开放范围、歌曲时长、音质改进和水印安全措施,便于理解 Suno 的产品取向。