跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

最新精选

第 21–37 条 · 共 37 条
7月31日周五
  1. meituan-longcat · Hugging Face 新模型70

    美团 LongCat 发布 LongCat-Flash-Lite-Sparse 稀疏 MoE 模型

    美团 LongCat 在 Hugging Face 发布 LongCat-Flash-Lite-Sparse,这是基于 LongCat-Flash-Lite 的非思考 MoE 模型,拥有 69B 总参数、每 token 约 3B 激活参数,并原生支持最高 1M tokens 上下文。

    推荐理由:原文同时给出架构改动、长上下文设定和多项基准,便于比较稀疏版与密集前代的取舍。

7月28日周二
  1. MiniMaxAI · Hugging Face 新模型85

    MiniMaxAI 发布 MiniMax-H3 全模态生成系统

    MiniMaxAI 在 Hugging Face 发布 MiniMax-H3,这是一个通用全模态生成系统,支持文本、图像、视频和音频组成的多模态上下文理解,并可生成带原生立体声音频的视频。

    推荐理由:原文披露了模块拆分、输入规格和本地部署路径,可帮助开发者评估接入成本与适用场景。

6月9日周二
6月4日周四
  1. Google Research63

    Google Research 开源用于 AI 洪水预测的水文建模框架

    Google Research 已在 GitHub 开源其水文建模框架,用于帮助国家气象和水文服务机构把 AI 洪水预测整合进自身工作流。该 Python 包基于 PyTorch,实现了驱动 Google Flood Hub 的河流预测模型,包含基于 LSTM 的模型架构和可用 Caravan 数据集训练的训练流程,并支持加入本地数据进行训练或微调。

    推荐理由:开源内容覆盖模型架构和训练流程,便于气象水文机构结合本地数据改造预测工作流和评估接入边界。

5月18日周一
4月27日周一
4月16日周四
  1. Google DeepMind75

    Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,提升可控性、表现力和语音质量。3.1 Flash TTS 从今天起通过 Gemini API 和 Google AI Studio 面向开发者预览,通过 Vertex AI 面向企业预览,并通过 Google Vids 面向 Workspace 用户推出。

    推荐理由:原文同时给出开放入口、音频标签控制方式和70+语言支持,便于评估语音生成应用适配空间。

4月14日周二
  1. moonshotai · Hugging Face 新模型83

    Moonshot AI 开源 Kimi-K2.6 原生多模态智能体模型

    Moonshot AI 在 Hugging Face 发布 Kimi-K2.6,这是开源的原生多模态智能体模型。该模型采用 MoE 架构,Total Parameters 1T、Activated Parameters 32B、Context Length 256K,支持长周期编码、coding-driven design、Agent Swarm、图像和视频输入。

    推荐理由:原文同时给出模型结构、评测表和部署入口,便于对比其在编码与智能体任务中的定位。

4月13日周一
4月3日周五
  1. Google DeepMind84

    Google DeepMind 发布 Gemma 4 开放模型家族

    Google DeepMind 发布 Gemma 4 开放模型家族,包含 E2B、E4B、26B MoE 和 31B Dense,面向高级推理和智能体工作流,并采用 Apache 2.0 license。

    推荐理由:原文同时给出模型尺寸、端侧部署方式和生态入口,便于比较开放模型在硬件约束下的能力取舍。

11月4日周二
  1. moonshotai · Hugging Face 新模型85

    Moonshot AI 发布 Kimi-K2-Thinking 开源推理模型

    Moonshot AI 发布 Kimi-K2-Thinking,称其为最新、能力最强的开源 thinking model,支持逐步推理并动态调用工具。该模型为 MoE 架构,总参数 1T、激活参数 32B、上下文长度 256K,原生 INT4 量化,称可在低延迟模式下实现无损 2x 加速,并在 200–300 次连续工具调用中保持稳定。

    推荐理由:原文同时给出架构参数、评测设置和部署入口,便于比较开源推理模型的长程工具调用能力。

10月16日周四
  1. World Labs77

    World Labs 发布 RTFM 实时生成式世界模型研究预览

    World Labs 分享了 RTFM(Real-Time Frame Model),一个可在交互时实时生成视频的生成式世界模型,今天以研究预览版开放。RTFM 可用于探索生成的 3D 世界和真实地点,并可在浏览器中 demo;其目标是在单个 H100 GPU 上以交互帧率推理。

    推荐理由:原文披露了单 H100 实时生成持久 3D 世界的架构思路,可作为世界模型工程取舍参考。

7月11日周五
  1. moonshotai · Hugging Face 新模型85

    Moonshot AI 发布 Kimi-K2-Instruct,1T 参数 MoE 模型面向 Agent 能力

    Moonshot AI 发布 Kimi-K2-Instruct,这是 Kimi K2 的后训练版本,面向通用聊天和 agentic experiences。Kimi K2 是 MoE 语言模型,拥有 1T 总参数、32B 激活参数、128K 上下文窗口,并在 15.5T tokens 上预训练。

    推荐理由:材料同时给出架构参数、基准对比和部署方式,便于评估 Kimi K2 的编码与工具调用定位。

5月1日周四
  1. Suno Blog72

    Suno 发布 v4.5 音乐生成模型

    Suno 发布 v4.5,称其为最新且最具表现力的模型,提升动态音乐、曲风多样性与准确性,并带来更丰富的人声。v4.5 支持更具表现力的描述和新的 prompt enhancement helper,并增强 Covers、Personas、Extend 等工具组合。新版本还提升生成速度,歌曲最长可达 8 minutes,并改善混音平衡、音频退化和 shimmer effects。

    推荐理由:原文列出 v4.5 在曲风、声线、提示词理解和生成速度上的变化,便于对比音乐生成体验。

11月19日周二
  1. Suno Blog72

    Suno 发布 v4 beta,面向 Pro 和 Premier 开放

    Suno 推出 v4,这一大版本更新带来更清晰的音频、更锐利的歌词和更动态的歌曲结构。v4 新增 Remaster、Lyrics by ReMi 和 Cover Art,并升级 Covers [v4] 与 Personas [v4]。v4 现已以 beta 形式面向 Pro 和 Premier 开放,可在 suno.com 和 iOS 体验。

    推荐理由:原文列出 v4 在音频、歌词和歌曲结构上的改进,并说明 Pro 和 Premier 的 beta 可用范围。

3月21日周四
  1. Suno Blog78

    Suno 发布 v3,可在数秒内生成两分钟歌曲

    Suno 发布 v3,这是其第一个能够生成广播级音乐的模型,现已面向所有用户在 https://app.suno.ai 开放。v3 可用几句短文本在数秒内生成完整的两分钟歌曲,并改进音频质量、风格和流派数量、提示词遵循能力,减少模型幻觉并带来更自然的结尾。Suno 还表示其模型不会识别对其他艺术家的引用,并开发了专有的不可听水印技术,用于检测歌曲是否由 Suno 创建。

    推荐理由:材料同时交代了 v3 的开放范围、歌曲时长、音质改进和水印安全措施,便于理解 Suno 的产品取向。