meituan-longcat 发布 LongCat-AudioDiT-1B 扩散式 TTS 模型
meituan-longcat 在 Hugging Face 发布 LongCat-AudioDiT-1B,这是一个基于扩散模型的 TTS 模型,直接在 waveform latent space 中运行。
推荐理由:原文同时给出模型结构、Seed基准和推理脚本,便于比较扩散式TTS的性能取舍与复现路径。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
meituan-longcat 在 Hugging Face 发布 LongCat-AudioDiT-1B,这是一个基于扩散模型的 TTS 模型,直接在 waveform latent space 中运行。
推荐理由:原文同时给出模型结构、Seed基准和推理脚本,便于比较扩散式TTS的性能取舍与复现路径。
Suno 今天发布 v5.5,称其为目前最具表现力的模型,并同步推出 Voices、Custom Models 和 My Taste 三项个性化功能。Voices 面向 Pro 和 Premier 订阅用户,可用实时捕捉或上传的声音创作音乐,并通过随机短语匹配验证,生成的 Voices 默认为私有。
推荐理由:原文同时说明 Voices、Custom Models 和 My Taste 的权限与隐私设计,可帮助判断音乐生成工作流变化。
美团 LongCat 团队开源 LongCat-Next,这是基于 LongCat-Flash-Lite MoE backbone(A3B)的原生多模态模型,统一处理文本、视觉和音频。
推荐理由:材料同时给出模型范式、能力边界和部署条件,便于比较离散多模态路线的工程取舍。
Mistral AI 发布 Voxtral TTS,这是其首个文本转语音模型,参数量 4B,面向多语言语音生成和企业语音智能体。它支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语,可用 3s 参考音频适配自定义声音,并在典型 10 秒语音样本和 500 characters 输入下模型延迟 70ms、RTF ≈9.7x。
推荐理由:原文同时给出语言覆盖、延迟、价格和架构细节,便于比较企业语音智能体的接入成本。
美团 LongCat 发布 LongCat-Flash-Prover,一个面向 Lean4 原生形式化推理的 560-billion-parameter 开源 MoE 模型。
推荐理由:材料同时披露训练框架、Lean4 工具接入和多项基准结果,便于比较开源定理推理模型的能力边界与工程路线。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一次主要版本,把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力整合到一个模型中。
推荐理由:原文同时给出架构参数、性能对比和部署入口,便于评估开放模型在多任务场景的取舍。
Mistral AI 发布 Leanstral,称其为面向 Lean 4 的开源代码智能体,用于在严格规格下生成并证明实现。Leanstral 采用高度稀疏架构,拥有 6B active parameters,权重以 Apache 2.0 许可发布,并集成到 Mistral Vibe、提供 labs-leanstral-2603 API endpoint。
推荐理由:原文把形式化证明场景、FLTEval 对比和开放入口放在一起,便于评估可信编码智能体的工程取舍。
Mistral 在 Hugging Face 发布 Leanstral-2603(Leanstral 119B A6B),称其是首个面向 Lean 4 的开源代码智能体模型,用于证明工程场景。
推荐理由:材料同时给出架构参数与部署方式,便于评估 Lean 4 证明工程中的使用成本和接入路径。
Mistral AI 在 Hugging Face 发布 Mistral Small 4 119B 2603 Eagle,这是一个混合模型,可同时作为通用指令模型和推理模型使用,并统一 Instruct、Reasoning 和 Devstral 三类模型能力。
推荐理由:材料同时给出架构参数、模式切换和 vLLM 部署示例,便于评估其在推理与智能体场景的适配。
mistralai 发布 Mistral-Small-4-119B-2603-NVFP4,这是 Mistral Small 4 的 post-training-activation quantized 版本。
推荐理由:原文同时给出架构参数、量化来源和 vLLM 部署示例,便于评估推理模式与吞吐取舍。
阶跃星辰在 Hugging Face 开源 Step 3.5 Flash-Base,称其为具备推理和 Agent 能力的开源基础模型,并开源训练代码库 SteptronOss。
推荐理由:原文同时给出架构参数、吞吐和基准对比,便于评估开源 MoE 模型在 Agent 场景的取舍。
阶跃星辰在 Hugging Face 发布 Step-3.5-Flash-Base-Midtrain,称 Step 3.5 Flash 是其最强开源基础模型,并同步开源训练代码库 SteptronOss。
推荐理由:材料同时给出架构参数、吞吐、长上下文和基准成绩,便于比较开源 MoE 模型的效率取舍。
Cognition 分享了正在训练的 SWE-1.6 早期预览,当前 checkpoint 在 SWE-Bench Pro 上比 SWE-1.5 高 11%,速度同为 950 tok/s。
推荐理由:文章同时披露评测口径、训练提速和 Model UX 问题,可用于比较编码智能体模型的工程取舍。
MiniMax 发布最新模型 MiniMax-M2.5,主打编码、智能体工具调用、搜索和办公任务。M2.5 在 SWE-Bench Verified 得分 80.2%,Multi-SWE-Bench 得分 51.3%,BrowseComp 得分 76.3%,完成 SWE-Bench Verified 比 M2.1 快 37%。
推荐理由:原文同时给出基准、成本和部署入口,可用于比较智能体任务中的速度与价格取舍。
zai-org 在 Hugging Face 发布 GLM-5,面向复杂系统工程和长周期 Agent 任务。
推荐理由:材料同时给出参数、训练数据、评测和部署命令,便于比较开放模型在 Agent 与编码任务上的定位。
StepFun 发布 Step 3.5 Flash 开源基础模型,采用稀疏 MoE 架构,196B 总参数中每 token 激活 11B,并支持 256K 上下文窗口。
推荐理由:材料同时给出架构参数、基准成绩、成本估算和部署路径,便于比较开源 MoE 模型的效率取舍。
Mistral AI 发布 Voxtral Transcribe 2,包括用于批量转写的 Voxtral Mini Transcribe V2 和用于实时应用的 Voxtral Realtime。
推荐理由:原文同时给出延迟、价格和开放权重信息,便于比较语音转写在实时与批处理场景的取舍。
stepfun-ai 在 Hugging Face 发布 Step3-VL-10B-FP8,并提供 Step3-VL-10B 的在线 Demo、FP8 量化权重和官方 vLLM 支持。
推荐理由:材料同时给出权重、量化、推理框架和训练细节,便于评估小尺寸多模态模型的部署取舍。
阶跃星辰在 Hugging Face 发布 Step-3.5-Flash-GGUF-Q4_K_S,介绍 Step 3.5 Flash 的 INT4 量化 GGUF 权重和本地部署方案。
推荐理由:原文同时给出架构参数、基准对比和本地部署路径,便于评估开源模型在编码与智能体场景的成本表现。
Mistral AI 在 Hugging Face 发布 Mistral Small 4 119B 混合模型,可同时作为通用指令模型和推理模型使用。
推荐理由:原文同时给出架构参数、模式切换和部署示例,便于评估开源通用模型的使用成本。