ElevenLabs 发布 Eleven v4 语音模型,提升表达力和长内容一致性
ElevenLabs 正在发布 Eleven v4 语音模型,称其能更准确遵循方向提示,并在长制作中保持声音一致。Eleven v4 支持 90 多种语言、每次请求最多 10,000 个字符,Turbo 变体面向实时语音智能体,约 150 毫秒开始生成语音。
推荐理由:原文同时给出语言覆盖、延迟、价格和对比测试,便于评估语音模型在创作与实时智能体中的适用性。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
ElevenLabs 正在发布 Eleven v4 语音模型,称其能更准确遵循方向提示,并在长制作中保持声音一致。Eleven v4 支持 90 多种语言、每次请求最多 10,000 个字符,Turbo 变体面向实时语音智能体,约 150 毫秒开始生成语音。
推荐理由:原文同时给出语言覆盖、延迟、价格和对比测试,便于评估语音模型在创作与实时智能体中的适用性。
OpenAI 发布 GPT-6.1 Sol,称其在 agentic coding、computer use 和 office work 上接近 GPT-6.1 Astra,成本约为后者的五分之一。
推荐理由:原文同时列出 API 价格、基准和安全测试口径,便于比较 Sol 与 Astra 在成本和能力上的取舍。
OpenAI 在 DevDay 活动上展示 GPT-6.1 Sol,称其在智能体编码、计算机使用和专业工作上接近 GPT-6 Astra,标准输入和输出 token 价格为 1/5。
推荐理由:原文同时交代价格、可用入口与安全背景,便于比较 GPT-6.1 Sol 和 GPT-6 Astra 的定位。
GPT-6.1 Sol 已在 Amazon Bedrock 正式可用,为编码、computer use 和高频专业工作负载带来更强推理能力。OpenAI 称它在 DeepSWE v1.1 上以约 one-fifth 的每任务成本匹配 GPT-6 Astra,并比 GPT-6 Sol 最佳分数高 6.4 percentage points。
推荐理由:原文同时给出任务成本对比与 Bedrock 生产控制,便于评估智能体工作流落地取舍。
GPT-6.1 Sol 在 GPT-6 Sol 发布仅 7 天后取代它,在 Artificial Analysis Intelligence Index 中仅比 GPT-6 Astra 低 1 分,Cost per Task 不到后者 1/4。
推荐理由:原文集中给出智能指数、任务成本和 token 用量对比,便于判断 GPT-6.1 Sol 的成本效率位置。
Introducing Claude Sonnet 5.5, the second model in the Claude 5.5 family. It’s a clear upgrade over Sonnet 5, runs more than 30% faster, and costs up to 30% less for most work.
推荐理由:材料给出 Sonnet 5.5 相对 Sonnet 5 的速度和成本变化,便于评估升级取舍。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两个文本转语音模型,用于生成自定义角色声音并逐行控制场景对白。
推荐理由:原文同时给出能力、评测和开放渠道,便于判断 Gemini 音频模型在创作与企业语音场景的定位。
World Labs 推出下一代世界模型 Atlas,它从零预训练,可原生处理文本、图像、视频和 3D,并采用多模态自回归扩散 Transformer 架构。Atlas 支持相机控制生成、空间重建、时空模拟和图像生成,可从 1 到 6 张输入图像生成最高 1 分钟、1440p 视频,也能输出点云或 3D Gaussian splats。
推荐理由:原文展示了空间上下文、相机控制和3D输出,便于判断世界模型在创作与机器人仿真中的用法。
zai-org 发布 GLM-5.3-Flash,称其为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 激活参数。官方称它在基准和真实工作负载中超过 GLM-5.2,价格为其十分之一,并在编码和智能体基准上接近 Claude Opus 4.8。
推荐理由:原文同时给出参数规模、架构变化和本地部署框架,便于比较其成本与落地路径。
美团 LongCat 在 Hugging Face 发布 LongCat-Flash-Lite-Sparse,这是基于 LongCat-Flash-Lite 的非思考 MoE 模型,拥有 69B 总参数、每 token 约 3B 激活参数,并原生支持最高 1M tokens 上下文。
推荐理由:原文同时给出架构改动、长上下文设定和多项基准,便于比较稀疏版与密集前代的取舍。
MiniMaxAI 在 Hugging Face 发布 MiniMax-H3,这是一个通用全模态生成系统,支持文本、图像、视频和音频组成的多模态上下文理解,并可生成带原生立体声音频的视频。
推荐理由:原文披露了模块拆分、输入规格和本地部署路径,可帮助开发者评估接入成本与适用场景。
Mistral 发布 Mistral-Medium-3.5-128B-EAGLE,用于为 Mistral Medium 3.5 执行推测解码。
推荐理由:原文同时给出模型规格、替代关系和 vLLM/SGLang 部署方式,便于评估统一模型的接入成本。
Moonshot AI 在 Hugging Face 发布 Kimi-K2.6,这是开源的原生多模态智能体模型。该模型采用 MoE 架构,Total Parameters 1T、Activated Parameters 32B、Context Length 256K,支持长周期编码、coding-driven design、Agent Swarm、图像和视频输入。
推荐理由:原文同时给出模型结构、评测表和部署入口,便于对比其在编码与智能体任务中的定位。