ElevenLabs 发布 Eleven v4 语音模型,提升表达力和长内容一致性
ElevenLabs 正在发布 Eleven v4 语音模型,称其能更准确遵循方向提示,并在长制作中保持声音一致。Eleven v4 支持 90 多种语言、每次请求最多 10,000 个字符,Turbo 变体面向实时语音智能体,约 150 毫秒开始生成语音。
推荐理由:原文同时给出语言覆盖、延迟、价格和对比测试,便于评估语音模型在创作与实时智能体中的适用性。
ElevenLabs 正在发布 Eleven v4 语音模型,称其能更准确遵循方向提示,并在长制作中保持声音一致。Eleven v4 支持 90 多种语言、每次请求最多 10,000 个字符,Turbo 变体面向实时语音智能体,约 150 毫秒开始生成语音。
推荐理由:原文同时给出语言覆盖、延迟、价格和对比测试,便于评估语音模型在创作与实时智能体中的适用性。
Google AI Dev 介绍如何用 Gemini Live API 构建实时语音 AI Agent,使浏览器、Python 后端和 Gemini Live API 通过 WebSocket 传输双向音频。
推荐理由:文章把实时语音 Agent 拆成 WebSocket、双循环、barge-in 和异步工具回执,便于复用到低延迟语音场景。
联通云犀工作流智能体从通信场景切入,把电话沟通信息转为可被 AI 理解和使用的数据,帮助企业 AI 嵌入业务流程。其重点布局 AI 数析、AI 助销、AI 助手,案例中某团队人均转化率提升 2.3 倍,新人培训周期从 2 周缩短至 3 天。平台历经 5 年技术打磨,已服务超 6 万家企业、800 万用户。
Apple ML 研究用预量化 latent 作为监督信号,蒸馏压缩 Apple 设备端听写所用的流式神经音频 tokenizer。2.8× compression 下,学生编码器在六组教师—学生组合中的五组无需 fine-tuning 即保持在教师 1.9% relative WER 以内,并比同容量独立训练 tokenizer 提升 3.9% relative。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两个文本转语音模型,用于生成自定义角色声音并逐行控制场景对白。
推荐理由:原文同时给出能力、评测和开放渠道,便于判断 Gemini 音频模型在创作与企业语音场景的定位。
Suno 宣布与 Believe 及其自助发行平台 TuneCore 达成全球战略合作,面向独立艺术家和厂牌开发可选择参与的新产品体验。使用 Suno 新行业合作伙伴模型创作的曲目将有资格通过 Believe 和 TuneCore 发行,相关音乐会适用音频水印、指纹识别和下载限制等保护。Suno 称新模型将很快发布,Believe、TuneCore 及其独立艺术家社区将参与后续发展。
推荐理由:原文呈现了 Suno 与分发方从分歧到合作的过程,可观察音乐生成工具进入发行链路的方式。
MiniMaxAI 在 Hugging Face 发布 MiniMax-H3,这是一个通用全模态生成系统,支持文本、图像、视频和音频组成的多模态上下文理解,并可生成带原生立体声音频的视频。
推荐理由:原文披露了模块拆分、输入规格和本地部署路径,可帮助开发者评估接入成本与适用场景。