跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

43条精选相关主题多模态AI 视频产品更新

最新精选

第 41–43 条 · 共 43 条
10月1日周二
  1. openai · Hugging Face 新模型67

    OpenAI 发布 Whisper large-v3-turbo 语音识别模型

    OpenAI 在 Hugging Face 发布 Whisper large-v3-turbo,它是 Whisper large-v3 的剪枝微调版本。模型将解码层从 32 层减少到 4 层,因此速度更快,但会有轻微质量下降;参数量为 809 M,支持在 Hugging Face Transformers 中用于自动语音识别、语音翻译和时间戳预测。

    推荐理由:模型卡同时给出结构变化与部署示例,便于评估语音转写场景中的速度和质量取舍。

9月12日周四
  1. Suno Blog70

    Suno 推出早期测试版 Covers 功能

    Suno 推出早期测试版 Covers 功能,可将语音备忘录或完整制作的曲目转换成新风格,同时保留原始旋律。该功能面向所有 Pro 和 Premier 订阅用户开放,起始提供 200 次免费 Covers,之后每次生成消耗 10 credits。Suno 提示测试期可能出现未按预期改编、返回原始片段等情况,并通过应用、Discord 或 [email protected] 收集反馈。

    推荐理由:原文说明了适用对象、操作路径和计费方式,便于订阅用户评估试用成本。

11月8日周三