跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

205条精选相关主题产品更新论文研究开源生态

最新精选

第 201–205 条 · 共 205 条
3月7日周五
  1. Mistral AI76

    Mistral AI 发布 Mistral OCR 文档理解 API

    Mistral AI 发布 Mistral OCR,这是一款用于文档理解的 OCR API,可处理图片和 PDF,抽取有序交错的文本与图片,适合与面向多模态文档的 RAG 系统结合。

    推荐理由:原文同时给出基准、价格和部署形态,便于比较文档理解 API 在 RAG 流程中的位置。

11月19日周二
  1. Suno Blog72

    Suno 发布 v4 beta,面向 Pro 和 Premier 开放

    Suno 推出 v4,这一大版本更新带来更清晰的音频、更锐利的歌词和更动态的歌曲结构。v4 新增 Remaster、Lyrics by ReMi 和 Cover Art,并升级 Covers [v4] 与 Personas [v4]。v4 现已以 beta 形式面向 Pro 和 Premier 开放,可在 suno.com 和 iOS 体验。

    推荐理由:原文列出 v4 在音频、歌词和歌曲结构上的改进,并说明 Pro 和 Premier 的 beta 可用范围。

10月1日周二
  1. openai · Hugging Face 新模型67

    OpenAI 发布 Whisper large-v3-turbo 语音识别模型

    OpenAI 在 Hugging Face 发布 Whisper large-v3-turbo,它是 Whisper large-v3 的剪枝微调版本。模型将解码层从 32 层减少到 4 层,因此速度更快,但会有轻微质量下降;参数量为 809 M,支持在 Hugging Face Transformers 中用于自动语音识别、语音翻译和时间戳预测。

    推荐理由:模型卡同时给出结构变化与部署示例,便于评估语音转写场景中的速度和质量取舍。

3月21日周四
  1. Suno Blog78

    Suno 发布 v3,可在数秒内生成两分钟歌曲

    Suno 发布 v3,这是其第一个能够生成广播级音乐的模型,现已面向所有用户在 https://app.suno.ai 开放。v3 可用几句短文本在数秒内生成完整的两分钟歌曲,并改进音频质量、风格和流派数量、提示词遵循能力,减少模型幻觉并带来更自然的结尾。Suno 还表示其模型不会识别对其他艺术家的引用,并开发了专有的不可听水印技术,用于检测歌曲是否由 Suno 创建。

    推荐理由:材料同时交代了 v3 的开放范围、歌曲时长、音质改进和水印安全措施,便于理解 Suno 的产品取向。

11月8日周三