Mistral AI 发布 Mistral OCR 文档理解 API
Mistral AI 发布 Mistral OCR,这是一款用于文档理解的 OCR API,可处理图片和 PDF,抽取有序交错的文本与图片,适合与面向多模态文档的 RAG 系统结合。
推荐理由:原文同时给出基准、价格和部署形态,便于比较文档理解 API 在 RAG 流程中的位置。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Mistral AI 发布 Mistral OCR,这是一款用于文档理解的 OCR API,可处理图片和 PDF,抽取有序交错的文本与图片,适合与面向多模态文档的 RAG 系统结合。
推荐理由:原文同时给出基准、价格和部署形态,便于比较文档理解 API 在 RAG 流程中的位置。
Suno 推出 v4,这一大版本更新带来更清晰的音频、更锐利的歌词和更动态的歌曲结构。v4 新增 Remaster、Lyrics by ReMi 和 Cover Art,并升级 Covers [v4] 与 Personas [v4]。v4 现已以 beta 形式面向 Pro 和 Premier 开放,可在 suno.com 和 iOS 体验。
推荐理由:原文列出 v4 在音频、歌词和歌曲结构上的改进,并说明 Pro 和 Premier 的 beta 可用范围。
OpenAI 在 Hugging Face 发布 Whisper large-v3-turbo,它是 Whisper large-v3 的剪枝微调版本。模型将解码层从 32 层减少到 4 层,因此速度更快,但会有轻微质量下降;参数量为 809 M,支持在 Hugging Face Transformers 中用于自动语音识别、语音翻译和时间戳预测。
推荐理由:模型卡同时给出结构变化与部署示例,便于评估语音转写场景中的速度和质量取舍。
Suno 发布 v3,这是其第一个能够生成广播级音乐的模型,现已面向所有用户在 https://app.suno.ai 开放。v3 可用几句短文本在数秒内生成完整的两分钟歌曲,并改进音频质量、风格和流派数量、提示词遵循能力,减少模型幻觉并带来更自然的结尾。Suno 还表示其模型不会识别对其他艺术家的引用,并开发了专有的不可听水印技术,用于检测歌曲是否由 Suno 创建。
推荐理由:材料同时交代了 v3 的开放范围、歌曲时长、音质改进和水印安全措施,便于理解 Suno 的产品取向。
OpenAI 在 Hugging Face 上发布 Whisper large-v3,用于自动语音识别和语音翻译。
推荐理由:原文交代了训练数据、结构差异和误差下降幅度,便于比较 large-v2 与 large-v3 的改进。