跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 81–93 条 · 共 93 条
10月16日周四
  1. World Labs77

    World Labs 发布 RTFM 实时生成式世界模型研究预览

    World Labs 分享了 RTFM(Real-Time Frame Model),一个可在交互时实时生成视频的生成式世界模型,今天以研究预览版开放。RTFM 可用于探索生成的 3D 世界和真实地点,并可在浏览器中 demo;其目标是在单个 H100 GPU 上以交互帧率推理。

    推荐理由:原文披露了单 H100 实时生成持久 3D 世界的架构思路,可作为世界模型工程取舍参考。

9月16日周二
  1. baidu · Hugging Face 新模型65

    百度发布 Qianfan-VL-70B 视觉语言模型

    百度在 Hugging Face 上发布 Qianfan-VL-70B,属于 Qianfan-VL 通用多模态大语言模型系列,面向企业级多模态应用。该系列包含 Qianfan-VL-3B、Qianfan-VL-8B 和 Qianfan-VL-70B,均为 32k 上下文,其中 8B 和 70B 支持 CoT,70B 面向复杂推理和数据合成。

    推荐理由:材料同时列出3B、8B、70B差异与训练流程,便于比较文档理解场景的部署取舍。

  2. World Labs68

    World Labs 推出 Marble 限量 beta,可生成可导航 3D 世界

    World Labs 推出 Marble 限量访问 beta 预览,用户可在 marble.worldlabs.ai 查看并创建 3D 世界。给定图像或文本提示词,其模型可生成可长期探索的 3D 世界,并称相比此前结果,世界更大、风格更多样、3D 几何更干净。

    推荐理由:原文展示了从图像或文本生成可导航 3D 世界的入口和导出方式,便于评估创作者工作流适配。

7月17日周四
7月15日周二
  1. Mistral AI81

    Mistral AI 发布 Voxtral 语音理解模型,开源 24B 与 3B 版本

    Mistral AI 发布 Voxtral 语音理解模型,包括面向生产应用的 24B 版和面向本地与端侧部署的 3B 版。两个版本均采用 Apache 2.0 许可证,并可通过 API 使用,转写价格从 $0.001 per minute 起,也已开放在 Hugging Face 下载。

    推荐理由:原文同时给出模型尺寸、授权、API价格和语音基准,便于评估开源语音理解的部署取舍。

5月7日周三
  1. Mistral AI72

    Mistral AI 发布 Mistral Medium 3,主打低成本企业级语言模型

    Mistral AI 发布 Mistral Medium 3,称其在 SOTA 性能、8X lower cost 和更简单部署之间取得平衡,面向企业使用。Mistral 称该模型在全套基准上达到或超过 Claude Sonnet 3.7 的 90%,价格为 $0.4 input / $2 output per M token,并在编码和多模态理解等专业场景表现突出。

    推荐理由:原文同时给出价格、部署方式和对比基准,便于评估中型模型在企业场景的取舍。

3月17日周一
3月7日周五
  1. Mistral AI76

    Mistral AI 发布 Mistral OCR 文档理解 API

    Mistral AI 发布 Mistral OCR,这是一款用于文档理解的 OCR API,可处理图片和 PDF,抽取有序交错的文本与图片,适合与面向多模态文档的 RAG 系统结合。

    推荐理由:原文同时给出基准、价格和部署形态,便于比较文档理解 API 在 RAG 流程中的位置。

10月16日周三
  1. Suno Blog65

    Suno 推出 Suno Scenes,可用照片和视频创建歌曲

    Suno 推出新功能 Suno Scenes,让用户可以从手机相机中的照片和视频创建独特歌曲。该功能首先面向 iOS 移动用户开放,下载 app 后可在歌曲创作体验的 Camera mode 下找到。Suno 鼓励用户用 #sunoscenes 和 @suno_ai_、@sunomusic 分享创作内容。

    推荐理由:原文说明了从照片和视频生成歌曲的入口,可帮助判断 Suno 在移动端创作场景的扩展。

7月1日周一
  1. Suno Blog64

    Suno 发布移动应用,iOS 版先在美国上线

    Suno 宣布推出 Suno mobile app,version one 可在手机上制作、收听和整理音乐。用户可以用文本歌词和描述生成歌曲,也可以用手机录音并把音频变成歌曲;Suno 称已有 Twelve million people 使用过其产品。该应用目前先从美国 iOS 开始,Android、全球发布和更多更新将随后推出。

    推荐理由:官方给出移动端版本的可用范围和核心入口,便于判断音乐生成如何迁移到手机场景。

6月12日周三
  1. Suno Blog76

    Suno 推出 Audio Input 功能,支持用任意声音生成歌曲

    Suno 发布 Audio Input 功能,Pro & Premier 用户现在可以上传或录制自己的音频来生成歌曲。用户可在 Library 或 Create 页面点击 Upload Audio,录制音频或上传 6 - 60 秒的音频/视频片段,再选择 Extend、设置延展时间点、填写曲风并可加入歌词。Suno 表示受版权保护的作品会被阻止上传,所有带人声的输入将保持私密且不可搜索。

    推荐理由:原文同时给出上传流程和责任限制,便于判断音频输入会怎样进入音乐创作流程。