World Labs 发布 RTFM 实时生成式世界模型研究预览
World Labs 分享了 RTFM(Real-Time Frame Model),一个可在交互时实时生成视频的生成式世界模型,今天以研究预览版开放。RTFM 可用于探索生成的 3D 世界和真实地点,并可在浏览器中 demo;其目标是在单个 H100 GPU 上以交互帧率推理。
推荐理由:原文披露了单 H100 实时生成持久 3D 世界的架构思路,可作为世界模型工程取舍参考。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
World Labs 分享了 RTFM(Real-Time Frame Model),一个可在交互时实时生成视频的生成式世界模型,今天以研究预览版开放。RTFM 可用于探索生成的 3D 世界和真实地点,并可在浏览器中 demo;其目标是在单个 H100 GPU 上以交互帧率推理。
推荐理由:原文披露了单 H100 实时生成持久 3D 世界的架构思路,可作为世界模型工程取舍参考。
百度在 Hugging Face 上发布 Qianfan-VL-70B,属于 Qianfan-VL 通用多模态大语言模型系列,面向企业级多模态应用。该系列包含 Qianfan-VL-3B、Qianfan-VL-8B 和 Qianfan-VL-70B,均为 32k 上下文,其中 8B 和 70B 支持 CoT,70B 面向复杂推理和数据合成。
推荐理由:材料同时列出3B、8B、70B差异与训练流程,便于比较文档理解场景的部署取舍。
百度在 Hugging Face 发布 Qianfan-VL-8B,属于 Qianfan-VL 系列通用多模态大语言模型,面向企业级多模态应用并强化 OCR 与文档理解。
推荐理由:原文同时给出模型规格、训练流程和基准对比,便于评估其在 OCR 与文档理解场景的适配度。
百度在 Hugging Face 发布 Qianfan-VL-3B,属于 Qianfan-VL 通用视觉语言模型系列,面向企业级多模态应用并强化 OCR、文档理解等场景。
推荐理由:模型卡列出3B到70B规格、训练阶段、基准和部署示例,便于比较企业多模态场景适配。
World Labs 推出 Marble 限量访问 beta 预览,用户可在 marble.worldlabs.ai 查看并创建 3D 世界。给定图像或文本提示词,其模型可生成可长期探索的 3D 世界,并称相比此前结果,世界更大、风格更多样、3D 几何更干净。
推荐理由:原文展示了从图像或文本生成可导航 3D 世界的入口和导出方式,便于评估创作者工作流适配。
Mistral AI 为 Le Chat 推出一组新功能,包括 Deep Research (Preview)、Voice mode、原生多语言推理、Projects 和高级图像编辑。
推荐理由:原文集中列出 Le Chat 的研究、语音、项目和图像编辑入口,便于比较其助手形态的扩展方向。
Mistral AI 发布 Voxtral 语音理解模型,包括面向生产应用的 24B 版和面向本地与端侧部署的 3B 版。两个版本均采用 Apache 2.0 许可证,并可通过 API 使用,转写价格从 $0.001 per minute 起,也已开放在 Hugging Face 下载。
推荐理由:原文同时给出模型尺寸、授权、API价格和语音基准,便于评估开源语音理解的部署取舍。
Mistral AI 发布 Mistral Medium 3,称其在 SOTA 性能、8X lower cost 和更简单部署之间取得平衡,面向企业使用。Mistral 称该模型在全套基准上达到或超过 Claude Sonnet 3.7 的 90%,价格为 $0.4 input / $2 output per M token,并在编码和多模态理解等专业场景表现突出。
推荐理由:原文同时给出价格、部署方式和对比基准,便于评估中型模型在企业场景的取舍。
Mistral AI 发布 Mistral Small 3.1,称其在文本性能、多模态理解和最长 128k tokens 上下文窗口上改进,并以 150 tokens per second 的速度超过 Gemma 3、GPT-4o Mini 等同类模型。
推荐理由:材料同时给出性能对比、运行门槛和开放渠道,便于评估小模型在端侧与企业场景的适配。
Mistral AI 发布 Mistral OCR,这是一款用于文档理解的 OCR API,可处理图片和 PDF,抽取有序交错的文本与图片,适合与面向多模态文档的 RAG 系统结合。
推荐理由:原文同时给出基准、价格和部署形态,便于比较文档理解 API 在 RAG 流程中的位置。
Suno 推出新功能 Suno Scenes,让用户可以从手机相机中的照片和视频创建独特歌曲。该功能首先面向 iOS 移动用户开放,下载 app 后可在歌曲创作体验的 Camera mode 下找到。Suno 鼓励用户用 #sunoscenes 和 @suno_ai_、@sunomusic 分享创作内容。
推荐理由:原文说明了从照片和视频生成歌曲的入口,可帮助判断 Suno 在移动端创作场景的扩展。
Suno 宣布推出 Suno mobile app,version one 可在手机上制作、收听和整理音乐。用户可以用文本歌词和描述生成歌曲,也可以用手机录音并把音频变成歌曲;Suno 称已有 Twelve million people 使用过其产品。该应用目前先从美国 iOS 开始,Android、全球发布和更多更新将随后推出。
推荐理由:官方给出移动端版本的可用范围和核心入口,便于判断音乐生成如何迁移到手机场景。
Suno 发布 Audio Input 功能,Pro & Premier 用户现在可以上传或录制自己的音频来生成歌曲。用户可在 Library 或 Create 页面点击 Upload Audio,录制音频或上传 6 - 60 秒的音频/视频片段,再选择 Extend、设置延展时间点、填写曲风并可加入歌词。Suno 表示受版权保护的作品会被阻止上传,所有带人声的输入将保持私密且不可搜索。
推荐理由:原文同时给出上传流程和责任限制,便于判断音频输入会怎样进入音乐创作流程。