用 NVIDIA VSS Blueprint 3.3 降低构建和运行视觉 AI 智能体的成本
NVIDIA VSS Blueprint 3.3 面向视觉 AI 智能体,旨在降低构建和运行可维护视频理解系统的成本。NVIDIA Metropolis Blueprint for Video Search and Summarization (VSS) 及其 agent skills 支持摄取、流处理、事件检测、检索、摘要和报告等环节。
NVIDIA VSS Blueprint 3.3 面向视觉 AI 智能体,旨在降低构建和运行可维护视频理解系统的成本。NVIDIA Metropolis Blueprint for Video Search and Summarization (VSS) 及其 agent skills 支持摄取、流处理、事件检测、检索、摘要和报告等环节。
World Labs 推出下一代世界模型 Atlas,它从零预训练,可原生处理文本、图像、视频和 3D,并采用多模态自回归扩散 Transformer 架构。Atlas 支持相机控制生成、空间重建、时空模拟和图像生成,可从 1 到 6 张输入图像生成最高 1 分钟、1440p 视频,也能输出点云或 3D Gaussian splats。
推荐理由:原文展示了空间上下文、相机控制和3D输出,便于判断世界模型在创作与机器人仿真中的用法。
MiniMaxAI 在 Hugging Face 发布 MiniMax-H3,这是一个通用全模态生成系统,支持文本、图像、视频和音频组成的多模态上下文理解,并可生成带原生立体声音频的视频。
推荐理由:原文披露了模块拆分、输入规格和本地部署路径,可帮助开发者评估接入成本与适用场景。