用 NVIDIA VSS Blueprint 3.3 降低构建和运行视觉 AI 智能体的成本
NVIDIA VSS Blueprint 3.3 面向视觉 AI 智能体,旨在降低构建和运行可维护视频理解系统的成本。NVIDIA Metropolis Blueprint for Video Search and Summarization (VSS) 及其 agent skills 支持摄取、流处理、事件检测、检索、摘要和报告等环节。
NVIDIA VSS Blueprint 3.3 面向视觉 AI 智能体,旨在降低构建和运行可维护视频理解系统的成本。NVIDIA Metropolis Blueprint for Video Search and Summarization (VSS) 及其 agent skills 支持摄取、流处理、事件检测、检索、摘要和报告等环节。
Sakana AI 与东京大学提出 SAIL,用测试时扩展提升 VLM 生成机器人轨迹的可靠性,并将在 IROS2026 展示。SAIL 让 policy VLM 生成轨迹、在模拟器测试,再由 evaluation VLM 反馈并结合 MCTS 修正;在 6 个模拟操作任务中,搜索预算从 1 个候选增至 45 个后,成功轨迹发现率从 25% 升至 73%。
internlm 发布 Intern-Decision-2B,这是一个由 Qwen3.5-2B 微调而来的多模态结构化决策模型,可接收共享状态、命名问题 schema 和可选图像,并在一次模型前向中为每个问题返回答案分布。
Intern-Decision 将状态、可选图像和多类问题转换为带概率的决策,并微调 Qwen3.5 语言骨干。Intern-Decision-4B 在七个测试套件平均准确率达 90.02%,RTX 4090 本地平均延迟为 44.16 ms。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两个文本转语音模型,用于生成自定义角色声音并逐行控制场景对白。
推荐理由:原文同时给出能力、评测和开放渠道,便于判断 Gemini 音频模型在创作与企业语音场景的定位。
NVIDIA 在 Hugging Face 发布 DeepSeek-V4.1-Flash-NVFP4,这是 DeepSeek AI 的 DeepSeek-V4.1-Flash 的 NVFP4 量化版。
InternLM 发布 Intern-S2-397B,称其是面向科学智能和长周期 Agent 的多模态基础模型。该模型结合新的视觉语言预训练范式、大规模多任务强化学习和长周期 Agent 强化学习,覆盖 20 多个科学领域,并在文本推理评测中使用最高 256K tokens、在多模态评测中使用最高 64K tokens。
推荐理由:材料同时给出训练方向、评测设置和部署入口,便于比较科学智能模型的工程落地路径。
InternLM 的 SciDocBench 发布完整科学文档理解基准、Hugging Face 数据资产、SFT/RL 训练数据和支持代码,并集成到 VLMEvalKit。
World Labs 推出下一代世界模型 Atlas,它从零预训练,可原生处理文本、图像、视频和 3D,并采用多模态自回归扩散 Transformer 架构。Atlas 支持相机控制生成、空间重建、时空模拟和图像生成,可从 1 到 6 张输入图像生成最高 1 分钟、1440p 视频,也能输出点云或 3D Gaussian splats。
推荐理由:原文展示了空间上下文、相机控制和3D输出,便于判断世界模型在创作与机器人仿真中的用法。
zai-org 发布 GLM-5.3-Flash,称其为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 激活参数。官方称它在基准和真实工作负载中超过 GLM-5.2,价格为其十分之一,并在编码和智能体基准上接近 Claude Opus 4.8。
推荐理由:原文同时给出参数规模、架构变化和本地部署框架,便于比较其成本与落地路径。
MiniMaxAI 在 Hugging Face 发布 MiniMax-H3,这是一个通用全模态生成系统,支持文本、图像、视频和音频组成的多模态上下文理解,并可生成带原生立体声音频的视频。
推荐理由:原文披露了模块拆分、输入规格和本地部署路径,可帮助开发者评估接入成本与适用场景。
Mistral 发布 Mistral-Medium-3.5-128B-EAGLE,用于为 Mistral Medium 3.5 执行推测解码。
推荐理由:原文同时给出模型规格、替代关系和 vLLM/SGLang 部署方式,便于评估统一模型的接入成本。
BeTTER 公开官方代码,用于诊断 Vision-Language-Action 模型中的具身推理幻觉。该 ECCV 2026 项目提供基于 Isaac Sim 的 benchmark 和任务编辑工具栈,包含 Task Editor、Assets Editor、Variation Editor、检索服务器、遥操作与渲染工具。
Moonshot AI 在 Hugging Face 发布 Kimi-K2.6,这是开源的原生多模态智能体模型。该模型采用 MoE 架构,Total Parameters 1T、Activated Parameters 32B、Context Length 256K,支持长周期编码、coding-driven design、Agent Swarm、图像和视频输入。
推荐理由:原文同时给出模型结构、评测表和部署入口,便于对比其在编码与智能体任务中的定位。