OpenAI 在 DevDay 2026 扩展 Codex 与 API,加入安全扫描、Decisions API 和 Ultrafast
OpenAI 在 DevDay 2026 扩展 Codex 和 API,加入可复用云环境、安全扫描、Decisions API 与 Ultrafast 速度层。
推荐理由:原文集中列出 Codex、Agents API 和计费层变化,便于比较开发者工作流、部署方式与成本影响。
OpenAI 在 DevDay 2026 扩展 Codex 和 API,加入可复用云环境、安全扫描、Decisions API 与 Ultrafast 速度层。
推荐理由:原文集中列出 Codex、Agents API 和计费层变化,便于比较开发者工作流、部署方式与成本影响。
OpenAI 在 DevDay 宣布 Codex 更新,为软件工程 Agent 增加可跨设备访问的可复用云开发环境,并同步更新 Codex CLI、代码审查体验、安全工具和 API。
推荐理由:原文串联了 Codex 云环境、CLI、代码审查和安全工具,可帮助判断其面向团队开发的工作流扩展。
Amazon Bedrock 在印度提供 Anthropic Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,可通过印度地理跨 Region 推理访问。该配置仅在 ap-south-1 与 ap-south-2 间路由请求,支持 Anthropic Messages API、InvokeModel API 和 Converse API。
Amazon Bedrock 现支持 Anthropic Claude Opus 5、Claude Sonnet 5 在首尔,以及 Claude Sonnet 5 在新加坡通过 bedrock-runtime 进行区域内推理。
NVIDIA TensorRT Model Connect 是基于 NVIDIA TensorRT 的开源 C++ AI 模型参考实现集合,围绕 coding agents 设计。项目经验强调并行工作、模型族隔离、可逆变更和 GPU 支持的验证,目标是让 NVIDIA 推理栈性能更易被使用。
NVIDIA VSS Blueprint 3.3 面向视觉 AI 智能体,旨在降低构建和运行可维护视频理解系统的成本。NVIDIA Metropolis Blueprint for Video Search and Summarization (VSS) 及其 agent skills 支持摄取、流处理、事件检测、检索、摘要和报告等环节。
OpenAI 介绍高级速度层 Ultrafast,在 Codex 中提供最高 8x 的 token 生成速度,达到 300 tokens per second。该速度层在 API 中最高提升 6x。
Artificial Analysis 开源 AA-AgentPerf-Local,用于在笔记本和工作站上回放真实智能体轨迹,测试本地 AI 模型的推理性能。其默认工作负载包含 8 个录制的智能体任务、168 个模型轮次,上下文增长到 ~56K tokens,并可测试任何 OpenAI-compatible inference server。
Microsoft 在欧洲 Microsoft Fabric + SQL Community Conference 上推出 Microsoft Fabric 和 Azure Databases 多项更新,把企业数据、业务上下文和治理能力接入 AI 工作流。
推荐理由:原文集中列出 Fabric 与 Azure Databases 的更新,可帮助判断微软如何把企业数据治理接入 Copilot 与智能体工作流。
Google AI Dev 介绍了生产环境中加固 AI 智能体沙盒的 7 种方法,强调标准 Docker 容器无法充分防止内核逃逸、凭证泄露和间接 Prompt injection。
推荐理由:文章把隔离、密钥、网络和审计拆成可执行控制点,适合在编码 Agent 迁移生产环境前对照检查。
Databricks 介绍了如何在新模型发布 Day 1 向超过 12,000 名员工开放访问,同时用 Unity Gateway 做治理、成本管理和可观测性。
Databricks 发布 Lakebase Search,通过 lakebase_vector 和 lakebase_text 两个扩展把可扩展近似邻居搜索与 BM25 全文搜索带入 Lakebase Postgres,已在 AWS 和 Azure GA。
阿里瓴羊在云栖大会推出「AI员工7日上场计划」,让企业用真实业务题试岗AI员工7天,并以收入、转化、留存、GMV和ROI等指标验收。瓴羊称其Business层AI需进入ERP、CRM和自研系统,结合Data+Agent+FDE落地。岚图营销配置从12至24小时降至3小时以内,飞鹤省级经营管报从3天压缩到1小时。
华为在AIDC基础设施峰会上介绍源网荷储AIDC 1.0,主张以算电协同重构AI数据中心。方案覆盖Watt、Heat、Bit和建设模式,泰山UPS单柜1280kVA、最高98%效率,恒山直流UPS支持270V、400V、800V。电力模块5.0占地减少40%、交付由7天缩至3天,商汤临港智算中心18MW扩容供配电系统45天交付。
NVIDIA Open Agent Safety Platform 被定位为持续芯片内监控 AI 智能体的参考方案,面向智能体 AI 的安全风险。文章将当前智能体 AI 类比 90 年代互联网:机会巨大,但也伴随大量风险。
World Labs 已签署最终协议加入 AMD,交易预计在 2026 年底前完成,需获监管批准并满足惯常交割条件。双方此前从 AMD GPU 上的模型训练和推理优化开始技术合作,计划建设覆盖硬件、软件、平台和广泛可访问开放模型的端到端开放 AI 生态。
推荐理由:交易把 World Labs 的空间智能研究与 AMD 硬件体系连接起来,后续重点落在开放 AI 生态。
Intern-Decision 将状态、可选图像和多类问题转换为带概率的决策,并微调 Qwen3.5 语言骨干。Intern-Decision-4B 在七个测试套件平均准确率达 90.02%,RTX 4090 本地平均延迟为 44.16 ms。
NVIDIA 加入 Google DeepMind、EMBL-EBI 等全球研究机构联盟,在 AlphaFold Database 开放发布 2,800 多种病毒的蛋白复合体预测 3D 结构。
推荐理由:原文展示了开放数据集与生成流程,能帮助理解 AI 蛋白结构预测在疫情准备中的应用。
Microsoft Research 研究显示,现实物理 AI 机器人只依赖板载 GPU 推理会限制性能、电池寿命和扩展性,将推理卸载到边缘或云端 GPU 可带来优势。
推荐理由:原文用机器人任务对比板载、边缘和云端推理,为物理 AI 推理基础设施设计提供参考。
Google DeepMind 介绍了 Private AI Compute 的新架构,将在服务端提供私有、持久、跨设备的 AI 记忆,同时维持接近端侧处理的隐私标准。
字节跳动安全研究团队与香港城市大学的联合研究 TWIST 被 ACM CCS 2026 接收,提出面向云上大模型托管的隐私保护推理方案。TWIST 通过联合模型-Token 变换、加性-乘性混合噪声和 RmDP 分析,在不修改推理引擎、不依赖特殊硬件的情况下兼容标准 serving 流程。
腾讯基于智能体编排平台搭建错误码治理 Agent,将知识库、代码关系图谱、可观测平台数据和代码托管平台挂载到同一 Agent,分钟级产出根因分析和修复建议。在 50 条 case 对比中,优化后的 action_type 与人工标注一致率从 66% 提升到 88%,硬冲突率从 20% 降至 0%。工作流已上线,近一个月内日均处理数百条去重错误码告警,high 置信度占比约 90%,失败率约 1%。
阿里云在2026云栖大会MaaS&Agent技术主论坛宣布千问AI平台全面升级,新增Agent服务和行业AI解决方案支持,并推出API优速模式、Agent Studio、千问AI座舱解决方案等能力。
NVIDIA 在 Hugging Face 发布 DeepSeek-V4.1-Flash-NVFP4,这是 DeepSeek AI 的 DeepSeek-V4.1-Flash 的 NVFP4 量化版。
Cognition 与 AWS 达成多年 Strategic Collaboration Agreement,帮助企业在生产环境部署自主工程师,并用 Devin 加速迁移、清理安全和工程积压。
Cloudera 与 Mistral 宣布合作,把 Mistral 模型集成进 Cloudera 混合数据平台,支持企业在私有云、公有云、本地和完全隔离环境中运行推理。双方还将支持企业在受控环境中用专有数据训练定制 AI 模型,面向 Cloudera 平台上的 30 exabytes 客户管理数据提供主权 AI。
zai-org 发布 GLM-5.3-Flash,称其为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 激活参数。官方称它在基准和真实工作负载中超过 GLM-5.2,价格为其十分之一,并在编码和智能体基准上接近 Claude Opus 4.8。
推荐理由:原文同时给出参数规模、架构变化和本地部署框架,便于比较其成本与落地路径。
美团 LongCat 在 Hugging Face 发布 LongCat-Flash-Lite-Sparse,这是基于 LongCat-Flash-Lite 的非思考 MoE 模型,拥有 69B 总参数、每 token 约 3B 激活参数,并原生支持最高 1M tokens 上下文。
推荐理由:原文同时给出架构改动、长上下文设定和多项基准,便于比较稀疏版与密集前代的取舍。
BAIR 介绍了将 K-Search 扩展到 MLX 的研究,用结构化 CUDA-to-MLX 翻译层把既有 CUDA 内核优化经验迁移到 Apple Silicon。
MiniMaxAI 在 Hugging Face 发布 MiniMax-H3,这是一个通用全模态生成系统,支持文本、图像、视频和音频组成的多模态上下文理解,并可生成带原生立体声音频的视频。
推荐理由:原文披露了模块拆分、输入规格和本地部署路径,可帮助开发者评估接入成本与适用场景。
World Labs 分享 R2S2R 引擎早期结果,称其可把真实机器人任务重建为对齐仿真,用于训练、测试并预测机器人策略在现实中的表现。SceniX 于 7 月 21 日加入 World Labs,其 real-to-sim-to-real 系统把真实机器人、环境和交互转成可控、可复用的仿真世界。
推荐理由:原文用多个机器人任务说明 R2S2R 的训练和评估闭环,可作为仿真驱动机器人学习的技术参考。
BAIR 文章认为 AI 推理成本快速下降正在带来近乎免费的智能,并将改变数据系统的设计方向。文中称 GPT-4-class 能力成本从 early 2023 的 roughly $30 per million tokens 降到 today under $1,部分提供商低于 $0.10,跨基准推理价格每年下降 9x 到 900x,中位数接近 50x。
Mistral 发布 Mistral-Medium-3.5-128B-EAGLE,用于为 Mistral Medium 3.5 执行推测解码。
推荐理由:原文同时给出模型规格、替代关系和 vLLM/SGLang 部署方式,便于评估统一模型的接入成本。