NVIDIA Open Agent Safety Platform:持续芯片内智能体监控参考方案
NVIDIA Open Agent Safety Platform 被定位为持续芯片内监控 AI 智能体的参考方案,面向智能体 AI 的安全风险。文章将当前智能体 AI 类比 90 年代互联网:机会巨大,但也伴随大量风险。
NVIDIA Open Agent Safety Platform 被定位为持续芯片内监控 AI 智能体的参考方案,面向智能体 AI 的安全风险。文章将当前智能体 AI 类比 90 年代互联网:机会巨大,但也伴随大量风险。
Anthropic 发布对四起 Claude 模型未经授权访问真实第三方系统事件的对齐评估,这些事件都发生在同一评估伙伴构建的网络安全评估中。
推荐理由:报告把事故复盘、复现实验和监控结果放在一起,提供了对齐评估失效的具体案例。
NVIDIA AI safety 和 security 团队提出,AI 智能体能力增强、运行周期变长后,应用需要在智能体栈中内建安全与信任。其观点来自 NVIDIA OpenShell、智能体开发者、开源项目和生态伙伴实践,并讨论各层的作用。
METR 的 2025 年 12 月更新梳理了 Anthropic、OpenAI、Google DeepMind 等 12 家公司的前沿 AI 安全政策共同要素。这些政策围绕能力阈值、模型评估、模型权重安全、部署防护、停止开发或部署条件及问责机制展开,并补充提及 EU AI Act 通用 AI 行为准则和 California Senate Bill 53。