AI 日报 · 2026 年 10 月 9 日 · 星期五
逗你 AI 资讯
OpenAI 全球推出 GPT-6
OpenAI 宣布 GPT-6 正在 ChatGPT 中面向全球推出,并配套 Intelligent UI,提供更快响应和交互式视觉体验。Anthropic 发布 Claude Haiku 5.5,并上线 Claude Platform、Claude Code 及 AWS 平台。安全方面,Zenity 披露 Bedrock AgentCore 账户级劫持风险,Common Sense Media 将 ChatGPT 青少年保护评为“不可接受风险”。
模型发布/更新
Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna
Anthropic 发布 Claude Haiku 5.5,这是约一年以来 Haiku 层级的更新,定价对齐 OpenAI 的 GPT-6 Luna,并已上线 Claude Platform 和 Claude Code。
OpenAI 在 ChatGPT 中全球推出 GPT-6 和 Intelligent UI
OpenAI 宣布 GPT-6 正在 ChatGPT 中面向全球推出,并配套 Intelligent UI。该更新提供更快响应,以及可直接探索和使用的视觉与交互体验。
Claude Haiku 5.5 登陆 Amazon Bedrock 和 Claude Platform on AWS
AWS 宣布 Claude Haiku 5.5 已可在 Amazon Bedrock 和 Claude Platform on AWS 使用。Anthropic 称它是 Claude 5.5 系列中最快、最高效的模型,面向 subagents 和高容量、成本敏感工作,多数任务成本比 Claude Haiku 4.5 低约 75%。
Hugging Face 博客介绍 Nemotron 微调在 IOI 2026 和 IMO 2026 达到金牌水平
Hugging Face 博客介绍了从 Nemotron 3 出发,通过 SFT、RL 和反馈驱动推理,让 Nemotron 系统在 IMO 2026 与 IOI 2026 都达到金牌水平。
Liquid AI 发布面向端侧的多模态 open d1 决策模型 d1-3B 和 d1-omni-600M
Liquid AI 发布 d1 决策模型家族的两个开放模型 d1-3B 和 d1-omni-600M,面向端侧快速结构化决策。d1-3B 支持文本和图像,在 Decision Index 0.2.1 得分 48.57,并在七个公开数据集均分 82.9;d1-omni-600M 为实验性早期研究发布,支持文本加图像或文本加音频,均分 78.4。
产品发布/更新
OpenAI 随 GPT-6 推出 ChatGPT 新界面 Intelligent UI
OpenAI 将随 GPT-6 推出 ChatGPT 新界面 Intelligent UI,在对话中加入大量可交互视觉元素。该界面可生成可点击按钮、定制计算器、交互式图表、可编辑图形等内容,示例包括机翼升力图解、食谱视觉化、多日徒步地图和个人储蓄计算器。
Microsoft Research 发布 Agent Lightning v1.0 轻量级 Agentic RL 框架
Microsoft Research Asia 发布并开源 Agent Lightning v1.0,这是一个约 3,500 行代码的轻量级 Agentic RL 框架,用于在真实 agent harness 中训练智能体。
GitHub 推出用于 Secret Protection 的 ModernBERT 分类器
GitHub 介绍了与 Microsoft Applied Sciences 构建的 ModernBERT 分类器,用于把 push protection 扩展到非结构化 secret。
Google 推出实验性游戏平台 Playground,可用提示词创建和分享自定义游戏
Google 推出 Playground,这是一个实验性游戏平台,支持用户创建、游玩和分享自定义游戏,无需编码。用户可通过对话界面从空白画布、starter prompts 或 guided support 开始,用文本提示词调整物理效果、规则、角色和环境,并可通过链接分享或发布到 Playground Explore gallery。
行业动态
Zenity 研究称单个提示词可劫持同一 AWS 账户中的所有 AgentCore agents
Zenity Labs 研究人员称,Amazon Bedrock AgentCore 上一个公开可访问的 AI agent 足以接管同一 AWS 账户和区域内的所有 AgentCore agents。
Common Sense Media 评估 ChatGPT 青少年保护为“不可接受风险”
Common Sense Media Youth AI Safety Institute 在超过 4,000 个测试提示词后,将 ChatGPT for Teens 评为对未成年人的“不可接受风险”。
NVIDIA 与 Microsoft 推出 RTX Spark Windows PC,并预览 DGX Station for Windows
NVIDIA 与 Microsoft 在 San Francisco 的 Windows AI and Surface 活动上介绍面向 Windows PC 的本地 AI 与 Agent 方案,包括 RTX Spark 设备、Microsoft Execution Containers 和 DGX Station for Windows。
论文研究
Google Research 研究 AI 辅助是否会提升或侵蚀专利律师专业能力
Google Research 介绍了一项 NBER 论文中的三个月现场实验,研究 AI 专利写作助手对 133 名专利律师短期产出和长期技能的影响。
技巧与观点
Tessl 复盘企业级 Agent 记忆系统设计:AI 不是笨,而是看不见上下文
Ran Aroussi 复盘了在 VarOps 为跨组织 Agent 构建记忆系统的经验,认为许多 Agent 失败不是模型不够聪明,而是缺少可用的企业上下文。
Cornerstone OnDemand 如何用 Amazon Bedrock 将数据库诊断时间减少 78%
Cornerstone OnDemand 构建了名为 Orion AI 的多 Agent 系统,用 Amazon Bedrock 和 AWS 开源编排框架 Strands Agents 将数据库诊断从 45 分钟降至 10 分钟,减少 78%。
Tessl 解析如何工程化上下文驱动的软件工厂
Tessl 文章说明,上下文可以让智能体在软件工厂中承担更多需要判断的工作,但需要工程机制保证可靠性。文章以 API 迁移为例,讨论兼容性策略、工具权限、工作流门禁、回归测试和上下文污染等问题。作者建议将共享指导封装为版本化 Skill,用工具权限实现授权边界,把失败转化为 Agent eval,并跟踪需求、检查项和每次运行的上下文版本。