OpenAI 发布 GPT-6.1 Sol,性能接近 Astra 且价格为五分之一
OpenAI 发布 GPT-6.1 Sol,称其在 agentic coding、computer use 和 office work 上接近 GPT-6.1 Astra,成本约为后者的五分之一。
推荐理由:原文同时列出 API 价格、基准和安全测试口径,便于比较 Sol 与 Astra 在成本和能力上的取舍。
OpenAI 发布 GPT-6.1 Sol,称其在 agentic coding、computer use 和 office work 上接近 GPT-6.1 Astra,成本约为后者的五分之一。
推荐理由:原文同时列出 API 价格、基准和安全测试口径,便于比较 Sol 与 Astra 在成本和能力上的取舍。
OpenAI 在 DevDay 2026 扩展 Codex 和 API,加入可复用云环境、安全扫描、Decisions API 与 Ultrafast 速度层。
推荐理由:原文集中列出 Codex、Agents API 和计费层变化,便于比较开发者工作流、部署方式与成本影响。
OpenAI 在 DevDay 活动上展示 GPT-6.1 Sol,称其在智能体编码、计算机使用和专业工作上接近 GPT-6 Astra,标准输入和输出 token 价格为 1/5。
推荐理由:原文同时交代价格、可用入口与安全背景,便于比较 GPT-6.1 Sol 和 GPT-6 Astra 的定位。
OpenAI 在 DevDay 宣布 Codex 更新,为软件工程 Agent 增加可跨设备访问的可复用云开发环境,并同步更新 Codex CLI、代码审查体验、安全工具和 API。
推荐理由:原文串联了 Codex 云环境、CLI、代码审查和安全工具,可帮助判断其面向团队开发的工作流扩展。
GPT-6.1 Sol 已在 Amazon Bedrock 正式可用,为编码、computer use 和高频专业工作负载带来更强推理能力。OpenAI 称它在 DeepSWE v1.1 上以约 one-fifth 的每任务成本匹配 GPT-6 Astra,并比 GPT-6 Sol 最佳分数高 6.4 percentage points。
推荐理由:原文同时给出任务成本对比与 Bedrock 生产控制,便于评估智能体工作流落地取舍。
Claude Code v2.1.285 增加多项 CLI、插件和管理配置能力,并修复云会话、MCP、Artifact 等问题。新增 CLAUDE_CODE_DISABLE_WEB_FETCH、claude --desktop、claude plugin configure、allowedProviders 等功能。
NVIDIA TensorRT Model Connect 是基于 NVIDIA TensorRT 的开源 C++ AI 模型参考实现集合,围绕 coding agents 设计。项目经验强调并行工作、模型族隔离、可逆变更和 GPU 支持的验证,目标是让 NVIDIA 推理栈性能更易被使用。
OpenAI DevDay 2026 台上宣布 usage reset,DidReset 将 Codex 的 29 Sep banked reset 标为 unverified,称官方 landed post 仍待发布。相关记录还提到 Dots、GPT-6.1 Sol 发布,以及 Pro $200 订阅将重新向新用户开放并调整 usage 计算方式。
OpenAI 介绍高级速度层 Ultrafast,在 Codex 中提供最高 8x 的 token 生成速度,达到 300 tokens per second。该速度层在 API 中最高提升 6x。
Codex 的 9月29日重置动态称,OpenAI DevDay 2026 现场宣布用量重置,并同时推出 Dots 和 GPT-6.1 Sol。条目标注为 unverified,称 Operator 已确认落地,官方 landed post 仍待发布;前一条还提到将重新开放 Pro $200 subscriptions 并调整用量计算方式。
Codex Reset 记录显示,OpenAI DevDay 2026 现场宣布 usage reset,Operator 确认已落地。该消息与 Dots 和 GPT-6.1 Sol launches 同台出现,官方 landed post 仍 pending。
GPT-6.1 Sol 在 GPT-6 Sol 发布仅 7 天后取代它,在 Artificial Analysis Intelligence Index 中仅比 GPT-6 Astra 低 1 分,Cost per Task 不到后者 1/4。
推荐理由:原文集中给出智能指数、任务成本和 token 用量对比,便于判断 GPT-6.1 Sol 的成本效率位置。
Google AI Dev 介绍了生产环境中加固 AI 智能体沙盒的 7 种方法,强调标准 Docker 容器无法充分防止内核逃逸、凭证泄露和间接 Prompt injection。
推荐理由:文章把隔离、密钥、网络和审计拆成可执行控制点,适合在编码 Agent 迁移生产环境前对照检查。
Databricks 介绍了如何在新模型发布 Day 1 向超过 12,000 名员工开放访问,同时用 Unity Gateway 做治理、成本管理和可观测性。
Claude Code v2.1.284 发布,加入 Claude Sonnet 5.5(claude-sonnet-5-5),并称其现在是 Anthropic API 的默认 Sonnet 模型。
推荐理由:这份更新同时覆盖默认模型、权限模式和 MCP 连接,便于团队评估 Claude Code 升级影响。
a16z 认为 OpenAI 的长期优势不只是模型、芯片、成本性能或产品,而是创造新用户行为和建立耐久分发策略的能力。文章把 AI 前沿规模业务拆成创造行为、分发、定价和切换成本四个杠杆,并认为模型层容易替换,关键落在前两项。
Artificial Analysis 发布 Cyber Index Alliance,其 Cyber Index 在上线时整合三项网络安全评测。
OpenAI 的 ChatGPT 定价页被发现调整 Pro 订阅显示,100 美元/月和 200 美元/月方案分别变为 Pro Standard 和 Pro More,并删除 5x、20x 用量描述。
华为诺亚方舟实验室、华为云天筹 AI 求解器团队和华中科技大学 John Hopcroft 计算中心联合团队获得 SAT Competition 2026 并行 AI 赛道 SAT 组冠军。
Cognition 宣布其年化收入运行率已突破 $1B。公司称,Cognition 于 January 2024 创立,Devin 在正式可用不到两年后,已与 GE Aerospace、Rivian、Rohlik、Exa 等工程团队协作。Cognition 表示这一里程碑属于客户,目标是让软件默认更好、更令人愉悦并无处不在。
推荐理由:这篇官方披露把收入里程碑与 Devin 的企业客户采用情况放在同一背景中。
GitHub Copilot 博客提出 chat 往往不是合适的 AI 交互 UI,并介绍 GitHub Copilot app 中的 canvases。canvas 是运行在 GitHub Copilot app 内的小型全栈应用,可与 GitHub Copilot agent 双向通信,也能调用第三方 API 或在本机执行代码。
推荐理由:文章用多个 canvases 示例说明替代纯聊天的思路,可迁移到本地工具和开发流程自动化。
GitHub Security Lab 推出 Fuzzing Taskflow,这是面向 C/C++ 项目的自主模糊测试流水线,基于 GitHub Security Lab Taskflow Agent 构建。
推荐理由:原文同时给出运行方式、架构分层和安全提示,可用于评估 LLM agent 在模糊测试中的落地边界。
David Heinemeier Hansson(DHH)在 Rails World 主题演讲中称,至少在 37signals,专业工作中手写代码的时代已经结束。Pragmatic Engineer 的 The Pulse 将此作为“手写代码是否终结”的争论切入点,并提到 Amazon 和 Meta 招聘受阻。
腾讯基于智能体编排平台搭建错误码治理 Agent,将知识库、代码关系图谱、可观测平台数据和代码托管平台挂载到同一 Agent,分钟级产出根因分析和修复建议。在 50 条 case 对比中,优化后的 action_type 与人工标注一致率从 66% 提升到 88%,硬冲突率从 20% 降至 0%。工作流已上线,近一个月内日均处理数百条去重错误码告警,high 置信度占比约 90%,失败率约 1%。
阿里云在2026云栖大会MaaS&Agent技术主论坛宣布千问AI平台全面升级,新增Agent服务和行业AI解决方案支持,并推出API优速模式、Agent Studio、千问AI座舱解决方案等能力。
Cognition 上周在 São Paulo 的 MASP 宣布扩展到拉丁美洲,称将帮助当地企业构建、现代化和维护软件。文章称拉丁美洲在 GitHub 上有 15.8 million 开发者,接近 2020 年的 5 倍,是仅次于 United States 和 India 的第三大开发者社区。
2026 云栖大会技术主论坛·MaaS & Agent 将于9月22日13:30在杭州国际博览中心二期启幕,聚焦「创造 Token、成就 Agent、交付生产力」。论坛将呈现阿里巴巴 MaaS 战略,展示千问 AI 平台演进,并发布千问办公、Qoder、千问 APP 全新版本和 Qwen Intelligence 手机智能解决方案。
Cognition 与 AWS 达成多年 Strategic Collaboration Agreement,帮助企业在生产环境部署自主工程师,并用 Devin 加速迁移、清理安全和工程积压。
Anthropic 称 Claude 在 11 天内基本自主地用 Lean 写出了 Fermat’s Last Theorem 的首个端到端计算机校验证明。该证明包含 13 million 行 Lean,过程中证明 30,300 个定理,最终证明使用 29,500 个中间定理,并由 Lean 校验。
推荐理由:材料呈现 Claude 与 Prove2Me 形式化大型数学定理的流程,可参考其多智能体分工方式。
zai-org 发布 GLM-5.3-Flash,称其为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 激活参数。官方称它在基准和真实工作负载中超过 GLM-5.2,价格为其十分之一,并在编码和智能体基准上接近 Claude Opus 4.8。
推荐理由:原文同时给出参数规模、架构变化和本地部署框架,便于比较其成本与落地路径。
美团 LongCat 在 Hugging Face 发布 LongCat-Flash-Lite-Sparse,这是基于 LongCat-Flash-Lite 的非思考 MoE 模型,拥有 69B 总参数、每 token 约 3B 激活参数,并原生支持最高 1M tokens 上下文。
推荐理由:原文同时给出架构改动、长上下文设定和多项基准,便于比较稀疏版与密集前代的取舍。
BAIR 介绍了将 K-Search 扩展到 MLX 的研究,用结构化 CUDA-to-MLX 翻译层把既有 CUDA 内核优化经验迁移到 Apple Silicon。
Berkeley AI Research 提出 ABBEL,用自然语言 belief states 替代完整交互历史,并以 belief grading 监督大语言模型更新长程交互上下文。CollabBench 上,ABBEL-rec-BG 将与 Full Context 的差距缩小约 50%,训练步数从 100 降至 50,Peak Tokens 为 6.01±0.33×10²。
Mistral 发布 Mistral-Medium-3.5-128B-EAGLE,用于为 Mistral Medium 3.5 执行推测解码。
推荐理由:原文同时给出模型规格、替代关系和 vLLM/SGLang 部署方式,便于评估统一模型的接入成本。
Moonshot AI 在 Hugging Face 发布 Kimi-K2.6,这是开源的原生多模态智能体模型。该模型采用 MoE 架构,Total Parameters 1T、Activated Parameters 32B、Context Length 256K,支持长周期编码、coding-driven design、Agent Swarm、图像和视频输入。
推荐理由:原文同时给出模型结构、评测表和部署入口,便于对比其在编码与智能体任务中的定位。