Databricks Lakebase Search 在 AWS 和 Azure GA,支持 Postgres 全文与向量搜索
Databricks 发布 Lakebase Search,通过 lakebase_vector 和 lakebase_text 两个扩展把可扩展近似邻居搜索与 BM25 全文搜索带入 Lakebase Postgres,已在 AWS 和 Azure GA。
Databricks 发布 Lakebase Search,通过 lakebase_vector 和 lakebase_text 两个扩展把可扩展近似邻居搜索与 BM25 全文搜索带入 Lakebase Postgres,已在 AWS 和 Azure GA。
Claude Code v2.1.284 发布,加入 Claude Sonnet 5.5(claude-sonnet-5-5),并称其现在是 Anthropic API 的默认 Sonnet 模型。
推荐理由:这份更新同时覆盖默认模型、权限模式和 MCP 连接,便于团队评估 Claude Code 升级影响。
a16z 认为 OpenAI 的长期优势不只是模型、芯片、成本性能或产品,而是创造新用户行为和建立耐久分发策略的能力。文章把 AI 前沿规模业务拆成创造行为、分发、定价和切换成本四个杠杆,并认为模型层容易替换,关键落在前两项。
上海人工智能实验室研究团队开源 Intern-Decision,包含 0.8B、2B 和 4B 三款多模态决策模型,称其平均指标超越 Jev 和相关开源模型。团队在 RTX4090 上测试称,Intern-Decision 相比 Jev 有 2-3倍效率提升,4B 端到端推理时延低于每 query 45ms,0.8B 和 2B 可达到每秒约30次推理。
阿里瓴羊在云栖大会推出「AI员工7日上场计划」,让企业用真实业务题试岗AI员工7天,并以收入、转化、留存、GMV和ROI等指标验收。瓴羊称其Business层AI需进入ERP、CRM和自研系统,结合Data+Agent+FDE落地。岚图营销配置从12至24小时降至3小时以内,飞鹤省级经营管报从3天压缩到1小时。
NVIDIA Open Agent Safety Platform 被定位为持续芯片内监控 AI 智能体的参考方案,面向智能体 AI 的安全风险。文章将当前智能体 AI 类比 90 年代互联网:机会巨大,但也伴随大量风险。
Artificial Analysis 发布 Cyber Index Alliance,其 Cyber Index 在上线时整合三项网络安全评测。
华为诺亚方舟实验室、华为云天筹 AI 求解器团队和华中科技大学 John Hopcroft 计算中心联合团队获得 SAT Competition 2026 并行 AI 赛道 SAT 组冠军。
联通云犀工作流智能体从通信场景切入,把电话沟通信息转为可被 AI 理解和使用的数据,帮助企业 AI 嵌入业务流程。其重点布局 AI 数析、AI 助销、AI 助手,案例中某团队人均转化率提升 2.3 倍,新人培训周期从 2 周缩短至 3 天。平台历经 5 年技术打磨,已服务超 6 万家企业、800 万用户。
千问AI平台在云栖大会论坛发布面向Agent的全新服务方式,围绕开放共建、Agent友好服务和持续授权执行展开。平台推出Qwen共创计划和千问AI Arena,前者面向至少26个领域招募模型评测专家,后者第一期聚焦跨境电商素材生成,已有800多位用户报名、收到1,626次Agent提交。
Cognition 宣布其年化收入运行率已突破 $1B。公司称,Cognition 于 January 2024 创立,Devin 在正式可用不到两年后,已与 GE Aerospace、Rivian、Rohlik、Exa 等工程团队协作。Cognition 表示这一里程碑属于客户,目标是让软件默认更好、更令人愉悦并无处不在。
推荐理由:这篇官方披露把收入里程碑与 Devin 的企业客户采用情况放在同一背景中。
GitHub Copilot 博客提出 chat 往往不是合适的 AI 交互 UI,并介绍 GitHub Copilot app 中的 canvases。canvas 是运行在 GitHub Copilot app 内的小型全栈应用,可与 GitHub Copilot agent 双向通信,也能调用第三方 API 或在本机执行代码。
推荐理由:文章用多个 canvases 示例说明替代纯聊天的思路,可迁移到本地工具和开发流程自动化。
GitHub Security Lab 推出 Fuzzing Taskflow,这是面向 C/C++ 项目的自主模糊测试流水线,基于 GitHub Security Lab Taskflow Agent 构建。
推荐理由:原文同时给出运行方式、架构分层和安全提示,可用于评估 LLM agent 在模糊测试中的落地边界。
Google DeepMind 介绍了 Private AI Compute 的新架构,将在服务端提供私有、持久、跨设备的 AI 记忆,同时维持接近端侧处理的隐私标准。
腾讯基于智能体编排平台搭建错误码治理 Agent,将知识库、代码关系图谱、可观测平台数据和代码托管平台挂载到同一 Agent,分钟级产出根因分析和修复建议。在 50 条 case 对比中,优化后的 action_type 与人工标注一致率从 66% 提升到 88%,硬冲突率从 20% 降至 0%。工作流已上线,近一个月内日均处理数百条去重错误码告警,high 置信度占比约 90%,失败率约 1%。
阿里云在2026云栖大会MaaS&Agent技术主论坛宣布千问AI平台全面升级,新增Agent服务和行业AI解决方案支持,并推出API优速模式、Agent Studio、千问AI座舱解决方案等能力。
火山引擎 ADrive 智能网盘让 Agent 在授权范围内直接读取项目文件夹,并把分析草稿、报告保存回同一空间,减少人工上传下载和转交。项目空间支持本地挂载、在线预览、历史版本恢复、链接分享,并通过身份与目录权限限定读写范围、提供操作审计;演示中三次未授权写入均被拒绝。
腾讯15年资深后台工程师吴银光讲述自己在 2025 年初转入大模型推理工程团队,从资深搜索后台工程师重新成为“新人”的经历。
Cognition 上周在 São Paulo 的 MASP 宣布扩展到拉丁美洲,称将帮助当地企业构建、现代化和维护软件。文章称拉丁美洲在 GitHub 上有 15.8 million 开发者,接近 2020 年的 5 倍,是仅次于 United States 和 India 的第三大开发者社区。
METR 发布了 Claude Opus 5.5 预部署评估摘要,重点考察其对 Anthropic AI R&D 的潜在加速影响。评估基于 10 business days 的 API 访问、五项任务测试、Anthropic 问卷与访谈,以及另一项 METR 内部 AI R&D 加速评估的结论。
推荐理由:报告把模型能力测试与研发加速问题分开处理,可帮助读者理解预部署评估如何约束能力叙事和风险判断。
2026 云栖大会技术主论坛·MaaS & Agent 将于9月22日13:30在杭州国际博览中心二期启幕,聚焦「创造 Token、成就 Agent、交付生产力」。论坛将呈现阿里巴巴 MaaS 战略,展示千问 AI 平台演进,并发布千问办公、Qoder、千问 APP 全新版本和 Qwen Intelligence 手机智能解决方案。
Claude Cowork 和聊天从今天起合并为一个 Claude,Claude 会根据任务需要在对话中调用 Cowork 和 Design 能力。该功能将在未来几周先面向 Pro 和 Max 计划推出,之后扩展到更多计划;Claude Docs 和 Claude Slides 同日上线,Claude Design 也可在对话中使用。
推荐理由:原文把 Cowork、Design 与聊天合并的可用范围讲清楚,可帮助判断 Claude 工作流入口的变化。
Cognition 与 AWS 达成多年 Strategic Collaboration Agreement,帮助企业在生产环境部署自主工程师,并用 Devin 加速迁移、清理安全和工程积压。
Claude for Small Business 现包含 43 个工作流和 27 个新集成,覆盖 Shopify、Salesforce、TikTok、Atlassian、Zoom、Xero、Gusto、Square、Stripe 和 Zapier 等工具。
推荐理由:原文列出 43 个工作流、27 个新集成和培训安排,便于理解小企业引入 Claude 的具体路径。
InternLM 发布 Intern-S2-397B,称其是面向科学智能和长周期 Agent 的多模态基础模型。该模型结合新的视觉语言预训练范式、大规模多任务强化学习和长周期 Agent 强化学习,覆盖 20 多个科学领域,并在文本推理评测中使用最高 256K tokens、在多模态评测中使用最高 64K tokens。
推荐理由:材料同时给出训练方向、评测设置和部署入口,便于比较科学智能模型的工程落地路径。
Anthropic 称 Claude 在 11 天内基本自主地用 Lean 写出了 Fermat’s Last Theorem 的首个端到端计算机校验证明。该证明包含 13 million 行 Lean,过程中证明 30,300 个定理,最终证明使用 29,500 个中间定理,并由 Lean 校验。
推荐理由:材料呈现 Claude 与 Prove2Me 形式化大型数学定理的流程,可参考其多智能体分工方式。
METR 披露今年早些时候两起外部安全事件,经与安全顾问调查,认为两起事件均未有敏感信息被访问。3 月,一名研究员公开部署的个人 EC2 实例因认证失效暴露,攻击者诱导 Agent 泄露公共模型 API key,并消耗约 $600,000 的免费授信 API credits。
推荐理由:披露了评测机构遭遇 API key 泄露和端点暴露的处置过程,可为敏感模型访问管理提供参照。
Claude in Chrome 现已面向所有付费 Claude 计划正式可用,并可在浏览器中自主执行部分操作,不再需要每一步都获批。它能查看当前页面,使用现有登录状态阅读和输入文本、点击链接、页面跳转和填写表单,安全分类器会在操作执行前检查其是否安全并符合用户请求。
推荐理由:原文同时给出浏览器自动操作范围、提示注入防护和企业管理入口,便于判断落地边界。
zai-org 发布 GLM-5.3-BF16,使用与 GLM-5.2 相同的基座模型,提升来自后训练。
推荐理由:模型卡同时给出同基座后训练收益、基准对比和部署参数,便于比较编码、安全与长程任务表现。
zai-org 发布 GLM-5.3-Flash,称其为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 激活参数。官方称它在基准和真实工作负载中超过 GLM-5.2,价格为其十分之一,并在编码和智能体基准上接近 Claude Opus 4.8。
推荐理由:原文同时给出参数规模、架构变化和本地部署框架,便于比较其成本与落地路径。
美团 LongCat 在 Hugging Face 发布 LongCat-Flash-Lite-Sparse,这是基于 LongCat-Flash-Lite 的非思考 MoE 模型,拥有 69B 总参数、每 token 约 3B 激活参数,并原生支持最高 1M tokens 上下文。
推荐理由:原文同时给出架构改动、长上下文设定和多项基准,便于比较稀疏版与密集前代的取舍。
Berkeley AI Research 提出 ABBEL,用自然语言 belief states 替代完整交互历史,并以 belief grading 监督大语言模型更新长程交互上下文。CollabBench 上,ABBEL-rec-BG 将与 Full Context 的差距缩小约 50%,训练步数从 100 降至 50,Peak Tokens 为 6.01±0.33×10²。
BAIR 文章认为 AI 推理成本快速下降正在带来近乎免费的智能,并将改变数据系统的设计方向。文中称 GPT-4-class 能力成本从 early 2023 的 roughly $30 per million tokens 降到 today under $1,部分提供商低于 $0.10,跨基准推理价格每年下降 9x 到 900x,中位数接近 50x。
Mistral 发布 Mistral-Medium-3.5-128B-EAGLE,用于为 Mistral Medium 3.5 执行推测解码。
推荐理由:原文同时给出模型规格、替代关系和 vLLM/SGLang 部署方式,便于评估统一模型的接入成本。
Moonshot AI 在 Hugging Face 发布 Kimi-K2.6,这是开源的原生多模态智能体模型。该模型采用 MoE 架构,Total Parameters 1T、Activated Parameters 32B、Context Length 256K,支持长周期编码、coding-driven design、Agent Swarm、图像和视频输入。
推荐理由:原文同时给出模型结构、评测表和部署入口,便于对比其在编码与智能体任务中的定位。