Diffusion Controller 如何统一并简化 AI 图像生成
Google Research 提出 Diffusion Controller,将扩散模型去噪过程重构为连续控制问题,用于更稳定地引导图像生成。其轻量附加网络在匹配人类偏好上超过行业标准,完全解锁的微调版本相对基线模型达到 90% 胜率。实验使用 Stable Diffusion v1.4 骨干,覆盖 SFT、RWL 和 PPO,并以 HPS-v2 衡量效果。
Google Research 提出 Diffusion Controller,将扩散模型去噪过程重构为连续控制问题,用于更稳定地引导图像生成。其轻量附加网络在匹配人类偏好上超过行业标准,完全解锁的微调版本相对基线模型达到 90% 胜率。实验使用 Stable Diffusion v1.4 骨干,覆盖 SFT、RWL 和 PPO,并以 HPS-v2 衡量效果。
NVIDIA VSS Blueprint 3.3 面向视觉 AI 智能体,旨在降低构建和运行可维护视频理解系统的成本。NVIDIA Metropolis Blueprint for Video Search and Summarization (VSS) 及其 agent skills 支持摄取、流处理、事件检测、检索、摘要和报告等环节。
6.1 Sol 的价格是 Astra 的 1/5,并且缓存读取折扣 95%!能力极强的模型。
Introducing 6.1 Sol, near Astra intelligence at one fifth of the price of Astra and 95% cache read discount. It is an absolute workhorse. Combined with ultrafast for 8X speeded available today for Astra and coming soon for 6.1 Sol.
OpenAI 介绍高级速度层 Ultrafast,在 Codex 中提供最高 8x 的 token 生成速度,达到 300 tokens per second。该速度层在 API 中最高提升 6x。
看到 Microduck 和 @romainhuet 一起亮相 @OpenAI Dev Days,太酷了!
OpenAI 发布 GPT-6.1 Sol,称其具备接近 Astra 的智能,价格为其五分之一。OpenAI 还称,它是目前同等性能下成本效率最高的模型。
Apple Creator Studio 的新更新将为 Freeform 加入模板、端到端电影级视频和提升效率的功能。Freeform 看板可自动适配 Dark Mode、用文件夹整理并邀请协作,Apple Intelligence 的 Writing Tools 可改写、校对和总结手写笔记,visionOS 27 支持把多种看板项目拉入空间并共同查看 3D 模型。
Codex 的 9月29日重置动态称,OpenAI DevDay 2026 现场宣布用量重置,并同时推出 Dots 和 GPT-6.1 Sol。条目标注为 unverified,称 Operator 已确认落地,官方 landed post 仍待发布;前一条还提到将重新开放 Pro $200 subscriptions 并调整用量计算方式。
Alex Immerman 分析称,当 AI assistants 成为用户决定购买的入口,Amazon、DoorDash、Instacart 等平台的广告和佣金利润可能承压。
推荐理由:推文把收购与长期招聘、开源 AI 目标联系起来,可作为理解组织变化的线索。
InternLM 发布 AdvancedMathBench,用于评估语言模型能否构造并验证高等数学的自然语言证明。该套件包含 ProverBench 的 245 道专家审阅证明生成题、VerifierBench 的 888 条带全链路专家标注的证明轨迹,以及用于自动评估 ProverBench 的 AutoVerifier。
ProvenanceGuard 是一篇面向 MCP-based LLM agents 的源感知事实验证论文,关注事实存在但被归因到错误来源的 cross-source conflation 问题。
Codex Reset 记录显示,OpenAI DevDay 2026 现场宣布 usage reset,Operator 确认已落地。该消息与 Dots 和 GPT-6.1 Sol launches 同台出现,官方 landed post 仍 pending。
GPT-6.1 Sol 在 GPT-6 Sol 发布仅 7 天后取代它,在 Artificial Analysis Intelligence Index 中仅比 GPT-6 Astra 低 1 分,Cost per Task 不到后者 1/4。
推荐理由:原文集中给出智能指数、任务成本和 token 用量对比,便于判断 GPT-6.1 Sol 的成本效率位置。
Artificial Analysis 开源 AA-AgentPerf-Local,用于在笔记本和工作站上回放真实智能体轨迹,测试本地 AI 模型的推理性能。其默认工作负载包含 8 个录制的智能体任务、168 个模型轮次,上下文增长到 ~56K tokens,并可测试任何 OpenAI-compatible inference server。
Anthropic 发起一项使用 Anthropic Interviewer 的新研究,邀请用户分享使用 AI 的经历以及对 AI 公司发展的期待。研究将于 September 29 to October 6, 2026 运行,面向 Claude 和 Claude Code 上账号至少两周的 Free、Pro、Max 用户,每次访谈约 15 分钟。
AdvancedMathBench-AutoVerifier 是用于 ProverBench 的自动评分器,可评估自然语言数学证明、解释错误并定位最早错误步骤。
Microsoft 在欧洲 Microsoft Fabric + SQL Community Conference 上推出 Microsoft Fabric 和 Azure Databases 多项更新,把企业数据、业务上下文和治理能力接入 AI 工作流。
推荐理由:原文集中列出 Fabric 与 Azure Databases 的更新,可帮助判断微软如何把企业数据治理接入 Copilot 与智能体工作流。
So excited to welcome @theworldlabs and @drfeifei to the @AMD family! I’ve always been a huge fan of Fei-Fei and her pioneering research in AI. Together, we’ll combine World Labs’ deep expertise in AI and world models with AMD’s compute leadership to power the future of AI and strengthen the open AI ecosystem. Can’t wait for all we’ll accomplish!
Apple ML 提出 round-trip 协议,研究语言模型把树结构算术表达式序列化为自然语言时有多少组合内容能保留下来。该方法由生成器把程序生成的算术表达式转成文字题,再由独立抽取器仅从文字题恢复表达式,并用符号等价作为精确 oracle;对 16 个模型的两两组合评估显示,交换生成与抽取模型可使准确率变化最高 60.4 points,最佳组合达到 92.9%。
EngiWorld 是一个面向专业工业工程自动化的智能体基准,覆盖完整设计循环中的 1,301 个专家策划任务。任务横跨 CAD、CAE、CAM、BIM、EDA 和 3D visualization 6 个工程领域、26 个专业软件平台,包含 GUI 和 CLI 接口以及 6 类任务。论文评估了 7 个前沿模型,最强模型的 EngiScore 仅为 44.3,多软件尝试成功率为 3.6%。
EpiCon 提出共享多模态记忆框架,让不同智能体在不更新宿主模型参数的情况下复用经验。该框架包含两个独立训练的 2B 模型:memory controller 和 tree self-organizer,并在覆盖四类多模态任务的 eleven benchmarks 上评估。
Anthropic 与 OpenAI 的竞争正在从技术升级扩展到客户分层和定价策略。文章称 Anthropic 在 2026 年 3 月推出企业计量计费后,季度收入翻倍;约三个月后,OpenAI 将其最便宜模型 Luna 的价格下调 80%,年化收入正接近 $70b。
Google AI Dev 介绍如何用 Gemini Live API 构建实时语音 AI Agent,使浏览器、Python 后端和 Gemini Live API 通过 WebSocket 传输双向音频。
推荐理由:文章把实时语音 Agent 拆成 WebSocket、双循环、barge-in 和异步工具回执,便于复用到低延迟语音场景。
Google AI Dev 介绍了生产环境中加固 AI 智能体沙盒的 7 种方法,强调标准 Docker 容器无法充分防止内核逃逸、凭证泄露和间接 Prompt injection。
推荐理由:文章把隔离、密钥、网络和审计拆成可执行控制点,适合在编码 Agent 迁移生产环境前对照检查。
Microsoft Research Asia – Singapore 开设一年后,已扩展团队并深化与新加坡政府、学界和产业合作,围绕前沿 AI 研究推动现实应用。其工作覆盖下一代 AI 模型与智能体系统、领域 AI、AI-native 研究实践、生态与人才发展,并在医疗、金融、教育和技术等领域探索应用。
佛罗里达州总检察长寻求针对 OpenAI 的禁令,Gary Marcus称这类似他近几周建议的暂停 OpenAI。他同时评论了Jensen Huang宣布的“AI Agent Safety”平台,认为这承认了通用 Agent 联网风险,但效果还太早判断;他主张各州和各国效仿佛罗里达,称 OpenAI没有能力妥善监管自己的技术。
Databricks 介绍了如何在新模型发布 Day 1 向超过 12,000 名员工开放访问,同时用 Unity Gateway 做治理、成本管理和可观测性。
Databricks 发布 Lakebase Search,通过 lakebase_vector 和 lakebase_text 两个扩展把可扩展近似邻居搜索与 BM25 全文搜索带入 Lakebase Postgres,已在 AWS 和 Azure GA。
Claude Sonnet 5.5 已在 Google Cloud 可用,面向编码和知识工作场景。它可帮助用户更快构建功能、生成整洁工作材料,并以更快速度降低单任务成本。
Introducing Claude Sonnet 5.5, the second model in the Claude 5.5 family. It’s a clear upgrade over Sonnet 5, runs more than 30% faster, and costs up to 30% less for most work.
推荐理由:材料给出 Sonnet 5.5 相对 Sonnet 5 的速度和成本变化,便于评估升级取舍。
Claude Code v2.1.284 发布,加入 Claude Sonnet 5.5(claude-sonnet-5-5),并称其现在是 Anthropic API 的默认 Sonnet 模型。
推荐理由:这份更新同时覆盖默认模型、权限模式和 MCP 连接,便于团队评估 Claude Code 升级影响。
a16z 认为 OpenAI 的长期优势不只是模型、芯片、成本性能或产品,而是创造新用户行为和建立耐久分发策略的能力。文章把 AI 前沿规模业务拆成创造行为、分发、定价和切换成本四个杠杆,并认为模型层容易替换,关键落在前两项。
上海人工智能实验室研究团队开源 Intern-Decision,包含 0.8B、2B 和 4B 三款多模态决策模型,称其平均指标超越 Jev 和相关开源模型。团队在 RTX4090 上测试称,Intern-Decision 相比 Jev 有 2-3倍效率提升,4B 端到端推理时延低于每 query 45ms,0.8B 和 2B 可达到每秒约30次推理。
阿里瓴羊在云栖大会推出「AI员工7日上场计划」,让企业用真实业务题试岗AI员工7天,并以收入、转化、留存、GMV和ROI等指标验收。瓴羊称其Business层AI需进入ERP、CRM和自研系统,结合Data+Agent+FDE落地。岚图营销配置从12至24小时降至3小时以内,飞鹤省级经营管报从3天压缩到1小时。
华为在AIDC基础设施峰会上介绍源网荷储AIDC 1.0,主张以算电协同重构AI数据中心。方案覆盖Watt、Heat、Bit和建设模式,泰山UPS单柜1280kVA、最高98%效率,恒山直流UPS支持270V、400V、800V。电力模块5.0占地减少40%、交付由7天缩至3天,商汤临港智算中心18MW扩容供配电系统45天交付。