Diffusion Controller 如何统一并简化 AI 图像生成
Google Research 提出 Diffusion Controller,将扩散模型去噪过程重构为连续控制问题,用于更稳定地引导图像生成。其轻量附加网络在匹配人类偏好上超过行业标准,完全解锁的微调版本相对基线模型达到 90% 胜率。实验使用 Stable Diffusion v1.4 骨干,覆盖 SFT、RWL 和 PPO,并以 HPS-v2 衡量效果。
Google Research 提出 Diffusion Controller,将扩散模型去噪过程重构为连续控制问题,用于更稳定地引导图像生成。其轻量附加网络在匹配人类偏好上超过行业标准,完全解锁的微调版本相对基线模型达到 90% 胜率。实验使用 Stable Diffusion v1.4 骨干,覆盖 SFT、RWL 和 PPO,并以 HPS-v2 衡量效果。
InternLM 发布 AdvancedMathBench,用于评估语言模型能否构造并验证高等数学的自然语言证明。该套件包含 ProverBench 的 245 道专家审阅证明生成题、VerifierBench 的 888 条带全链路专家标注的证明轨迹,以及用于自动评估 ProverBench 的 AutoVerifier。
Microsoft 在欧洲 Microsoft Fabric + SQL Community Conference 上推出 Microsoft Fabric 和 Azure Databases 多项更新,把企业数据、业务上下文和治理能力接入 AI 工作流。
推荐理由:原文集中列出 Fabric 与 Azure Databases 的更新,可帮助判断微软如何把企业数据治理接入 Copilot 与智能体工作流。
Apple ML 提出 round-trip 协议,研究语言模型把树结构算术表达式序列化为自然语言时有多少组合内容能保留下来。该方法由生成器把程序生成的算术表达式转成文字题,再由独立抽取器仅从文字题恢复表达式,并用符号等价作为精确 oracle;对 16 个模型的两两组合评估显示,交换生成与抽取模型可使准确率变化最高 60.4 points,最佳组合达到 92.9%。
World Labs 已签署最终协议加入 AMD,交易预计在 2026 年底前完成,需获监管批准并满足惯常交割条件。双方此前从 AMD GPU 上的模型训练和推理优化开始技术合作,计划建设覆盖硬件、软件、平台和广泛可访问开放模型的端到端开放 AI 生态。
推荐理由:交易把 World Labs 的空间智能研究与 AMD 硬件体系连接起来,后续重点落在开放 AI 生态。
Intern-Decision 将状态、可选图像和多类问题转换为带概率的决策,并微调 Qwen3.5 语言骨干。Intern-Decision-4B 在七个测试套件平均准确率达 90.02%,RTX 4090 本地平均延迟为 44.16 ms。
NVIDIA 加入 Google DeepMind、EMBL-EBI 等全球研究机构联盟,在 AlphaFold Database 开放发布 2,800 多种病毒的蛋白复合体预测 3D 结构。
推荐理由:原文展示了开放数据集与生成流程,能帮助理解 AI 蛋白结构预测在疫情准备中的应用。
Apple ML 研究用预量化 latent 作为监督信号,蒸馏压缩 Apple 设备端听写所用的流式神经音频 tokenizer。2.8× compression 下,学生编码器在六组教师—学生组合中的五组无需 fine-tuning 即保持在教师 1.9% relative WER 以内,并比同容量独立训练 tokenizer 提升 3.9% relative。
METR 发布了 Claude Opus 5.5 预部署评估摘要,重点考察其对 Anthropic AI R&D 的潜在加速影响。评估基于 10 business days 的 API 访问、五项任务测试、Anthropic 问卷与访谈,以及另一项 METR 内部 AI R&D 加速评估的结论。
推荐理由:报告把模型能力测试与研发加速问题分开处理,可帮助读者理解预部署评估如何约束能力叙事和风险判断。
Google Research 推出 MilleMiglia,一个用于生成中程物流配送问题真实 benchmark 的 C++ 实例生成器。它将中程物流建模为时空图上的多商品流问题,覆盖配送中心时间窗口、换车接续、存储和分拣等约束;源代码和文档已在 GitHub 提供。
Cloudera 与 Mistral 宣布合作,把 Mistral 模型集成进 Cloudera 混合数据平台,支持企业在私有云、公有云、本地和完全隔离环境中运行推理。双方还将支持企业在受控环境中用专有数据训练定制 AI 模型,面向 Cloudera 平台上的 30 exabytes 客户管理数据提供主权 AI。
InternLM 的 SciDocBench 发布完整科学文档理解基准、Hugging Face 数据资产、SFT/RL 训练数据和支持代码,并集成到 VLMEvalKit。
World Labs 推出下一代世界模型 Atlas,它从零预训练,可原生处理文本、图像、视频和 3D,并采用多模态自回归扩散 Transformer 架构。Atlas 支持相机控制生成、空间重建、时空模拟和图像生成,可从 1 到 6 张输入图像生成最高 1 分钟、1440p 视频,也能输出点云或 3D Gaussian splats。
推荐理由:原文展示了空间上下文、相机控制和3D输出,便于判断世界模型在创作与机器人仿真中的用法。
Google Research 发布 TimesFM 3.0 的官方 PyTorch 权重和配置,这是一个用于时序预测的预训练时序基础模型。
World Labs 分享 R2S2R 引擎早期结果,称其可把真实机器人任务重建为对齐仿真,用于训练、测试并预测机器人策略在现实中的表现。SceniX 于 7 月 21 日加入 World Labs,其 real-to-sim-to-real 系统把真实机器人、环境和交互转成可控、可复用的仿真世界。
推荐理由:原文用多个机器人任务说明 R2S2R 的训练和评估闭环,可作为仿真驱动机器人学习的技术参考。
Berkeley AI Research 提出 ABBEL,用自然语言 belief states 替代完整交互历史,并以 belief grading 监督大语言模型更新长程交互上下文。CollabBench 上,ABBEL-rec-BG 将与 Full Context 的差距缩小约 50%,训练步数从 100 降至 50,Peak Tokens 为 6.01±0.33×10²。
BAIR 文章认为 AI 推理成本快速下降正在带来近乎免费的智能,并将改变数据系统的设计方向。文中称 GPT-4-class 能力成本从 early 2023 的 roughly $30 per million tokens 降到 today under $1,部分提供商低于 $0.10,跨基准推理价格每年下降 9x 到 900x,中位数接近 50x。