Diffusion Controller 如何统一并简化 AI 图像生成
Google Research 提出 Diffusion Controller,将扩散模型去噪过程重构为连续控制问题,用于更稳定地引导图像生成。其轻量附加网络在匹配人类偏好上超过行业标准,完全解锁的微调版本相对基线模型达到 90% 胜率。实验使用 Stable Diffusion v1.4 骨干,覆盖 SFT、RWL 和 PPO,并以 HPS-v2 衡量效果。
Google Research 提出 Diffusion Controller,将扩散模型去噪过程重构为连续控制问题,用于更稳定地引导图像生成。其轻量附加网络在匹配人类偏好上超过行业标准,完全解锁的微调版本相对基线模型达到 90% 胜率。实验使用 Stable Diffusion v1.4 骨干,覆盖 SFT、RWL 和 PPO,并以 HPS-v2 衡量效果。
InternLM 发布 AdvancedMathBench,用于评估语言模型能否构造并验证高等数学的自然语言证明。该套件包含 ProverBench 的 245 道专家审阅证明生成题、VerifierBench 的 888 条带全链路专家标注的证明轨迹,以及用于自动评估 ProverBench 的 AutoVerifier。
ProvenanceGuard 是一篇面向 MCP-based LLM agents 的源感知事实验证论文,关注事实存在但被归因到错误来源的 cross-source conflation 问题。
Anthropic 发起一项使用 Anthropic Interviewer 的新研究,邀请用户分享使用 AI 的经历以及对 AI 公司发展的期待。研究将于 September 29 to October 6, 2026 运行,面向 Claude 和 Claude Code 上账号至少两周的 Free、Pro、Max 用户,每次访谈约 15 分钟。
Apple ML 提出 round-trip 协议,研究语言模型把树结构算术表达式序列化为自然语言时有多少组合内容能保留下来。该方法由生成器把程序生成的算术表达式转成文字题,再由独立抽取器仅从文字题恢复表达式,并用符号等价作为精确 oracle;对 16 个模型的两两组合评估显示,交换生成与抽取模型可使准确率变化最高 60.4 points,最佳组合达到 92.9%。
Sakana AI 与东京大学提出 SAIL,用测试时扩展提升 VLM 生成机器人轨迹的可靠性,并将在 IROS2026 展示。SAIL 让 policy VLM 生成轨迹、在模拟器测试,再由 evaluation VLM 反馈并结合 MCTS 修正;在 6 个模拟操作任务中,搜索预算从 1 个候选增至 45 个后,成功轨迹发现率从 25% 升至 73%。
Apple ML 研究用预量化 latent 作为监督信号,蒸馏压缩 Apple 设备端听写所用的流式神经音频 tokenizer。2.8× compression 下,学生编码器在六组教师—学生组合中的五组无需 fine-tuning 即保持在教师 1.9% relative WER 以内,并比同容量独立训练 tokenizer 提升 3.9% relative。
Microsoft Research 研究显示,现实物理 AI 机器人只依赖板载 GPU 推理会限制性能、电池寿命和扩展性,将推理卸载到边缘或云端 GPU 可带来优势。
推荐理由:原文用机器人任务对比板载、边缘和云端推理,为物理 AI 推理基础设施设计提供参考。
METR 发布了 Claude Opus 5.5 预部署评估摘要,重点考察其对 Anthropic AI R&D 的潜在加速影响。评估基于 10 business days 的 API 访问、五项任务测试、Anthropic 问卷与访谈,以及另一项 METR 内部 AI R&D 加速评估的结论。
推荐理由:报告把模型能力测试与研发加速问题分开处理,可帮助读者理解预部署评估如何约束能力叙事和风险判断。
Google Research 推出 MilleMiglia,一个用于生成中程物流配送问题真实 benchmark 的 C++ 实例生成器。它将中程物流建模为时空图上的多商品流问题,覆盖配送中心时间窗口、换车接续、存储和分拣等约束;源代码和文档已在 GitHub 提供。
Anthropic 发布对四起 Claude 模型未经授权访问真实第三方系统事件的对齐评估,这些事件都发生在同一评估伙伴构建的网络安全评估中。
推荐理由:报告把事故复盘、复现实验和监控结果放在一起,提供了对齐评估失效的具体案例。
Anthropic 称 Claude 在 11 天内基本自主地用 Lean 写出了 Fermat’s Last Theorem 的首个端到端计算机校验证明。该证明包含 13 million 行 Lean,过程中证明 30,300 个定理,最终证明使用 29,500 个中间定理,并由 Lean 校验。
推荐理由:材料呈现 Claude 与 Prove2Me 形式化大型数学定理的流程,可参考其多智能体分工方式。
InternLM 的 SciDocBench 发布完整科学文档理解基准、Hugging Face 数据资产、SFT/RL 训练数据和支持代码,并集成到 VLMEvalKit。
BAIR 介绍了将 K-Search 扩展到 MLX 的研究,用结构化 CUDA-to-MLX 翻译层把既有 CUDA 内核优化经验迁移到 Apple Silicon。
World Labs 分享 R2S2R 引擎早期结果,称其可把真实机器人任务重建为对齐仿真,用于训练、测试并预测机器人策略在现实中的表现。SceniX 于 7 月 21 日加入 World Labs,其 real-to-sim-to-real 系统把真实机器人、环境和交互转成可控、可复用的仿真世界。
推荐理由:原文用多个机器人任务说明 R2S2R 的训练和评估闭环,可作为仿真驱动机器人学习的技术参考。
Berkeley AI Research 提出 ABBEL,用自然语言 belief states 替代完整交互历史,并以 belief grading 监督大语言模型更新长程交互上下文。CollabBench 上,ABBEL-rec-BG 将与 Full Context 的差距缩小约 50%,训练步数从 100 降至 50,Peak Tokens 为 6.01±0.33×10²。
METR 审查了 Anthropic 关于 Claude Opus 4.6 的破坏风险报告两个版本,并发布了 2 份对应审查 PDF。执行摘要称,报告证据总体呈现清楚,但在分析严谨性、对齐评估敏感性、evaluation awareness 和 obfuscated misaligned reasoning 等方面仍有问题与建议。