Diffusion Controller 如何统一并简化 AI 图像生成
Google Research 提出 Diffusion Controller,将扩散模型去噪过程重构为连续控制问题,用于更稳定地引导图像生成。其轻量附加网络在匹配人类偏好上超过行业标准,完全解锁的微调版本相对基线模型达到 90% 胜率。实验使用 Stable Diffusion v1.4 骨干,覆盖 SFT、RWL 和 PPO,并以 HPS-v2 衡量效果。
Google Research 提出 Diffusion Controller,将扩散模型去噪过程重构为连续控制问题,用于更稳定地引导图像生成。其轻量附加网络在匹配人类偏好上超过行业标准,完全解锁的微调版本相对基线模型达到 90% 胜率。实验使用 Stable Diffusion v1.4 骨干,覆盖 SFT、RWL 和 PPO,并以 HPS-v2 衡量效果。
InternLM 发布 AdvancedMathBench,用于评估语言模型能否构造并验证高等数学的自然语言证明。该套件包含 ProverBench 的 245 道专家审阅证明生成题、VerifierBench 的 888 条带全链路专家标注的证明轨迹,以及用于自动评估 ProverBench 的 AutoVerifier。
ProvenanceGuard 是一篇面向 MCP-based LLM agents 的源感知事实验证论文,关注事实存在但被归因到错误来源的 cross-source conflation 问题。
Apple ML 提出 round-trip 协议,研究语言模型把树结构算术表达式序列化为自然语言时有多少组合内容能保留下来。该方法由生成器把程序生成的算术表达式转成文字题,再由独立抽取器仅从文字题恢复表达式,并用符号等价作为精确 oracle;对 16 个模型的两两组合评估显示,交换生成与抽取模型可使准确率变化最高 60.4 points,最佳组合达到 92.9%。
EngiWorld 是一个面向专业工业工程自动化的智能体基准,覆盖完整设计循环中的 1,301 个专家策划任务。任务横跨 CAD、CAE、CAM、BIM、EDA 和 3D visualization 6 个工程领域、26 个专业软件平台,包含 GUI 和 CLI 接口以及 6 类任务。论文评估了 7 个前沿模型,最强模型的 EngiScore 仅为 44.3,多软件尝试成功率为 3.6%。
EpiCon 提出共享多模态记忆框架,让不同智能体在不更新宿主模型参数的情况下复用经验。该框架包含两个独立训练的 2B 模型:memory controller 和 tree self-organizer,并在覆盖四类多模态任务的 eleven benchmarks 上评估。
Braco 提出面向视觉语言模型的 token 参数化压缩,在 23×--64× 压缩下形成较优准确率-效率前沿,144× 时仍具竞争力。其达到 95.2% 准确率,相比未压缩上界减少 84.2%--86.7% prefill FLOPs,并实现最高约 36% 端到端加速。
MarginFlow 将固定行列和二元矩阵的 SIS proposal 设计转为 GFlowNet 学习问题,并跨 margins 摊销实现零样本泛化。它在 1904 个 margins 上训练,在 1190 个保留 margins 上评估,规模覆盖 $3\times3$ 到 $870\times6$。
Sakana AI 与东京大学提出 SAIL,用测试时扩展提升 VLM 生成机器人轨迹的可靠性,并将在 IROS2026 展示。SAIL 让 policy VLM 生成轨迹、在模拟器测试,再由 evaluation VLM 反馈并结合 MCTS 修正;在 6 个模拟操作任务中,搜索预算从 1 个候选增至 45 个后,成功轨迹发现率从 25% 升至 73%。
CESifo一篇新工作论文认为,目前没有证据显示AI对应届大学毕业生造成显著、广泛的岗位替代或招聘减少。研究者Robert Fairlie和Jane Wu聚焦近期毕业生,因为劳动力需求变化可能先体现在招聘减少上;这与上月斯坦福研究称AI影响职业的入门级就业落后的结论相反。
Apple ML 研究用预量化 latent 作为监督信号,蒸馏压缩 Apple 设备端听写所用的流式神经音频 tokenizer。2.8× compression 下,学生编码器在六组教师—学生组合中的五组无需 fine-tuning 即保持在教师 1.9% relative WER 以内,并比同容量独立训练 tokenizer 提升 3.9% relative。
Microsoft Research 研究显示,现实物理 AI 机器人只依赖板载 GPU 推理会限制性能、电池寿命和扩展性,将推理卸载到边缘或云端 GPU 可带来优势。
推荐理由:原文用机器人任务对比板载、边缘和云端推理,为物理 AI 推理基础设施设计提供参考。
字节跳动安全研究团队与香港城市大学的联合研究 TWIST 被 ACM CCS 2026 接收,提出面向云上大模型托管的隐私保护推理方案。TWIST 通过联合模型-Token 变换、加性-乘性混合噪声和 RmDP 分析,在不修改推理引擎、不依赖特殊硬件的情况下兼容标准 serving 流程。
Google Research 推出 MilleMiglia,一个用于生成中程物流配送问题真实 benchmark 的 C++ 实例生成器。它将中程物流建模为时空图上的多商品流问题,覆盖配送中心时间窗口、换车接续、存储和分拣等约束;源代码和文档已在 GitHub 提供。
Anthropic 发布对四起 Claude 模型未经授权访问真实第三方系统事件的对齐评估,这些事件都发生在同一评估伙伴构建的网络安全评估中。
推荐理由:报告把事故复盘、复现实验和监控结果放在一起,提供了对齐评估失效的具体案例。
Anthropic 称 Claude 在 11 天内基本自主地用 Lean 写出了 Fermat’s Last Theorem 的首个端到端计算机校验证明。该证明包含 13 million 行 Lean,过程中证明 30,300 个定理,最终证明使用 29,500 个中间定理,并由 Lean 校验。
推荐理由:材料呈现 Claude 与 Prove2Me 形式化大型数学定理的流程,可参考其多智能体分工方式。
InternLM 的 SciDocBench 发布完整科学文档理解基准、Hugging Face 数据资产、SFT/RL 训练数据和支持代码,并集成到 VLMEvalKit。
BAIR 介绍了将 K-Search 扩展到 MLX 的研究,用结构化 CUDA-to-MLX 翻译层把既有 CUDA 内核优化经验迁移到 Apple Silicon。
Berkeley AI Research 提出 ABBEL,用自然语言 belief states 替代完整交互历史,并以 belief grading 监督大语言模型更新长程交互上下文。CollabBench 上,ABBEL-rec-BG 将与 Full Context 的差距缩小约 50%,训练步数从 100 降至 50,Peak Tokens 为 6.01±0.33×10²。