Diffusion Controller 如何统一并简化 AI 图像生成
Google Research 提出 Diffusion Controller,将扩散模型去噪过程重构为连续控制问题,用于更稳定地引导图像生成。其轻量附加网络在匹配人类偏好上超过行业标准,完全解锁的微调版本相对基线模型达到 90% 胜率。实验使用 Stable Diffusion v1.4 骨干,覆盖 SFT、RWL 和 PPO,并以 HPS-v2 衡量效果。
Google Research 提出 Diffusion Controller,将扩散模型去噪过程重构为连续控制问题,用于更稳定地引导图像生成。其轻量附加网络在匹配人类偏好上超过行业标准,完全解锁的微调版本相对基线模型达到 90% 胜率。实验使用 Stable Diffusion v1.4 骨干,覆盖 SFT、RWL 和 PPO,并以 HPS-v2 衡量效果。
Google AI Dev 介绍如何用 Gemini Live API 构建实时语音 AI Agent,使浏览器、Python 后端和 Gemini Live API 通过 WebSocket 传输双向音频。
推荐理由:文章把实时语音 Agent 拆成 WebSocket、双循环、barge-in 和异步工具回执,便于复用到低延迟语音场景。
Google AI Dev 介绍了生产环境中加固 AI 智能体沙盒的 7 种方法,强调标准 Docker 容器无法充分防止内核逃逸、凭证泄露和间接 Prompt injection。
推荐理由:文章把隔离、密钥、网络和审计拆成可执行控制点,适合在编码 Agent 迁移生产环境前对照检查。
Claude Sonnet 5.5 已在 Google Cloud 可用,面向编码和知识工作场景。它可帮助用户更快构建功能、生成整洁工作材料,并以更快速度降低单任务成本。
NVIDIA 加入 Google DeepMind、EMBL-EBI 等全球研究机构联盟,在 AlphaFold Database 开放发布 2,800 多种病毒的蛋白复合体预测 3D 结构。
推荐理由:原文展示了开放数据集与生成流程,能帮助理解 AI 蛋白结构预测在疫情准备中的应用。
Remedy Entertainment 的 CONTROL Resonant 本周首发登陆 GeForce NOW,Ultimate 会员可用 GeForce RTX 5080-class 云端性能串流。
Google DeepMind 介绍了 Private AI Compute 的新架构,将在服务端提供私有、持久、跨设备的 AI 记忆,同时维持接近端侧处理的隐私标准。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两个文本转语音模型,用于生成自定义角色声音并逐行控制场景对白。
推荐理由:原文同时给出能力、评测和开放渠道,便于判断 Gemini 音频模型在创作与企业语音场景的定位。
Google Research 推出 MilleMiglia,一个用于生成中程物流配送问题真实 benchmark 的 C++ 实例生成器。它将中程物流建模为时空图上的多商品流问题,覆盖配送中心时间窗口、换车接续、存储和分拣等约束;源代码和文档已在 GitHub 提供。
Google 在 Hugging Face 发布 GNM v3.0 官方权重,这是用于人类头部的参数化 3D 统计模型,支持对面部身份、表情、头部姿态和眼球、牙齿、舌头等内部解剖结构进行解耦控制。
Google Research 发布 TimesFM 3.0 的官方 PyTorch 权重和配置,这是一个用于时序预测的预训练时序基础模型。