Braco:面向极端视觉 token 压缩的 token 参数化方法
Braco 提出面向视觉语言模型的 token 参数化压缩,在 23×--64× 压缩下形成较优准确率-效率前沿,144× 时仍具竞争力。其达到 95.2% 准确率,相比未压缩上界减少 84.2%--86.7% prefill FLOPs,并实现最高约 36% 端到端加速。
Braco 提出面向视觉语言模型的 token 参数化压缩,在 23×--64× 压缩下形成较优准确率-效率前沿,144× 时仍具竞争力。其达到 95.2% 准确率,相比未压缩上界减少 84.2%--86.7% prefill FLOPs,并实现最高约 36% 端到端加速。
NVIDIA 加入 Google DeepMind、EMBL-EBI 等全球研究机构联盟,在 AlphaFold Database 开放发布 2,800 多种病毒的蛋白复合体预测 3D 结构。
推荐理由:原文展示了开放数据集与生成流程,能帮助理解 AI 蛋白结构预测在疫情准备中的应用。
Microsoft Research 研究显示,现实物理 AI 机器人只依赖板载 GPU 推理会限制性能、电池寿命和扩展性,将推理卸载到边缘或云端 GPU 可带来优势。
推荐理由:原文用机器人任务对比板载、边缘和云端推理,为物理 AI 推理基础设施设计提供参考。
字节跳动安全研究团队与香港城市大学的联合研究 TWIST 被 ACM CCS 2026 接收,提出面向云上大模型托管的隐私保护推理方案。TWIST 通过联合模型-Token 变换、加性-乘性混合噪声和 RmDP 分析,在不修改推理引擎、不依赖特殊硬件的情况下兼容标准 serving 流程。
BAIR 介绍了将 K-Search 扩展到 MLX 的研究,用结构化 CUDA-to-MLX 翻译层把既有 CUDA 内核优化经验迁移到 Apple Silicon。