Artificial Analysis 开源 AA-AgentPerf-Local,用于测试本地 AI 智能体推理性能
Artificial Analysis 开源 AA-AgentPerf-Local,用于在笔记本和工作站上回放真实智能体轨迹,测试本地 AI 模型的推理性能。其默认工作负载包含 8 个录制的智能体任务、168 个模型轮次,上下文增长到 ~56K tokens,并可测试任何 OpenAI-compatible inference server。
Artificial Analysis 开源 AA-AgentPerf-Local,用于在笔记本和工作站上回放真实智能体轨迹,测试本地 AI 模型的推理性能。其默认工作负载包含 8 个录制的智能体任务、168 个模型轮次,上下文增长到 ~56K tokens,并可测试任何 OpenAI-compatible inference server。
Apple ML 研究用预量化 latent 作为监督信号,蒸馏压缩 Apple 设备端听写所用的流式神经音频 tokenizer。2.8× compression 下,学生编码器在六组教师—学生组合中的五组无需 fine-tuning 即保持在教师 1.9% relative WER 以内,并比同容量独立训练 tokenizer 提升 3.9% relative。
Google DeepMind 介绍了 Private AI Compute 的新架构,将在服务端提供私有、持久、跨设备的 AI 记忆,同时维持接近端侧处理的隐私标准。
2026 云栖大会技术主论坛·MaaS & Agent 将于9月22日13:30在杭州国际博览中心二期启幕,聚焦「创造 Token、成就 Agent、交付生产力」。论坛将呈现阿里巴巴 MaaS 战略,展示千问 AI 平台演进,并发布千问办公、Qoder、千问 APP 全新版本和 Qwen Intelligence 手机智能解决方案。
BAIR 介绍了将 K-Search 扩展到 MLX 的研究,用结构化 CUDA-to-MLX 翻译层把既有 CUDA 内核优化经验迁移到 Apple Silicon。