最新精选
第 101–118 条 · 共 118 条- Google Research精选AI 评分6262
Google Research 介绍了 Empirical Research Assistance(ERA)的 Nature 论文,并开始通过 Gemini for Science 更广泛推出基于 ERA 和 AlphaEvolve 的 Computational Discovery。
推荐理由:材料把 Nature 论文、跨学科基准和五类应用放在一起,便于评估科研编码工具在不同问题中的适用边界。
Anthropic 在 Claude Managed Agents 中推出 self-hosted sandboxes 和 MCP tunnels,让智能体可在企业控制的沙盒中运行工具,并连接私有网络内的 MCP servers。
推荐理由:材料说明了执行环境和私有服务连接的边界,适合评估企业智能体落地的安全架构。
Claude Managed Agents 以研究预览推出 dreaming,并向开发者开放 outcomes、多智能体编排和 webhooks。dreaming 会定期回顾 agent sessions 和 memory stores,提取模式并整理记忆;outcomes 让开发者用 rubric 定义成功标准,由单独 grader 评估并推动智能体重试。
推荐理由:原文列出 dreaming、outcomes 与多智能体编排的机制和测试数据,便于评估托管智能体的适用场景。
- Cognition Blog精选AI 评分7373
Cognition 推出 Devin Auto-Triage,Devin 现在可以监控新告警、自动调查,并返回调查结果、后续步骤甚至 PR。它可响应 Slack、Linear、GitHub、日程和 incoming webhooks,检查代码库、可观测性工具、相关 ticket 或 thread,并在需要人工时标记负责人。
推荐理由:原文展示了 Devin 从告警检测延伸到调查和 PR 的流程,可帮助评估工程值班自动化的边界。
- Cognition Blog精选AI 评分6363
Devin 现在可以启动 Android Virtual Device(AVD),支持面向 Android 应用的自主开发。此前 Devin 能处理 Android 代码,但不能在本地 Android 环境中运行和测试应用;新的 Android 模拟器支持让它能在自己的机器上构建和运行 Android 应用,打开应用、检查行为、复现问题并验证更改。
推荐理由:原文说明了 Devin 从编写 Android 代码扩展到本地运行测试,对移动应用开发流程有直接参考。
- Google DeepMind精选AI 评分7575
Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 过去一年的应用进展,覆盖科研、Google 基础设施和商业企业。
推荐理由:文章用医疗、能源、量子和企业案例串联 AlphaEvolve 从研究走向基础设施的路径。
- Google DeepMind精选AI 评分6868
Google DeepMind 公布 AI co-clinician 研究计划,探索在医生临床监督下让 AI agent 与患者互动并辅助照护。研究称,在 98 个现实初级保健查询的客观分析中,AI co-clinician 有 97 个案例记录为零关键错误,并在 OpenFDA 的 RxQA 开放式用药问答上超过可用的前沿模型。
推荐理由:材料同时覆盖证据检索和远程问诊模拟,可帮助理解医疗 AI 更适合辅助而非替代医生的边界。
- mistralai · Hugging Face 新模型精选AI 评分7777
Mistral 发布 Mistral-Medium-3.5-128B-EAGLE,用于为 Mistral Medium 3.5 执行推测解码。
推荐理由:原文同时给出模型规格、替代关系和 vLLM/SGLang 部署方式,便于评估统一模型的接入成本。
Claude Managed Agents 的内置记忆功能已在 Claude Platform 开放 public beta,让 agents 可从每次会话中学习。
推荐理由:文章具体说明了文件化记忆、权限和审计设计,可用于评估企业智能体的跨会话学习方案。
Claude 扩展 connectors,新增连接 AllTrails、Instacart、Audible、Tripadvisor、Intuit TurboTax 等日常应用。
推荐理由:原文列出新增生活类应用和权限控制方式,可帮助判断 Claude 连接器从办公扩展到日常场景的影响。
- Cognition Blog精选AI 评分7070
Cognition 本周将更新 Devin 自助服务定价,停用旧 Core 和 Team 套餐,改为 Free、Pro、Max、Teams 和 Enterprise。
推荐理由:原文列出新旧套餐迁移和用量计费口径,可帮助团队预估 Devin 采用成本变化。
- moonshotai · Hugging Face 新模型精选AI 评分8383
Moonshot AI 在 Hugging Face 发布 Kimi-K2.6,这是开源的原生多模态智能体模型。该模型采用 MoE 架构,Total Parameters 1T、Activated Parameters 32B、Context Length 256K,支持长周期编码、coding-driven design、Agent Swarm、图像和视频输入。
推荐理由:原文同时给出模型结构、评测表和部署入口,便于对比其在编码与智能体任务中的定位。
- Google DeepMind精选AI 评分8484
Google DeepMind 发布 Gemma 4 开放模型家族,包含 E2B、E4B、26B MoE 和 31B Dense,面向高级推理和智能体工作流,并采用 Apache 2.0 license。
推荐理由:原文同时给出模型尺寸、端侧部署方式和生态入口,便于比较开放模型在硬件约束下的能力取舍。
- Cognition Blog精选AI 评分7070
Cognition 介绍了内部如何用 Devin 构建 Devin,上周将 659 个 Devin PR 合并进自家代码库,高于 2025 年最好一周的 154 个。
推荐理由:文章拆解了 Cognition 内部把 Devin 接入 PR、工单、日志和数据分析的工作流,可迁移到工程团队的智能体落地。
- moonshotai · Hugging Face 新模型精选AI 评分8585
Moonshot AI 发布 Kimi-K2-Thinking,称其为最新、能力最强的开源 thinking model,支持逐步推理并动态调用工具。该模型为 MoE 架构,总参数 1T、激活参数 32B、上下文长度 256K,原生 INT4 量化,称可在低延迟模式下实现无损 2x 加速,并在 200–300 次连续工具调用中保持稳定。
推荐理由:原文同时给出架构参数、评测设置和部署入口,便于比较开源推理模型的长程工具调用能力。
Mistral AI 为 Le Chat 推出 Memories beta,让助手自动保存有用信息,并在调用记忆时显示来源链接、相关性和正在使用的记忆。用户可以随时关闭 Memories、开启不使用记忆的隐身聊天、编辑或删除单条记忆,并导出或从其他地方导入记忆。
推荐理由:原文说明了 Le Chat 记忆功能的可见性和控制项,可帮助评估长期上下文如何进入助手工作流。
Mistral AI 发布 Codestral 25.08,并推出由 Codestral、Codestral Embed、Devstral 和 Mistral Code IDE 扩展组成的企业级完整编码栈。
推荐理由:原文把模型更新、嵌入检索、Agent 工作流和企业部署放在同一栈中说明,便于比较企业编码方案的组成。
- moonshotai · Hugging Face 新模型精选AI 评分8585
Moonshot AI 发布 Kimi-K2-Instruct,这是 Kimi K2 的后训练版本,面向通用聊天和 agentic experiences。Kimi K2 是 MoE 语言模型,拥有 1T 总参数、32B 激活参数、128K 上下文窗口,并在 15.5T tokens 上预训练。
推荐理由:材料同时给出架构参数、基准对比和部署方式,便于评估 Kimi K2 的编码与工具调用定位。