跳到正文

#Agent

今日 29 条
9月29日周二
9月28日周一
  1. 量子位(公众号 · Wechat2RSS)64

    上海人工智能实验室开源 Intern-Decision 多模态决策模型

    上海人工智能实验室研究团队开源 Intern-Decision,包含 0.8B、2B 和 4B 三款多模态决策模型,称其平均指标超越 Jev 和相关开源模型。团队在 RTX4090 上测试称,Intern-Decision 相比 Jev 有 2-3倍效率提升,4B 端到端推理时延低于每 query 45ms,0.8B 和 2B 可达到每秒约30次推理。

  2. 量子位(公众号 · Wechat2RSS)47

    阿里瓴羊推出「AI员工7日上场计划」:AI员工得直接扛KPI

    阿里瓴羊在云栖大会推出「AI员工7日上场计划」,让企业用真实业务题试岗AI员工7天,并以收入、转化、留存、GMV和ROI等指标验收。瓴羊称其Business层AI需进入ERP、CRM和自研系统,结合Data+Agent+FDE落地。岚图营销配置从12至24小时降至3小时以内,飞鹤省级经营管报从3天压缩到1小时。

9月27日周日
  1. 机器之心(公众号 · Wechat2RSS)36

    模型越来越强,企业 AI 为什么还卡在「最后一公里」?联通云犀从通信场景切入

    联通云犀工作流智能体从通信场景切入,把电话沟通信息转为可被 AI 理解和使用的数据,帮助企业 AI 嵌入业务流程。其重点布局 AI 数析、AI 助销、AI 助手,案例中某团队人均转化率提升 2.3 倍,新人培训周期从 2 周缩短至 3 天。平台历经 5 年技术打磨,已服务超 6 万家企业、800 万用户。

9月25日周五
  1. 阿里云开发者(公众号 · Wechat2RSS)62

    千问AI平台发布面向Agent的全新服务方式

    千问AI平台在云栖大会论坛发布面向Agent的全新服务方式,围绕开放共建、Agent友好服务和持续授权执行展开。平台推出Qwen共创计划和千问AI Arena,前者面向至少26个领域招募模型评测专家,后者第一期聚焦跨境电商素材生成,已有800多位用户报名、收到1,626次Agent提交。

  2. Cognition Blog73

    Cognition 年化收入运行率突破 $1B

    Cognition 宣布其年化收入运行率已突破 $1B。公司称,Cognition 于 January 2024 创立,Devin 在正式可用不到两年后,已与 GE Aerospace、Rivian、Rohlik、Exa 等工程团队协作。Cognition 表示这一里程碑属于客户,目标是让软件默认更好、更令人愉悦并无处不在。

    推荐理由:这篇官方披露把收入里程碑与 Devin 的企业客户采用情况放在同一背景中。

  3. GitHub Blog · AI & ML75

    GitHub Copilot 解释何时 chat 是错误 UI,并展示 canvases 用法

    GitHub Copilot 博客提出 chat 往往不是合适的 AI 交互 UI,并介绍 GitHub Copilot app 中的 canvases。canvas 是运行在 GitHub Copilot app 内的小型全栈应用,可与 GitHub Copilot agent 双向通信,也能调用第三方 API 或在本机执行代码。

    推荐理由:文章用多个 canvases 示例说明替代纯聊天的思路,可迁移到本地工具和开发流程自动化。

9月24日周四
9月23日周三
  1. 腾讯技术工程(公众号 · Wechat2RSS)72

    腾讯错误码治理 Agent 将排查从 3~8 小时缩短到分钟级

    腾讯基于智能体编排平台搭建错误码治理 Agent,将知识库、代码关系图谱、可观测平台数据和代码托管平台挂载到同一 Agent,分钟级产出根因分析和修复建议。在 50 条 case 对比中,优化后的 action_type 与人工标注一致率从 66% 提升到 88%,硬冲突率从 20% 降至 0%。工作流已上线,近一个月内日均处理数百条去重错误码告警,high 置信度占比约 90%,失败率约 1%。

9月22日周二
  1. 字节跳动技术团队(公众号 · Wechat2RSS)43

    火山引擎 ADrive 智能网盘:让 Agent 直接进入团队文件协作流程

    火山引擎 ADrive 智能网盘让 Agent 在授权范围内直接读取项目文件夹,并把分析草稿、报告保存回同一空间,减少人工上传下载和转交。项目空间支持本地挂载、在线预览、历史版本恢复、链接分享,并通过身份与目录权限限定读写范围、提供操作审计;演示中三次未授权写入均被拒绝。

  2. METR Notes66

    METR 发布 Claude Opus 5.5 预部署评估摘要

    METR 发布了 Claude Opus 5.5 预部署评估摘要,重点考察其对 Anthropic AI R&D 的潜在加速影响。评估基于 10 business days 的 API 访问、五项任务测试、Anthropic 问卷与访谈,以及另一项 METR 内部 AI R&D 加速评估的结论。

    推荐理由:报告把模型能力测试与研发加速问题分开处理,可帮助读者理解预部署评估如何约束能力叙事和风险判断。

9月21日周一
  1. 阿里云开发者(公众号 · Wechat2RSS)28

    2026 云栖大会技术主论坛·MaaS & Agent 9月22日启幕

    2026 云栖大会技术主论坛·MaaS & Agent 将于9月22日13:30在杭州国际博览中心二期启幕,聚焦「创造 Token、成就 Agent、交付生产力」。论坛将呈现阿里巴巴 MaaS 战略,展示千问 AI 平台演进,并发布千问办公、Qoder、千问 APP 全新版本和 Qwen Intelligence 手机智能解决方案。

9月16日周三
  1. Claude Blog82

    Claude 将 Cowork 与聊天合并,并推出 Docs 和 Slides

    Claude Cowork 和聊天从今天起合并为一个 Claude,Claude 会根据任务需要在对话中调用 Cowork 和 Design 能力。该功能将在未来几周先面向 Pro 和 Max 计划推出,之后扩展到更多计划;Claude Docs 和 Claude Slides 同日上线,Claude Design 也可在对话中使用。

    推荐理由:原文把 Cowork、Design 与聊天合并的可用范围讲清楚,可帮助判断 Claude 工作流入口的变化。

9月15日周二
9月13日周日
  1. internlm · Hugging Face 新模型70

    InternLM 发布 Intern-S2-397B 多模态基础模型

    InternLM 发布 Intern-S2-397B,称其是面向科学智能和长周期 Agent 的多模态基础模型。该模型结合新的视觉语言预训练范式、大规模多任务强化学习和长周期 Agent 强化学习,覆盖 20 多个科学领域,并在文本推理评测中使用最高 256K tokens、在多模态评测中使用最高 64K tokens。

    推荐理由:材料同时给出训练方向、评测设置和部署入口,便于比较科学智能模型的工程落地路径。

9月4日周五
  1. Anthropic Research90

    Anthropic 称 Claude 生成 Fermat’s Last Theorem 的首个完整计算机校验证明

    Anthropic 称 Claude 在 11 天内基本自主地用 Lean 写出了 Fermat’s Last Theorem 的首个端到端计算机校验证明。该证明包含 13 million 行 Lean,过程中证明 30,300 个定理,最终证明使用 29,500 个中间定理,并由 Lean 校验。

    推荐理由:材料呈现 Claude 与 Prove2Me 形式化大型数学定理的流程,可参考其多智能体分工方式。

8月31日周一
  1. METR Notes76

    METR 更新安全事件,API key 被盗与公开端点暴露未发现敏感信息被访问

    METR 披露今年早些时候两起外部安全事件,经与安全顾问调查,认为两起事件均未有敏感信息被访问。3 月,一名研究员公开部署的个人 EC2 实例因认证失效暴露,攻击者诱导 Agent 泄露公共模型 API key,并消耗约 $600,000 的免费授信 API credits。

    推荐理由:披露了评测机构遭遇 API key 泄露和端点暴露的处置过程,可为敏感模型访问管理提供参照。

8月26日周三
  1. Claude Blog85

    Claude in Chrome 面向所有付费 Claude 计划开放并支持自主浏览器操作

    Claude in Chrome 现已面向所有付费 Claude 计划正式可用,并可在浏览器中自主执行部分操作,不再需要每一步都获批。它能查看当前页面,使用现有登录状态阅读和输入文本、点击链接、页面跳转和填写表单,安全分类器会在操作执行前检查其是否安全并符合用户请求。

    推荐理由:原文同时给出浏览器自动操作范围、提示注入防护和企业管理入口,便于判断落地边界。

8月25日周二
  1. zai-org · Hugging Face 新模型80

    zai-org 发布 GLM-5.3-Flash,GLM-5 系列首个原生多模态模型

    zai-org 发布 GLM-5.3-Flash,称其为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 激活参数。官方称它在基准和真实工作负载中超过 GLM-5.2,价格为其十分之一,并在编码和智能体基准上接近 Claude Opus 4.8。

    推荐理由:原文同时给出参数规模、架构变化和本地部署框架,便于比较其成本与落地路径。

7月31日周五
  1. meituan-longcat · Hugging Face 新模型70

    美团 LongCat 发布 LongCat-Flash-Lite-Sparse 稀疏 MoE 模型

    美团 LongCat 在 Hugging Face 发布 LongCat-Flash-Lite-Sparse,这是基于 LongCat-Flash-Lite 的非思考 MoE 模型,拥有 69B 总参数、每 token 约 3B 激活参数,并原生支持最高 1M tokens 上下文。

    推荐理由:原文同时给出架构改动、长上下文设定和多项基准,便于比较稀疏版与密集前代的取舍。

7月26日周日
7月7日周二
4月27日周一
4月14日周二
  1. moonshotai · Hugging Face 新模型83

    Moonshot AI 开源 Kimi-K2.6 原生多模态智能体模型

    Moonshot AI 在 Hugging Face 发布 Kimi-K2.6,这是开源的原生多模态智能体模型。该模型采用 MoE 架构,Total Parameters 1T、Activated Parameters 32B、Context Length 256K,支持长周期编码、coding-driven design、Agent Swarm、图像和视频输入。

    推荐理由:原文同时给出模型结构、评测表和部署入口,便于对比其在编码与智能体任务中的定位。