跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 41–60 条 · 共 64 条
8月27日周四
  1. 腾讯技术工程(公众号 · Wechat2RSS)79

    腾讯程序员复盘 AI Coding 深水区实践:代码交给 AI 后人退到决策点

    腾讯程序员复盘了一个内部 AI Coding 平台实践:七个服务、三个月、1800 多次提交,产出 16 万行生产代码、11 万行测试代码和 8 万多行前端,没有一行由人写,设计文档也全部由 AI 落笔。

    推荐理由:作者把三个月 AI Coding 平台实践拆成提示词、runtime、评测和验收流程,可迁移到复杂代码库的 agent 建设。

8月26日周三
  1. Claude Blog85

    Claude in Chrome 面向所有付费 Claude 计划开放并支持自主浏览器操作

    Claude in Chrome 现已面向所有付费 Claude 计划正式可用,并可在浏览器中自主执行部分操作,不再需要每一步都获批。它能查看当前页面,使用现有登录状态阅读和输入文本、点击链接、页面跳转和填写表单,安全分类器会在操作执行前检查其是否安全并符合用户请求。

    推荐理由:原文同时给出浏览器自动操作范围、提示注入防护和企业管理入口,便于判断落地边界。

8月25日周二
  1. zai-org · Hugging Face 新模型80

    zai-org 发布 GLM-5.3-Flash,GLM-5 系列首个原生多模态模型

    zai-org 发布 GLM-5.3-Flash,称其为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 激活参数。官方称它在基准和真实工作负载中超过 GLM-5.2,价格为其十分之一,并在编码和智能体基准上接近 Claude Opus 4.8。

    推荐理由:原文同时给出参数规模、架构变化和本地部署框架,便于比较其成本与落地路径。

8月20日周四
  1. Tessl64

    Tessl 发布 Tessl Code Review,用团队标准审查 Agent 编写的代码

    Tessl 发布公开 Beta 的 Tessl Code Review,用团队自有标准审查 Agent 编写的代码。团队可将审查标准写成可拥有、版本化和复用的技能,工具会读取整个 PR、周边代码库和讨论线程,并将评论与摘要发布到 GitHub。Tessl 称其已在内部 monorepo 使用数月,并用更强模型复核内部 PR 发现的问题,74% 被确认为真实缺陷,相比同类工具约为 ~50%。

    推荐理由:原文说明了团队标准以技能形式沉淀并贯穿复审流程,可帮助评估 AI 代码审查的落地方式。

8月13日周四
8月11日周二
8月10日周一
  1. Hugging Face Blog87

    Meta 发布 Muse Glimmer-30B 开源本地智能体多模态模型

    Meta 发布 Muse Glimmer-30B,这是一个面向本地智能体用例的开源多模态模型,采用 Apache 2.0 许可。Hugging Face 同步提供 transformers、llama.cpp、vLLM、Inference Endpoints 等 day-0 支持,并给出文本、图像、视频、多模态工具调用和开放式目标检测示例。

    推荐理由:原文同时给出架构、基准和本地部署示例,便于评估30B多模态模型在智能体场景的落地成本。

7月31日周五
  1. meituan-longcat · Hugging Face 新模型70

    美团 LongCat 发布 LongCat-Flash-Lite-Sparse 稀疏 MoE 模型

    美团 LongCat 在 Hugging Face 发布 LongCat-Flash-Lite-Sparse,这是基于 LongCat-Flash-Lite 的非思考 MoE 模型,拥有 69B 总参数、每 token 约 3B 激活参数,并原生支持最高 1M tokens 上下文。

    推荐理由:原文同时给出架构改动、长上下文设定和多项基准,便于比较稀疏版与密集前代的取舍。

7月28日周二
  1. Microsoft Blog62

    Microsoft 推出智能体安全系统 Project Perception,8 月 3 日公开预览

    Microsoft 推出 Project Perception,这是一套面向 AI 时代的智能体安全系统,将于 8 月 3 日进入公开预览。它协调红队、蓝队和绿队三类专用智能体,结合信号、上下文、模型和执行器,持续发现、评估并改进组织的安全态势。

    推荐理由:原文披露了Project Perception的多智能体安全架构和预览时间,可用来观察微软安全产品的AI化路径。

7月1日周三
6月9日周二
6月5日周五
5月28日周四
  1. Mistral AI69

    Mistral AI 推出 Search Toolkit 公测版,用于构建 AI 应用搜索管线

    Mistral AI 发布 Search Toolkit 公开预览版,这是一个开源、可组合框架,用于为 AI 应用构建生产级搜索管线。它把摄取、检索和评估放在统一接口下,支持云端、本地和边缘运行,并包含文档解析、分块、嵌入生成、BM25、稠密嵌入检索、混合检索以及 recall、precision、MRR、NDCG 等评估指标。

    推荐理由:原文把摄取、检索和评估放进同一框架,适合对比企业 RAG 检索管线的工程取舍。

5月22日周五
  1. Tessl60

    Tessl 创始人谈智能体开发安全应保护编码者而非代码

    Tessl 创始人 Guy Podjarny 认为,随着 AI 智能体高速创建和删除代码,安全工作的重点应从直接保护代码转向让智能体在构建时主动保障安全。他用 ElevenLabs 音乐 API 任务说明 evals 的必要性,并称加入技能后平均分从 50% 提升到 98%;在 CodeGuard 实验中,精简到认证和授权内容的技能也达到 98%。

    推荐理由:文章把智能体开发中的安全对象从代码转向技能和上下文,给出 eval 与治理框架供团队参考。

5月20日周三
5月18日周一
  1. Cognition Blog73

    Cognition 推出 Devin Auto-Triage,用于自动调查告警并生成后续行动

    Cognition 推出 Devin Auto-Triage,Devin 现在可以监控新告警、自动调查,并返回调查结果、后续步骤甚至 PR。它可响应 Slack、Linear、GitHub、日程和 incoming webhooks,检查代码库、可观测性工具、相关 ticket 或 thread,并在需要人工时标记负责人。

    推荐理由:原文展示了 Devin 从告警检测延伸到调查和 PR 的流程,可帮助评估工程值班自动化的边界。

4月30日周四
  1. Google DeepMind68

    Google DeepMind 公布 AI co-clinician 研究计划

    Google DeepMind 公布 AI co-clinician 研究计划,探索在医生临床监督下让 AI agent 与患者互动并辅助照护。研究称,在 98 个现实初级保健查询的客观分析中,AI co-clinician 有 97 个案例记录为零关键错误,并在 OpenFDA 的 RxQA 开放式用药问答上超过可用的前沿模型。

    推荐理由:材料同时覆盖证据检索和远程问诊模拟,可帮助理解医疗 AI 更适合辅助而非替代医生的边界。

4月27日周一
4月14日周二