腾讯程序员详解 Agent 自进化飞轮搭建方法
腾讯程序员提出一套 Agent 自进化飞轮方法论,将评测、记忆、落地工程化和人机控制串成闭环。文章强调自进化当前主战场是 Harness 层,即通过 Skill、Prompt、工具配置和工作流等配套系统改进,而不是直接修改模型参数。核心建议包括评测集三分法、记忆治理、Diff 模式修复、灰度回流、异步 Dreaming 和分级人工审核。
推荐理由:文章把评测、记忆、Skill更新和人工门控串成工程闭环,适合迁移到自进化 Agent 体系设计中。
拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。
腾讯程序员提出一套 Agent 自进化飞轮方法论,将评测、记忆、落地工程化和人机控制串成闭环。文章强调自进化当前主战场是 Harness 层,即通过 Skill、Prompt、工具配置和工作流等配套系统改进,而不是直接修改模型参数。核心建议包括评测集三分法、记忆治理、Diff 模式修复、灰度回流、异步 Dreaming 和分级人工审核。
推荐理由:文章把评测、记忆、Skill更新和人工门控串成工程闭环,适合迁移到自进化 Agent 体系设计中。
腾讯技术工程作者分享 Harness 工作流成本优化实践,围绕 1 个 TL + 6 个子 Agent 的前后端全流程开发,把中型需求全流程 token 成本预估降低 50%~65%。
推荐理由:文章把 Multi-Agent 成本拆到提示词、工具返回和历史消息等来源,并给出可迁移的十项优化路径。
Tessl 文章认为,Agent 可靠性不只取决于提示词,还取决于工具本身让 Agent 实际能够做什么。文章用 Gmail、CRM、Slack、数据库和云凭证等例子说明,应把审批、权限、校验和凭证范围做成 hard restrictions,而不是只依赖 system prompts、AGENTS.md 或 SKILL.md 等 soft guardrails。
推荐理由:文章把提示词约束与工具权限边界分开讨论,提供了设计 Agent 工具接口的可迁移检查思路。
Cognition 介绍了内部如何用 Devin 构建 Devin,上周将 659 个 Devin PR 合并进自家代码库,高于 2025 年最好一周的 154 个。
推荐理由:文章拆解了 Cognition 内部把 Devin 接入 PR、工单、日志和数据分析的工作流,可迁移到工程团队的智能体落地。
Sebastian Raschka 分析 OpenAI 本周发布的 gpt-oss-120b 和 gpt-oss-20b,称这是自 GPT-2 以来 OpenAI 再次共享大型完全开权重模型。
推荐理由:文章把 gpt-oss 与 GPT-2、Qwen3 的结构差异逐项拆开,便于理解开权重模型的工程取舍。