腾讯程序员复盘 AI Coding 深水区实践:代码交给 AI 后人退到决策点
腾讯程序员复盘了一个内部 AI Coding 平台实践:七个服务、三个月、1800 多次提交,产出 16 万行生产代码、11 万行测试代码和 8 万多行前端,没有一行由人写,设计文档也全部由 AI 落笔。
推荐理由:作者把三个月 AI Coding 平台实践拆成提示词、runtime、评测和验收流程,可迁移到复杂代码库的 agent 建设。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
腾讯程序员复盘了一个内部 AI Coding 平台实践:七个服务、三个月、1800 多次提交,产出 16 万行生产代码、11 万行测试代码和 8 万多行前端,没有一行由人写,设计文档也全部由 AI 落笔。
推荐理由:作者把三个月 AI Coding 平台实践拆成提示词、runtime、评测和验收流程,可迁移到复杂代码库的 agent 建设。
Claude in Chrome 现已面向所有付费 Claude 计划正式可用,并可在浏览器中自主执行部分操作,不再需要每一步都获批。它能查看当前页面,使用现有登录状态阅读和输入文本、点击链接、页面跳转和填写表单,安全分类器会在操作执行前检查其是否安全并符合用户请求。
推荐理由:原文同时给出浏览器自动操作范围、提示注入防护和企业管理入口,便于判断落地边界。
zai-org 发布 GLM-5.3-BF16,使用与 GLM-5.2 相同的基座模型,提升来自后训练。
推荐理由:模型卡同时给出同基座后训练收益、基准对比和部署参数,便于比较编码、安全与长程任务表现。
zai-org 发布 GLM-5.3-Flash,称其为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 激活参数。官方称它在基准和真实工作负载中超过 GLM-5.2,价格为其十分之一,并在编码和智能体基准上接近 Claude Opus 4.8。
推荐理由:原文同时给出参数规模、架构变化和本地部署框架,便于比较其成本与落地路径。
Tessl 发布公开 Beta 的 Tessl Code Review,用团队自有标准审查 Agent 编写的代码。团队可将审查标准写成可拥有、版本化和复用的技能,工具会读取整个 PR、周边代码库和讨论线程,并将评论与摘要发布到 GitHub。Tessl 称其已在内部 monorepo 使用数月,并用更强模型复核内部 PR 发现的问题,74% 被确认为真实缺陷,相比同类工具约为 ~50%。
推荐理由:原文说明了团队标准以技能形式沉淀并贯穿复审流程,可帮助评估 AI 代码审查的落地方式。
Hugging Face 总结了 7 月一次 ICML 2026 论文复现黑客松的结果,1,221 名社区成员用 coding agents 在 19 天内发布 6,816 份 Trackio logbooks,尝试复现 2,226 篇论文。
推荐理由:材料用大规模复现实验的数据,呈现智能体参与科研审稿时人类介入的边界。
NVIDIA Magpie Multilingual TTS 最新版本开放权重,支持 12 种语言,并新增 Modern Standard Arabic、Korean 和 Brazilian Portuguese。
推荐理由:文章给出语言覆盖、延迟指标和部署路径,便于评估开源 TTS 在企业语音智能体中的取舍。
Meta 发布 Muse Glimmer-30B,这是一个面向本地智能体用例的开源多模态模型,采用 Apache 2.0 许可。Hugging Face 同步提供 transformers、llama.cpp、vLLM、Inference Endpoints 等 day-0 支持,并给出文本、图像、视频、多模态工具调用和开放式目标检测示例。
推荐理由:原文同时给出架构、基准和本地部署示例,便于评估30B多模态模型在智能体场景的落地成本。
美团 LongCat 在 Hugging Face 发布 LongCat-Flash-Lite-Sparse,这是基于 LongCat-Flash-Lite 的非思考 MoE 模型,拥有 69B 总参数、每 token 约 3B 激活参数,并原生支持最高 1M tokens 上下文。
推荐理由:原文同时给出架构改动、长上下文设定和多项基准,便于比较稀疏版与密集前代的取舍。
Microsoft 推出 Project Perception,这是一套面向 AI 时代的智能体安全系统,将于 8 月 3 日进入公开预览。它协调红队、蓝队和绿队三类专用智能体,结合信号、上下文、模型和执行器,持续发现、评估并改进组织的安全态势。
推荐理由:原文披露了Project Perception的多智能体安全架构和预览时间,可用来观察微软安全产品的AI化路径。
Cognition 推出 Devin Security Swarm,为安全团队提供由并行 Agent 执行的代码库漏洞发现、运行时可利用性确认和修复 PR 生成功能。
推荐理由:原文展示了从漏洞发现到修复 PR 的流程,可对照现有安全扫描成本与交付方式。
Google DeepMind 发布 Gemma 4 12B,称其是面向笔记本电脑的统一、无编码器多模态模型,支持视觉和音频输入直接进入 LLM backbone。
推荐理由:原文同时交代架构取舍、16GB 本地运行门槛和生态入口,便于评估多模态应用的适配成本。
Google 推出 Gemini Enterprise Agent Platform 托管的 Cross-Corpus Retrieval,由 Agentic RAG 驱动,并已作为 public preview offering 开放。
推荐理由:原文用医疗和 FramesQA 案例说明多智能体 RAG 如何补齐跨数据源检索缺口。
Mistral AI 发布 Search Toolkit 公开预览版,这是一个开源、可组合框架,用于为 AI 应用构建生产级搜索管线。它把摄取、检索和评估放在统一接口下,支持云端、本地和边缘运行,并包含文档解析、分块、嵌入生成、BM25、稠密嵌入检索、混合检索以及 recall、precision、MRR、NDCG 等评估指标。
推荐理由:原文把摄取、检索和评估放进同一框架,适合对比企业 RAG 检索管线的工程取舍。
Tessl 创始人 Guy Podjarny 认为,随着 AI 智能体高速创建和删除代码,安全工作的重点应从直接保护代码转向让智能体在构建时主动保障安全。他用 ElevenLabs 音乐 API 任务说明 evals 的必要性,并称加入技能后平均分从 50% 提升到 98%;在 CodeGuard 实验中,精简到认证和授权内容的技能也达到 98%。
推荐理由:文章把智能体开发中的安全对象从代码转向技能和上下文,给出 eval 与治理框架供团队参考。
Google Research 介绍了 Empirical Research Assistance(ERA)的 Nature 论文,并开始通过 Gemini for Science 更广泛推出基于 ERA 和 AlphaEvolve 的 Computational Discovery。
推荐理由:材料把 Nature 论文、跨学科基准和五类应用放在一起,便于评估科研编码工具在不同问题中的适用边界。
Cognition 推出 Devin Auto-Triage,Devin 现在可以监控新告警、自动调查,并返回调查结果、后续步骤甚至 PR。它可响应 Slack、Linear、GitHub、日程和 incoming webhooks,检查代码库、可观测性工具、相关 ticket 或 thread,并在需要人工时标记负责人。
推荐理由:原文展示了 Devin 从告警检测延伸到调查和 PR 的流程,可帮助评估工程值班自动化的边界。
Google DeepMind 公布 AI co-clinician 研究计划,探索在医生临床监督下让 AI agent 与患者互动并辅助照护。研究称,在 98 个现实初级保健查询的客观分析中,AI co-clinician 有 97 个案例记录为零关键错误,并在 OpenFDA 的 RxQA 开放式用药问答上超过可用的前沿模型。
推荐理由:材料同时覆盖证据检索和远程问诊模拟,可帮助理解医疗 AI 更适合辅助而非替代医生的边界。
Mistral 发布 Mistral-Medium-3.5-128B-EAGLE,用于为 Mistral Medium 3.5 执行推测解码。
推荐理由:原文同时给出模型规格、替代关系和 vLLM/SGLang 部署方式,便于评估统一模型的接入成本。
Cognition 本周将更新 Devin 自助服务定价,停用旧 Core 和 Team 套餐,改为 Free、Pro、Max、Teams 和 Enterprise。
推荐理由:原文列出新旧套餐迁移和用量计费口径,可帮助团队预估 Devin 采用成本变化。