跳到正文

#编码

今日 11 条
今天9月30日周三
  1. AWS Machine Learning Blog77

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用,面向智能体编码和专业工作负载

    GPT-6.1 Sol 已在 Amazon Bedrock 正式可用,为编码、computer use 和高频专业工作负载带来更强推理能力。OpenAI 称它在 DeepSWE v1.1 上以约 one-fifth 的每任务成本匹配 GPT-6 Astra,并比 GPT-6 Sol 最佳分数高 6.4 percentage points。

    推荐理由:原文同时给出任务成本对比与 Bedrock 生产控制,便于评估智能体工作流落地取舍。

  2. Claude Code Releases49

    Claude Code v2.1.285 发布

    Claude Code v2.1.285 增加多项 CLI、插件和管理配置能力,并修复云会话、MCP、Artifact 等问题。新增 CLAUDE_CODE_DISABLE_WEB_FETCH、claude --desktop、claude plugin configure、allowedProviders 等功能。

  3. DidReset · Codex 重置动态36

    Codex 9月29日用量重置动态

    Codex 的 9月29日重置动态称,OpenAI DevDay 2026 现场宣布用量重置,并同时推出 Dots 和 GPT-6.1 Sol。条目标注为 unverified,称 Operator 已确认落地,官方 landed post 仍待发布;前一条还提到将重新开放 Pro $200 subscriptions 并调整用量计算方式。

9月29日周二
9月28日周一
9月25日周五
  1. Cognition Blog73

    Cognition 年化收入运行率突破 $1B

    Cognition 宣布其年化收入运行率已突破 $1B。公司称,Cognition 于 January 2024 创立,Devin 在正式可用不到两年后,已与 GE Aerospace、Rivian、Rohlik、Exa 等工程团队协作。Cognition 表示这一里程碑属于客户,目标是让软件默认更好、更令人愉悦并无处不在。

    推荐理由:这篇官方披露把收入里程碑与 Devin 的企业客户采用情况放在同一背景中。

  2. GitHub Blog · AI & ML75

    GitHub Copilot 解释何时 chat 是错误 UI,并展示 canvases 用法

    GitHub Copilot 博客提出 chat 往往不是合适的 AI 交互 UI,并介绍 GitHub Copilot app 中的 canvases。canvas 是运行在 GitHub Copilot app 内的小型全栈应用,可与 GitHub Copilot agent 双向通信,也能调用第三方 API 或在本机执行代码。

    推荐理由:文章用多个 canvases 示例说明替代纯聊天的思路,可迁移到本地工具和开发流程自动化。

9月23日周三
  1. 腾讯技术工程(公众号 · Wechat2RSS)72

    腾讯错误码治理 Agent 将排查从 3~8 小时缩短到分钟级

    腾讯基于智能体编排平台搭建错误码治理 Agent,将知识库、代码关系图谱、可观测平台数据和代码托管平台挂载到同一 Agent,分钟级产出根因分析和修复建议。在 50 条 case 对比中,优化后的 action_type 与人工标注一致率从 66% 提升到 88%,硬冲突率从 20% 降至 0%。工作流已上线,近一个月内日均处理数百条去重错误码告警,high 置信度占比约 90%,失败率约 1%。

9月22日周二
9月21日周一
  1. 阿里云开发者(公众号 · Wechat2RSS)28

    2026 云栖大会技术主论坛·MaaS & Agent 9月22日启幕

    2026 云栖大会技术主论坛·MaaS & Agent 将于9月22日13:30在杭州国际博览中心二期启幕,聚焦「创造 Token、成就 Agent、交付生产力」。论坛将呈现阿里巴巴 MaaS 战略,展示千问 AI 平台演进,并发布千问办公、Qoder、千问 APP 全新版本和 Qwen Intelligence 手机智能解决方案。

9月15日周二
9月4日周五
  1. Anthropic Research90

    Anthropic 称 Claude 生成 Fermat’s Last Theorem 的首个完整计算机校验证明

    Anthropic 称 Claude 在 11 天内基本自主地用 Lean 写出了 Fermat’s Last Theorem 的首个端到端计算机校验证明。该证明包含 13 million 行 Lean,过程中证明 30,300 个定理,最终证明使用 29,500 个中间定理,并由 Lean 校验。

    推荐理由:材料呈现 Claude 与 Prove2Me 形式化大型数学定理的流程,可参考其多智能体分工方式。

8月25日周二
  1. zai-org · Hugging Face 新模型80

    zai-org 发布 GLM-5.3-Flash,GLM-5 系列首个原生多模态模型

    zai-org 发布 GLM-5.3-Flash,称其为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 激活参数。官方称它在基准和真实工作负载中超过 GLM-5.2,价格为其十分之一,并在编码和智能体基准上接近 Claude Opus 4.8。

    推荐理由:原文同时给出参数规模、架构变化和本地部署框架,便于比较其成本与落地路径。

7月31日周五
  1. meituan-longcat · Hugging Face 新模型70

    美团 LongCat 发布 LongCat-Flash-Lite-Sparse 稀疏 MoE 模型

    美团 LongCat 在 Hugging Face 发布 LongCat-Flash-Lite-Sparse,这是基于 LongCat-Flash-Lite 的非思考 MoE 模型,拥有 69B 总参数、每 token 约 3B 激活参数,并原生支持最高 1M tokens 上下文。

    推荐理由:原文同时给出架构改动、长上下文设定和多项基准,便于比较稀疏版与密集前代的取舍。

7月29日周三
7月26日周日
4月27日周一
4月14日周二
  1. moonshotai · Hugging Face 新模型83

    Moonshot AI 开源 Kimi-K2.6 原生多模态智能体模型

    Moonshot AI 在 Hugging Face 发布 Kimi-K2.6,这是开源的原生多模态智能体模型。该模型采用 MoE 架构,Total Parameters 1T、Activated Parameters 32B、Context Length 256K,支持长周期编码、coding-driven design、Agent Swarm、图像和视频输入。

    推荐理由:原文同时给出模型结构、评测表和部署入口,便于对比其在编码与智能体任务中的定位。