最新精选
第 121–140 条 · 共 184 条- Cognition Blog精选AI 评分7777
Cognition 宣布完成超过 $1B 融资,估值为 $26B,由 Lux Capital、General Catalyst 和 8VC 领投。公司称 Devin 企业使用量自今年初增长 >10x,run-rate revenue 达 $492M,客户包括 Citi、Mercedes-Benz、Goldman Sachs、U.S. Army 和 U.S. Navy。
推荐理由:融资金额、收入增速和客户案例放在一起,呈现 Devin 从云端 Agent 工具走向企业级交付的商业进展。
- stepfun-ai · Hugging Face 新模型精选AI 评分7979
阶跃星辰发布 Step 3.7 Flash,这是一个 198B-parameter sparse MoE 视觉语言模型,结合 196B-parameter 语言骨干和 1.8B-parameter 视觉编码器,支持 256k context window。
推荐理由:材料同时给出参数规模、基准成绩、价格和部署方式,便于评估多模态智能体工作流的接入成本。
Mistral 发布 Mistral Medium 3.5 public preview,这是一款 128B dense、256k context window 的开放权重模型,成为 Mistral Vibe 和 Le Chat 的默认模型。
推荐理由:原文把模型规格、远程编码会话和 Work mode 放在一起,便于评估云端智能体在开发与办公中的落点。
Mistral AI 发布 Studio 的 Connectors,内置连接器和自定义 MCP 现可通过 API/SDK 用于所有模型和 Agent 调用。新功能包括 direct tool calling、人类参与审批流程,以及创建、修改、列出、删除连接器和直接运行工具的编程访问;连接器会集中注册并可用于 LeChat、AI Studio,Vibe 即将支持。
推荐理由:原文展示了连接器从注册到调用的开发路径,可参考其处理企业数据集成与工具治理的方式。
Tessl 创始人 Guy Podjarny 认为,随着 AI 智能体高速创建和删除代码,安全工作的重点应从直接保护代码转向让智能体在构建时主动保障安全。他用 ElevenLabs 音乐 API 任务说明 evals 的必要性,并称加入技能后平均分从 50% 提升到 98%;在 CodeGuard 实验中,精简到认证和授权内容的技能也达到 98%。
推荐理由:文章把智能体开发中的安全对象从代码转向技能和上下文,给出 eval 与治理框架供团队参考。
- Google Research精选AI 评分6262
Google Research 介绍了 Empirical Research Assistance(ERA)的 Nature 论文,并开始通过 Gemini for Science 更广泛推出基于 ERA 和 AlphaEvolve 的 Computational Discovery。
推荐理由:材料把 Nature 论文、跨学科基准和五类应用放在一起,便于评估科研编码工具在不同问题中的适用边界。
- Cognition Blog精选AI 评分7373
Cognition 推出 Devin Auto-Triage,Devin 现在可以监控新告警、自动调查,并返回调查结果、后续步骤甚至 PR。它可响应 Slack、Linear、GitHub、日程和 incoming webhooks,检查代码库、可观测性工具、相关 ticket 或 thread,并在需要人工时标记负责人。
推荐理由:原文展示了 Devin 从告警检测延伸到调查和 PR 的流程,可帮助评估工程值班自动化的边界。
- Cognition Blog精选AI 评分6363
Devin 现在可以启动 Android Virtual Device(AVD),支持面向 Android 应用的自主开发。此前 Devin 能处理 Android 代码,但不能在本地 Android 环境中运行和测试应用;新的 Android 模拟器支持让它能在自己的机器上构建和运行 Android 应用,打开应用、检查行为、复现问题并验证更改。
推荐理由:原文说明了 Devin 从编写 Android 代码扩展到本地运行测试,对移动应用开发流程有直接参考。
- Google DeepMind精选AI 评分7575
Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 过去一年的应用进展,覆盖科研、Google 基础设施和商业企业。
推荐理由:文章用医疗、能源、量子和企业案例串联 AlphaEvolve 从研究走向基础设施的路径。
- mistralai · Hugging Face 新模型精选AI 评分7777
Mistral 发布 Mistral-Medium-3.5-128B-EAGLE,用于为 Mistral Medium 3.5 执行推测解码。
推荐理由:原文同时给出模型规格、替代关系和 vLLM/SGLang 部署方式,便于评估统一模型的接入成本。
- Cognition Blog精选AI 评分8181
Cognition 发布 Devin CLI,可在本地 shell 运行编码智能体,并在任务超出本机能力时把同一会话交给云端 Devin。它可访问代码库、工具和环境,支持选择 Opus 4.7、GPT-5.5 和 SWE-1.6,并用 Rust 编写自定义终端渲染库。
推荐理由:原文说明了本地终端与云端接力的边界,便于评估编码智能体在长任务中的工作流变化。
- Cognition Blog精选AI 评分6363
Cognition 总结了为 Devin 构建云端 Agent 两年多的经验,认为企业自建需要同时投入安全自主运行的技术基础设施和工程组织变革。
推荐理由:文章把云端 Agent 的隔离、持久化、编排和组织改造拆开说明,可作为企业评估自建成本的参照。
- Cognition Blog精选AI 评分7676
Cognition 总结其多智能体实践,认为当前较有效的形态是保持写入单线程,让其他 agents 贡献智能而不是并行改动。文中称 Devin Review 在 Devin 编写的 PR 上平均发现 2 个 bug,其中约 58% 属于严重问题,干净上下文的审查 agent 能发现编码 agent 忽略的问题。
推荐理由:文章用 Devin 的代码审查循环和 smart friend 实验,归纳了多智能体在软件开发中的可行边界。
- Cognition Blog精选AI 评分6969
Cognition 宣布 Devin 接入 Windsurf 2.0,用户可在 Windsurf 本地理解代码库并制定计划,再一键发送给 Devin 执行实现。
推荐理由:原文具体说明了本地 Agent 与云端 Agent 的分工,可作为编码工作流协作设计参考。
- Cognition Blog精选AI 评分7070
Cognition 本周将更新 Devin 自助服务定价,停用旧 Core 和 Team 套餐,改为 Free、Pro、Max、Teams 和 Enterprise。
推荐理由:原文列出新旧套餐迁移和用量计费口径,可帮助团队预估 Devin 采用成本变化。
- Cognition Blog精选AI 评分6666
Cognition 与 Applied Compute 合作 RL 训练了 bug 检测模型 SWE-Check,用于分析当前 diff 并标记变更可能引入的 bug。
推荐理由:原文披露了专用模型训练流程与延迟取舍,可参考其把生产反馈转成样本级奖励的方法。
- moonshotai · Hugging Face 新模型精选AI 评分8383
Moonshot AI 在 Hugging Face 发布 Kimi-K2.6,这是开源的原生多模态智能体模型。该模型采用 MoE 架构,Total Parameters 1T、Activated Parameters 32B、Context Length 256K,支持长周期编码、coding-driven design、Agent Swarm、图像和视频输入。
推荐理由:原文同时给出模型结构、评测表和部署入口,便于对比其在编码与智能体任务中的定位。
- MiniMaxAI · Hugging Face 新模型精选AI 评分7878
MiniMax 在 Hugging Face 发布 MiniMax-M2.7,称其为首个深度参与自身演进的模型,可构建复杂 Agent harnesses、使用 Agent Teams、复杂 Skills 和动态工具搜索完成生产力任务。
推荐理由:材料同时列出自进化流程、工程基准和部署入口,便于比较开源权重模型的智能体能力。
- Cognition Blog精选AI 评分6363
Cognition 说明 Devin 在过去八个月被多家 Fortune 500 公司用于 COBOL 现代化,覆盖数百万行代码文档、从 COBOL 到 AWS Lambda 的海关工作流迁移,以及跨数百个程序的税号逻辑重构。
推荐理由:文章把 COBOL 改造拆成文档、批处理迁移和重构三类,呈现 Agent 适用边界与落地条件。
- Cognition Blog精选AI 评分7474
Cognition 发布 SWE-1.6,这是面向软件工程智能体的最新模型,并已在 Windsurf 面向所有人开放。SWE-1.6 在 SWE-Bench Pro 等基准上与 Preview 模型表现相近,但更强调 Model UX,减少过度思考、循环行为和不当终端依赖,更多使用并行工具调用。
推荐理由:原文披露了从预览版到正式版的行为改进,可用于理解编码智能体体验优化的取舍。