最新精选
第 241–260 条 · 共 290 条- Cognition Blog精选AI 评分7777
Cognition 宣布 Devin 现在可以调度自己的会话,用户只需描述要定期执行的工作,Devin 会确定节奏、设置日程并自动运行。Scheduled Devins 会在多次运行之间读写自己的 notes,用于避免重复处理已覆盖的 PR 或已处理的消息。该功能可与本周早些时候发布的 Managed Devins 组合,例如每周并行测试应用页面、汇总结果并发布到团队 Slack。
推荐理由:原文展示了递归任务、跨会话状态和并行智能体组合方式,可参考其自动化工程例行工作的设计。
- meituan-longcat · Hugging Face 新模型精选AI 评分6161
美团 LongCat 发布 LongCat-Flash-Prover,一个面向 Lean4 原生形式化推理的 560-billion-parameter 开源 MoE 模型。
推荐理由:材料同时披露训练框架、Lean4 工具接入和多项基准结果,便于比较开源定理推理模型的能力边界与工程路线。
- Cognition Blog精选AI 评分7979
Devin 现在可以将大型任务拆解并委派给一组并行工作的 managed Devins,由主 Devin 会话负责协调、监控进度、解决冲突并汇总结果。每个 managed Devin 都是完整 Devin,在独立虚拟机中拥有自己的 terminal、browser 和开发环境,可运行 shell 命令、执行测试并验证修改。
推荐理由:原文展示了多智能体并行协作的具体分工方式,可用于评估复杂开发任务的拆解路径。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一次主要版本,把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力整合到一个模型中。
推荐理由:原文同时给出架构参数、性能对比和部署入口,便于评估开放模型在多任务场景的取舍。
Mistral AI 发布 Leanstral,称其为面向 Lean 4 的开源代码智能体,用于在严格规格下生成并证明实现。Leanstral 采用高度稀疏架构,拥有 6B active parameters,权重以 Apache 2.0 许可发布,并集成到 Mistral Vibe、提供 labs-leanstral-2603 API endpoint。
推荐理由:原文把形式化证明场景、FLTEval 对比和开放入口放在一起,便于评估可信编码智能体的工程取舍。
- mistralai · Hugging Face 新模型精选AI 评分6666
Mistral 在 Hugging Face 发布 Leanstral-2603(Leanstral 119B A6B),称其是首个面向 Lean 4 的开源代码智能体模型,用于证明工程场景。
推荐理由:材料同时给出架构参数与部署方式,便于评估 Lean 4 证明工程中的使用成本和接入路径。
Mistral AI 构建了一个自主 Agent,可读取 Rails 源文件,生成或改进 RSpec 测试,按样式规则和覆盖率目标验证,并在 CI/CD pipeline 中无人干预运行。
推荐理由:文章把 Rails 测试生成拆成 AGENTS.md、分类型技能和验证工具,提供了可迁移的编码 Agent 搭建路径。
- mistralai · Hugging Face 新模型精选AI 评分7979
Mistral AI 在 Hugging Face 发布 Mistral Small 4 119B 2603 Eagle,这是一个混合模型,可同时作为通用指令模型和推理模型使用,并统一 Instruct、Reasoning 和 Devstral 三类模型能力。
推荐理由:材料同时给出架构参数、模式切换和 vLLM 部署示例,便于评估其在推理与智能体场景的适配。
- mistralai · Hugging Face 新模型精选AI 评分6969
mistralai 发布 Mistral-Small-4-119B-2603-NVFP4,这是 Mistral Small 4 的 post-training-activation quantized 版本。
推荐理由:原文同时给出架构参数、量化来源和 vLLM 部署示例,便于评估推理模式与吞吐取舍。
- stepfun-ai · Hugging Face 新模型精选AI 评分7676
阶跃星辰在 Hugging Face 开源 Step 3.5 Flash-Base,称其为具备推理和 Agent 能力的开源基础模型,并开源训练代码库 SteptronOss。
推荐理由:原文同时给出架构参数、吞吐和基准对比,便于评估开源 MoE 模型在 Agent 场景的取舍。
- stepfun-ai · Hugging Face 新模型精选AI 评分7575
阶跃星辰在 Hugging Face 发布 Step-3.5-Flash-Base-Midtrain,称 Step 3.5 Flash 是其最强开源基础模型,并同步开源训练代码库 SteptronOss。
推荐理由:材料同时给出架构参数、吞吐、长上下文和基准成绩,便于比较开源 MoE 模型的效率取舍。
- Cognition Blog精选AI 评分6363
Cognition 分享了正在训练的 SWE-1.6 早期预览,当前 checkpoint 在 SWE-Bench Pro 上比 SWE-1.5 高 11%,速度同为 950 tok/s。
推荐理由:文章同时披露评测口径、训练提速和 Model UX 问题,可用于比较编码智能体模型的工程取舍。
- Cognition Blog精选AI 评分7070
Cognition 介绍了内部如何用 Devin 构建 Devin,上周将 659 个 Devin PR 合并进自家代码库,高于 2025 年最好一周的 154 个。
推荐理由:文章拆解了 Cognition 内部把 Devin 接入 PR、工单、日志和数据分析的工作流,可迁移到工程团队的智能体落地。
- Cognition Blog精选AI 评分7777
Cognition 发布 Devin 2.2,称这是 Devin 上线以来最大的更新之一,新增通过 computer use 测试、自验证和自动修复代码能力。Devin 现在可访问自己的 Linux desktop,用于启动和测试 desktop applications,并在创建 PR 后建议在桌面上测试,随后返回 screen recordings。
推荐理由:原文给出 Devin 从写代码到测试修复的闭环变化,可用于评估编码智能体接管 PR 前流程的边界。
- MiniMaxAI · Hugging Face 新模型精选AI 评分8484
MiniMax 发布最新模型 MiniMax-M2.5,主打编码、智能体工具调用、搜索和办公任务。M2.5 在 SWE-Bench Verified 得分 80.2%,Multi-SWE-Bench 得分 51.3%,BrowseComp 得分 76.3%,完成 SWE-Bench Verified 比 M2.1 快 37%。
推荐理由:原文同时给出基准、成本和部署入口,可用于比较智能体任务中的速度与价格取舍。
- zai-org · Hugging Face 新模型精选AI 评分8282
zai-org 在 Hugging Face 发布 GLM-5,面向复杂系统工程和长周期 Agent 任务。
推荐理由:材料同时给出参数、训练数据、评测和部署命令,便于比较开放模型在 Agent 与编码任务上的定位。
- Cognition Blog精选AI 评分7272
Cognition 推出 Devin 自动修复 PR 审查评论功能,可配置 Devin 处理来自 Devin Review 和其他 review bots 的评论,并继续自动修复 lint 与 CI/CD 问题。
推荐理由:原文展示了编码智能体与审查机器人闭环的配置方式,可参考其把机械修复前置到人工评审前。
- stepfun-ai · Hugging Face 新模型精选AI 评分7878
StepFun 发布 Step 3.5 Flash 开源基础模型,采用稀疏 MoE 架构,196B 总参数中每 token 激活 11B,并支持 256K 上下文窗口。
推荐理由:材料同时给出架构参数、基准成绩、成本估算和部署路径,便于比较开源 MoE 模型的效率取舍。
Mistral AI 发布 Voxtral Transcribe 2,包括用于批量转写的 Voxtral Mini Transcribe V2 和用于实时应用的 Voxtral Realtime。
推荐理由:原文同时给出延迟、价格和开放权重信息,便于比较语音转写在实时与批处理场景的取舍。
- stepfun-ai · Hugging Face 新模型精选AI 评分7878
阶跃星辰在 Hugging Face 发布 Step-3.5-Flash-GGUF-Q4_K_S,介绍 Step 3.5 Flash 的 INT4 量化 GGUF 权重和本地部署方案。
推荐理由:原文同时给出架构参数、基准对比和本地部署路径,便于评估开源模型在编码与智能体场景的成本表现。