Cognition Blog·· 2026-06-08精选AI 评分69
Cognition 推出 FrontierCode 代码质量评测基准
Introducing FrontierCode
AI 导读
Cognition 推出 FrontierCode,用于评测模型是否能达到高质量生产代码库的标准,核心关注 PR 是否会被维护者合并。该基准由 20+ 开源维护者构建任务,每个任务投入超过 40 hours,包含 150 个任务,并声称相比 SWE-Bench Pro 假阳性率低 81%。
推荐理由
原文把代码评测从功能正确扩展到可合并质量,可用于比较模型在生产代码场景中的短板。
来源:Cognition Blog · cognition.ai