跳到正文
原文
Cognition Blog·· 2026-07-08精选AI 评分60

Cognition 披露开源衍生模型可信度评估,SWE-1.7 改善 Kimi K2.7 Code 基线

Measuring the Trustworthiness of Open-Source-Derived Models

AI 导读

Cognition 构建了一套模型可信度评估,用直接问答测试宣传与审查倾向,并用真实编码场景测试模型在不同用户和语境下的行为稳定性。评估覆盖 Kimi K2.7 Code、DeepSeek-V4、GLM 5.2、GPT 5.5、Claude Opus 4.8 和 SWE-1.7 等模型,SWE-1.7 是在开源模型基础上通过大规模强化学习开发的模型。

推荐理由

材料把政治问答、拒绝问题和差异化安全行为放进同一评估框架,可借鉴其测试设计与局限。

来源:Cognition Blog · cognition.ai