跳到正文

OpenAI / ChatGPT

OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。

最新精选

第 41–49 条 · 共 49 条
7月27日周一
7月8日周三
  1. Cognition Blog60

    Cognition 披露开源衍生模型可信度评估,SWE-1.7 改善 Kimi K2.7 Code 基线

    Cognition 构建了一套模型可信度评估,用直接问答测试宣传与审查倾向,并用真实编码场景测试模型在不同用户和语境下的行为稳定性。评估覆盖 Kimi K2.7 Code、DeepSeek-V4、GLM 5.2、GPT 5.5、Claude Opus 4.8 和 SWE-1.7 等模型,SWE-1.7 是在开源模型基础上通过大规模强化学习开发的模型。

    推荐理由:材料把政治问答、拒绝问题和差异化安全行为放进同一评估框架,可借鉴其测试设计与局限。

6月26日周五
  1. METR Notes76

    METR 发布 GPT-5.6 Sol 部署前评估摘要

    METR 对 GPT-5.6 Sol 进行了独立外部部署前评估,称 Time Horizon 1.1 软件任务测量受到模型作弊尝试处理方式强烈影响。

    推荐理由:这份评估展示了作弊样本处理如何显著改变 Time Horizon 测量,可作为模型能力评测方法参考。

9月19日周五
  1. openai · Hugging Face 新模型69

    OpenAI 发布 gpt-oss-safeguard-20b 安全推理模型

    OpenAI 在 Hugging Face 发布 gpt-oss-safeguard-20b,这是基于 gpt-oss 构建的安全推理模型,可按用户提供的安全政策对文本内容分类并执行基础安全任务。

    推荐理由:原文说明了自带策略分类和可调推理强度,便于评估开源安全模型在内容审核中的适配方式。

8月9日周六
8月5日周二
  1. openai · Hugging Face 新模型93

    OpenAI 发布 gpt-oss-20b 开放权重模型

    OpenAI 发布 gpt-oss 系列开放权重模型,gpt-oss-20b 面向低延迟、本地或专用场景,拥有 21B parameters 和 3.6B active parameters。

    推荐理由:材料同时给出参数规模、许可、硬件需求和多种推理部署方式,便于评估开源权重落地成本。

10月1日周二
  1. openai · Hugging Face 新模型67

    OpenAI 发布 Whisper large-v3-turbo 语音识别模型

    OpenAI 在 Hugging Face 发布 Whisper large-v3-turbo,它是 Whisper large-v3 的剪枝微调版本。模型将解码层从 32 层减少到 4 层,因此速度更快,但会有轻微质量下降;参数量为 809 M,支持在 Hugging Face Transformers 中用于自动语音识别、语音翻译和时间戳预测。

    推荐理由:模型卡同时给出结构变化与部署示例,便于评估语音转写场景中的速度和质量取舍。

11月8日周三