跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

128条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 121–128 条 · 共 128 条
8月5日周二
  1. openai · Hugging Face 新模型93

    OpenAI 发布 gpt-oss-20b 开放权重模型

    OpenAI 发布 gpt-oss 系列开放权重模型,gpt-oss-20b 面向低延迟、本地或专用场景,拥有 21B parameters 和 3.6B active parameters。

    推荐理由:材料同时给出参数规模、许可、硬件需求和多种推理部署方式,便于评估开源权重落地成本。

7月12日周六
7月11日周五
  1. moonshotai · Hugging Face 新模型85

    Moonshot AI 发布 Kimi-K2-Instruct,1T 参数 MoE 模型面向 Agent 能力

    Moonshot AI 发布 Kimi-K2-Instruct,这是 Kimi K2 的后训练版本,面向通用聊天和 agentic experiences。Kimi K2 是 MoE 语言模型,拥有 1T 总参数、32B 激活参数、128K 上下文窗口,并在 15.5T tokens 上预训练。

    推荐理由:材料同时给出架构参数、基准对比和部署方式,便于评估 Kimi K2 的编码与工具调用定位。

5月21日周三
5月7日周三
  1. Mistral AI72

    Mistral AI 发布 Mistral Medium 3,主打低成本企业级语言模型

    Mistral AI 发布 Mistral Medium 3,称其在 SOTA 性能、8X lower cost 和更简单部署之间取得平衡,面向企业使用。Mistral 称该模型在全套基准上达到或超过 Claude Sonnet 3.7 的 90%,价格为 $0.4 input / $2 output per M token,并在编码和多模态理解等专业场景表现突出。

    推荐理由:原文同时给出价格、部署方式和对比基准,便于评估中型模型在企业场景的取舍。

10月1日周二
  1. openai · Hugging Face 新模型67

    OpenAI 发布 Whisper large-v3-turbo 语音识别模型

    OpenAI 在 Hugging Face 发布 Whisper large-v3-turbo,它是 Whisper large-v3 的剪枝微调版本。模型将解码层从 32 层减少到 4 层,因此速度更快,但会有轻微质量下降;参数量为 809 M,支持在 Hugging Face Transformers 中用于自动语音识别、语音翻译和时间戳预测。

    推荐理由:模型卡同时给出结构变化与部署示例,便于评估语音转写场景中的速度和质量取舍。