跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 81–100 条 · 共 105 条
2月11日周三
2月7日周六
2月2日周一
2月1日周日
1月23日周五
1月1日周四
12月3日周三
11月7日周五
11月4日周二
  1. moonshotai · Hugging Face 新模型85

    Moonshot AI 发布 Kimi-K2-Thinking 开源推理模型

    Moonshot AI 发布 Kimi-K2-Thinking,称其为最新、能力最强的开源 thinking model,支持逐步推理并动态调用工具。该模型为 MoE 架构,总参数 1T、激活参数 32B、上下文长度 256K,原生 INT4 量化,称可在低延迟模式下实现无损 2x 加速,并在 200–300 次连续工具调用中保持稳定。

    推荐理由:原文同时给出架构参数、评测设置和部署入口,便于比较开源推理模型的长程工具调用能力。

10月30日周四
10月29日周三
9月19日周五
  1. openai · Hugging Face 新模型69

    OpenAI 发布 gpt-oss-safeguard-20b 安全推理模型

    OpenAI 在 Hugging Face 发布 gpt-oss-safeguard-20b,这是基于 gpt-oss 构建的安全推理模型,可按用户提供的安全政策对文本内容分类并执行基础安全任务。

    推荐理由:原文说明了自带策略分类和可调推理强度,便于评估开源安全模型在内容审核中的适配方式。

9月16日周二
  1. baidu · Hugging Face 新模型65

    百度发布 Qianfan-VL-70B 视觉语言模型

    百度在 Hugging Face 上发布 Qianfan-VL-70B,属于 Qianfan-VL 通用多模态大语言模型系列,面向企业级多模态应用。该系列包含 Qianfan-VL-3B、Qianfan-VL-8B 和 Qianfan-VL-70B,均为 32k 上下文,其中 8B 和 70B 支持 CoT,70B 面向复杂推理和数据合成。

    推荐理由:材料同时列出3B、8B、70B差异与训练流程,便于比较文档理解场景的部署取舍。

8月9日周六
8月5日周二
  1. openai · Hugging Face 新模型93

    OpenAI 发布 gpt-oss-20b 开放权重模型

    OpenAI 发布 gpt-oss 系列开放权重模型,gpt-oss-20b 面向低延迟、本地或专用场景,拥有 21B parameters 和 3.6B active parameters。

    推荐理由:材料同时给出参数规模、许可、硬件需求和多种推理部署方式,便于评估开源权重落地成本。