OpenAI 发布 GPT-6.1 Sol,称其接近 GPT-6 Astra 且成本更低
OpenAI 在 DevDay 活动上展示 GPT-6.1 Sol,称其在智能体编码、计算机使用和专业工作上接近 GPT-6 Astra,标准输入和输出 token 价格为 1/5。
推荐理由:原文同时交代价格、可用入口与安全背景,便于比较 GPT-6.1 Sol 和 GPT-6 Astra 的定位。
OpenAI 在 DevDay 活动上展示 GPT-6.1 Sol,称其在智能体编码、计算机使用和专业工作上接近 GPT-6 Astra,标准输入和输出 token 价格为 1/5。
推荐理由:原文同时交代价格、可用入口与安全背景,便于比较 GPT-6.1 Sol 和 GPT-6 Astra 的定位。
GPT-6.1 Sol 已在 Amazon Bedrock 正式可用,为编码、computer use 和高频专业工作负载带来更强推理能力。OpenAI 称它在 DeepSWE v1.1 上以约 one-fifth 的每任务成本匹配 GPT-6 Astra,并比 GPT-6 Sol 最佳分数高 6.4 percentage points。
推荐理由:原文同时给出任务成本对比与 Bedrock 生产控制,便于评估智能体工作流落地取舍。
GPT-6.1 Sol 在 GPT-6 Sol 发布仅 7 天后取代它,在 Artificial Analysis Intelligence Index 中仅比 GPT-6 Astra 低 1 分,Cost per Task 不到后者 1/4。
推荐理由:原文集中给出智能指数、任务成本和 token 用量对比,便于判断 GPT-6.1 Sol 的成本效率位置。
AdvancedMathBench-AutoVerifier 是用于 ProverBench 的自动评分器,可评估自然语言数学证明、解释错误并定位最早错误步骤。
上海人工智能实验室研究团队开源 Intern-Decision,包含 0.8B、2B 和 4B 三款多模态决策模型,称其平均指标超越 Jev 和相关开源模型。团队在 RTX4090 上测试称,Intern-Decision 相比 Jev 有 2-3倍效率提升,4B 端到端推理时延低于每 query 45ms,0.8B 和 2B 可达到每秒约30次推理。
internlm 发布 Intern-Decision-2B,这是一个由 Qwen3.5-2B 微调而来的多模态结构化决策模型,可接收共享状态、命名问题 schema 和可选图像,并在一次模型前向中为每个问题返回答案分布。
Intern-Decision 将状态、可选图像和多类问题转换为带概率的决策,并微调 Qwen3.5 语言骨干。Intern-Decision-4B 在七个测试套件平均准确率达 90.02%,RTX 4090 本地平均延迟为 44.16 ms。
METR 发布了 Claude Opus 5.5 预部署评估摘要,重点考察其对 Anthropic AI R&D 的潜在加速影响。评估基于 10 business days 的 API 访问、五项任务测试、Anthropic 问卷与访谈,以及另一项 METR 内部 AI R&D 加速评估的结论。
推荐理由:报告把模型能力测试与研发加速问题分开处理,可帮助读者理解预部署评估如何约束能力叙事和风险判断。
InternLM 发布 Intern-S2-397B,称其是面向科学智能和长周期 Agent 的多模态基础模型。该模型结合新的视觉语言预训练范式、大规模多任务强化学习和长周期 Agent 强化学习,覆盖 20 多个科学领域,并在文本推理评测中使用最高 256K tokens、在多模态评测中使用最高 64K tokens。
推荐理由:材料同时给出训练方向、评测设置和部署入口,便于比较科学智能模型的工程落地路径。
zai-org 发布 GLM-5.3-BF16,使用与 GLM-5.2 相同的基座模型,提升来自后训练。
推荐理由:模型卡同时给出同基座后训练收益、基准对比和部署参数,便于比较编码、安全与长程任务表现。
美团 LongCat 在 Hugging Face 发布 LongCat-Flash-Lite-Sparse,这是基于 LongCat-Flash-Lite 的非思考 MoE 模型,拥有 69B 总参数、每 token 约 3B 激活参数,并原生支持最高 1M tokens 上下文。
推荐理由:原文同时给出架构改动、长上下文设定和多项基准,便于比较稀疏版与密集前代的取舍。
Mistral 发布 Mistral-Medium-3.5-128B-EAGLE,用于为 Mistral Medium 3.5 执行推测解码。
推荐理由:原文同时给出模型规格、替代关系和 vLLM/SGLang 部署方式,便于评估统一模型的接入成本。
Moonshot AI 在 Hugging Face 发布 Kimi-K2.6,这是开源的原生多模态智能体模型。该模型采用 MoE 架构,Total Parameters 1T、Activated Parameters 32B、Context Length 256K,支持长周期编码、coding-driven design、Agent Swarm、图像和视频输入。
推荐理由:原文同时给出模型结构、评测表和部署入口,便于对比其在编码与智能体任务中的定位。