Intern-Decision:基于 Qwen3.5 的多问题决策模型项目
Intern-Decision 将状态、可选图像和多类问题转换为带概率的决策,并微调 Qwen3.5 语言骨干。Intern-Decision-4B 在七个测试套件平均准确率达 90.02%,RTX 4090 本地平均延迟为 44.16 ms。
Intern-Decision 将状态、可选图像和多类问题转换为带概率的决策,并微调 Qwen3.5 语言骨干。Intern-Decision-4B 在七个测试套件平均准确率达 90.02%,RTX 4090 本地平均延迟为 44.16 ms。
NVIDIA 在 Hugging Face 发布 DeepSeek-V4.1-Flash-NVFP4,这是 DeepSeek AI 的 DeepSeek-V4.1-Flash 的 NVFP4 量化版。
InternLM 发布 Intern-S2-397B,称其是面向科学智能和长周期 Agent 的多模态基础模型。该模型结合新的视觉语言预训练范式、大规模多任务强化学习和长周期 Agent 强化学习,覆盖 20 多个科学领域,并在文本推理评测中使用最高 256K tokens、在多模态评测中使用最高 64K tokens。
推荐理由:材料同时给出训练方向、评测设置和部署入口,便于比较科学智能模型的工程落地路径。
zai-org 发布 GLM-5.3-Flash,称其为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 激活参数。官方称它在基准和真实工作负载中超过 GLM-5.2,价格为其十分之一,并在编码和智能体基准上接近 Claude Opus 4.8。
推荐理由:原文同时给出参数规模、架构变化和本地部署框架,便于比较其成本与落地路径。
美团 LongCat 在 Hugging Face 发布 LongCat-Flash-Lite-Sparse,这是基于 LongCat-Flash-Lite 的非思考 MoE 模型,拥有 69B 总参数、每 token 约 3B 激活参数,并原生支持最高 1M tokens 上下文。
推荐理由:原文同时给出架构改动、长上下文设定和多项基准,便于比较稀疏版与密集前代的取舍。
MiniMaxAI 在 Hugging Face 发布 MiniMax-H3,这是一个通用全模态生成系统,支持文本、图像、视频和音频组成的多模态上下文理解,并可生成带原生立体声音频的视频。
推荐理由:原文披露了模块拆分、输入规格和本地部署路径,可帮助开发者评估接入成本与适用场景。
Mistral 发布 Mistral-Medium-3.5-128B-EAGLE,用于为 Mistral Medium 3.5 执行推测解码。
推荐理由:原文同时给出模型规格、替代关系和 vLLM/SGLang 部署方式,便于评估统一模型的接入成本。