跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 61–80 条 · 共 93 条
4月14日周二
  1. moonshotai · Hugging Face 新模型83

    Moonshot AI 开源 Kimi-K2.6 原生多模态智能体模型

    Moonshot AI 在 Hugging Face 发布 Kimi-K2.6,这是开源的原生多模态智能体模型。该模型采用 MoE 架构,Total Parameters 1T、Activated Parameters 32B、Context Length 256K,支持长周期编码、coding-driven design、Agent Swarm、图像和视频输入。

    推荐理由:原文同时给出模型结构、评测表和部署入口,便于对比其在编码与智能体任务中的定位。

4月13日周一
4月3日周五
  1. Google DeepMind84

    Google DeepMind 发布 Gemma 4 开放模型家族

    Google DeepMind 发布 Gemma 4 开放模型家族,包含 E2B、E4B、26B MoE 和 31B Dense,面向高级推理和智能体工作流,并采用 Apache 2.0 license。

    推荐理由:原文同时给出模型尺寸、端侧部署方式和生态入口,便于比较开放模型在硬件约束下的能力取舍。

3月31日周二
3月29日周日
3月25日周三
  1. meituan-longcat · Hugging Face 新模型74

    美团 LongCat-Next A3B 原生多模态模型开源

    美团 LongCat 团队开源 LongCat-Next,这是基于 LongCat-Flash-Lite MoE backbone(A3B)的原生多模态模型,统一处理文本、视觉和音频。

    推荐理由:材料同时给出模型范式、能力边界和部署条件,便于比较离散多模态路线的工程取舍。

3月17日周二
3月11日周三
3月5日周四
  1. mistralai · Hugging Face 新模型79

    Mistral Small 4 119B 2603 Eagle 发布,统一 Instruct、Reasoning 和 Devstral 能力

    Mistral AI 在 Hugging Face 发布 Mistral Small 4 119B 2603 Eagle,这是一个混合模型,可同时作为通用指令模型和推理模型使用,并统一 Instruct、Reasoning 和 Devstral 三类模型能力。

    推荐理由:材料同时给出架构参数、模式切换和 vLLM 部署示例,便于评估其在推理与智能体场景的适配。

3月3日周二
2月18日周三
  1. World Labs70

    World Labs 宣布获得 $1 billion 新融资

    World Labs 宣布获得 $1 billion 新融资,投资方包括 AMD、Autodesk、Emerson Collective、Fidelity Management & Research Company、NVIDIA、Sea 等。

    推荐理由:融资信息同时交代了 World Labs 的空间智能方向和 Marble 的输入形态,便于理解其后续投入重点。

2月2日周一
1月23日周五
1月21日周三
1月1日周四
12月17日周三
12月3日周三
11月30日周日
11月12日周三
  1. World Labs78

    World Labs 多模态世界模型 Marble 面向所有用户开放

    World Labs 今天将多模态世界模型 Marble 面向所有用户开放,并扩展其从文本、图像、视频或粗略3D布局创建3D世界的能力。Marble 支持交互式编辑、扩展和组合世界,生成后可导出为 Gaussian splats、meshes 或视频。

    推荐理由:原文列出从文本、图像、视频到粗略3D布局的生成路径,便于比较世界模型工作流。

11月7日周五