baidu · Hugging Face 新模型· baidu·· 2026-05-29精选AI 评分72
百度 ERNIE Team 发布 NAVA 6.3 B 联合音视频生成模型
baidu/NAVA
AI 导读
百度 ERNIE Team 发布 NAVA,这是一个 6.3 B 参数的联合音视频生成模型,可由单一提示词生成同步视频与音频。NAVA 支持多说话人语音的参考音色控制、图像条件续写,采用 Align-then-Fuse MMDiT,并在 Verse-Bench 的 Sync-C、Sync-D、视频质量和 audio WER 上优于列出的开源基线,同时参数量少 2× 到 5×。
推荐理由
原文同时给出架构、评测表和推理命令,可比较联合音视频生成在同步、语音与参数规模上的取舍。
来源:baidu · Hugging Face 新模型 · huggingface.co