MiniMax H3:全模态视频生成与开源权重本地部署
MiniMax H3 7 月 31 日,MiniMax 发布了第三代视频生成模型 H3。这不是又一个文生视频工具:H3 将文本、图像、视频、音频作为统一上下文输入,生成带原生立体声音轨、最高 2K 分辨率、最长 15 秒的视频片段。两天后,模型权重在 HuggingFace 上线,ComfyUI 完成首日适配。 核心规格 | 参数 | 规格 | |---|-…
MiniMax H3 7 月 31 日,MiniMax 发布了第三代视频生成模型 H3。这不是又一个文生视频工具:H3 将文本、图像、视频、音频作为统一上下文输入,生成带原生立体声音轨、最高 2K 分辨率、最长 15 秒的视频片段。两天后,模型权重在 HuggingFace 上线,ComfyUI 完成首日适配。 核心规格 | 参数 | 规格 | |---|-…
7月9日,蚂蚁灵波开源了LingBot-Video,全球第一个基于MoE(混合专家)架构、面向具身智能的视频生成基础模型。在北京大学联合字节跳动发布的RBench评测基准上,LingBot-Video总分0.620排名第一,超过了Wan 2.6(0.607)、Seedance 1.5 Pro(0.584)、Cosmos 3 Super(0.581)和Veo…
Gemini Omni Flash 登顶 Video Arena 盲测榜,领先第二名 101 分 Google DeepMind 公测的视频生成模型 Gemini Omni Flash 以 Elo 1404 分登顶 Video Arena 盲测排行榜,领先第二名字节跳动 Seedance 2.0 Mini 达 101 分,创下该榜单有史以来最大的领先分差之一…
字节跳动旗下 CapCut 推出 CapCut Video Studio,正式将 Dreamina Seedance 2.0 音视频模型纳入产品线。用户无需时间轴操作,即可通过多模态输入生成短视频。 Seedance 2.0 的核心能力集中在四个方面。 多模态参考输入:每个项目最多上传 9 张图片、3 段视频和 3 段音频(单段最长 15 秒),模型根据这些…