标签: 多模态

清除筛选

FLUX 3:Black Forest Labs 的多模态模型与机器人野心

2026 年 7 月 23 日,Black Forest Labs(BFL)发布了 FLUX 3,这是这家德国 AI 实验室首个多模态基础模型。FLUX 3 将图像、视频和音频的训练统一到同一架构下,并能扩展到机器人动作预测。视频能力是这次发布的核心:单个提示词可生成最长 20 秒、带原生音频的 720p 视频片段。 FLUX 3 目前处于 Early Ac…

智谱GLM-5V-Turbo:首款原生多模态编程基础模型

4月2日,智谱AI(Z.ai)发布GLM-5V-Turbo,首款原生多模态编程基础模型。模型原生支持图像、视频、文本等多模态输入,上下文窗口200K,最大输出128K tokens。 模型定位 GLM-5V-Turbo的定位很明确:一个"看得见、写得出"的编程模型。它不是在文本模型上嫁接视觉能力,而是从预训练阶段就做多模态融合,CogViT视觉编码器与MTP…

通义开源影视级配音大模型 Fun-CineForge,关键变化是把“时间”也做进了模型

通义实验室发布并开源了影视配音模型 Fun-CineForge。按官方介绍,它面向独白、旁白、对话、多说话人等多种影视场景,底层基于 CosyVoice3 的语音合成能力构建;对应论文也已上线 arXiv。 这条消息真正值得看的,是这套模型把“时间”当成了一个单独的模态来处理。 为什么“时间模态”这件事重要 传统配音模型更常依赖文本、参考音色和可见嘴型去做音…