OpenMontage 技术解读:一套让编码代理拍片子的开源流水线

OpenMontage 自称"第一个开源的 agentic 视频生产系统",Star 数超过 5.3 万,单日新增 1,144,GitHub 给它挂了 Trending 榜单第一的徽章。它不提供网页版生成器,也不发布自己的模型,而是把一整套视频制片流程装进一个仓库:开发者用现成的 AI 编码代理(Claude Code、Cursor、Copilot、Windsurf、Codex 均可)打开项目,用自然语言下指令,代理负责调研、写脚本、生成素材、剪辑和合成,最后输出一条成片。项目采用 AGPLv3 协议。

OpenMontage Backlot 运行看板

编排器去哪了:代理即流水线

常见的生成式视频自动化有三种做法:n8n 这类节点式工作流、ComfyUI 的图编排,以及团队自研的 pipeline 框架,共同点是把流程写死在代码或图结构里。OpenMontage 走了第四条路:仓库里没有代码编排器,Python 只提供工具函数和持久化,编排逻辑全部放在 YAML 清单和 Markdown 技能文件里,由编码代理在运行时读取并执行。

项目把知识拆成三层。第一层是 tools/pipeline_defs/,回答"有什么":100 多个注册工具,覆盖视频生成、图像、语音合成、音乐、混音、字幕、增强、转写分析等类别,外加每条流水线的 YAML 清单;第二层是 skills/,回答"怎么用":每个阶段有一份 director skill,用 Markdown 写明执行步骤、自检项和质量标准;第三层是 .agents/skills/,存放外部技术知识包,每个工具声明自己依赖哪些包。代理先读清单知道可用的能力,再读技能知道项目约定的质量线,遇到不熟的供应商再去查知识包。

这套设计把流程可靠性押在提示词工程上:代理对技能文件的遵循是概率性的,后文会回到它的代价。

七个阶段,四道闸门

每条流水线遵循同一个结构化流程:research -> proposal -> script -> scene_plan -> assets -> edit -> compose。三个细节值得单独拆开。

调研是一等公民阶段。写脚本之前,代理先去搜 YouTube、Reddit、Hacker News、新闻站和学术来源,收集数据点、受众问题和视觉参考,产出一份带引用的 research brief。脚本的每个论断都能往回追到这份简报。

状态检查点贯穿全程。代理在每个阶段把状态写成 JSON,包含决策日志和成本快照,中断后可以从任意检查点恢复,不用从头烧钱。

闸门是硬性的。创意决策点暂停等人工批准;合成前有一道 pre-compose validation gate,检查交付承诺、幻灯片风险和渲染器选择;渲染交给 Remotion(用 React 写视频时间线)或 FFmpeg,按视觉语法匹配;渲染完成后再跑一轮自检,用 ffprobe 验证文件、抽样抽帧、分析音频电平、核对脚本里承诺过的内容,全部通过才交付最终视频。脚本产物还要过 20 多套 JSON Schema 的契约校验。

脚本阶段的审批门:代理暂停,等用户在聊天里批准或要求修改

Backlot:给代理的运行过程开一扇窗

聊天窗口只能告诉用户代理"说了什么",Backlot 是项目的可视化看板,展示代理"正在做什么"。生产开始时自动打开,看板内容全部从流水线写下的项目文件推导,不需要额外配置。

从官方截图可以看到三层信息。顶部是七阶段进度条和实时花费(示例里是 0.08 美元,预算上限 4 美元);右侧决策面板展示每一次供应商选择的分数和理由,比如合成引擎选了 Remotion、评分 0.83、落选者是 HyperFrames,图像生成选了 flux_image、评分 0.9、落选者是 gpt-image-1;活动流逐条列出每次生成的耗时和成本,flux_image 的一次生成是 18.4 秒、0.04 美元。分镜接触表则在渲染前暂停,每张卡片带 prompt、成本、质量分和候选 take,用户批准之后才进入合成。

供应商打分覆盖 7 个维度,加上"also considered"的落选记录,代理的每次选择都留了审计痕迹。对排查"为什么这条片子画质不行"这类问题,决策日志比重新跑一遍有效得多。

分镜审批界面:每张卡带 prompt、成本与质量分,批准后才渲染

成本阶梯:从零美元到本地 GPU

docs/PROVIDERS.md 给出一份 15 级配置阶梯,免费路径足够跑通全流程。零成本层包括 Pexels 和 Pixabay 的素材库、Google TTS 的三档免费额度(Standard、WaveNet、Neural2 各自每月 100 万字符,加起来约 250 分钟以上的旁白)、ElevenLabs 每月 1 万字符、以及 Piper 本地离线语音合成。付费入门层是按张计价的图像生成:fal.ai 约 0.03 美元一张,Google Imagen 约 0.04 美元,OpenAI GPT Image 2 约 0.05 美元。云端视频生成的价位明显更高,Gemini Omni Flash 一个 8 秒片段约 0.80 美元且仅限付费档,Runway 每月 12 美元。顶层是本地 GPU 路径,支持 WAN 2.1/2.2、Hunyuan 1.5、LTX、CogVideo-5b 等开源模型,也支持接入本地 ComfyUI。

成本估算在提交给供应商之前完成,文档里写明一条原则:未知定价不按免费处理。官方展示片公开了每条的账单:60 秒动画短片 The Last Banana 成本 1.33 美元,由 6 段 Kling v3 生成片段、Chirp3-HD 旁白、免版税钢琴曲和词级字幕经 Remotion 合成;50 秒竖屏概念片约 4 美元;七段世界展示片的源生成成本约 5 美元。

完全不想付钱的路径也存在。Documentary Montage 流水线从 Pexels、Archive.org、NASA、Wikimedia、Unsplash 这些开放档案建素材语料库,用 CLIP 做语义检索和排序,剪成时间线,全程不调用任何付费生成 API。

边界在哪

部署门槛不高:Python 3.10 以上、FFmpeg、Node 18 以上,make setup 一步完成。真正的约束在别处。生成片段的时长和画质仍受底层模型限制,10 秒级的镜头是常态;整套系统的可靠性取决于编码代理对 Markdown 技能的遵循程度,这是概率性的执行,与确定性流水线的失败模式不同,跑偏时需要人来纠正;AGPLv3 对想把它集成进商业产品的团队有传染性约束,需要法务过目。

对个人开发者,它演示了一种可复用的模式:把领域流程拆成清单、技能和工具三层,让通用编码代理充当执行器,用 Schema 校验、审批门和渲染后自检兜住质量。仓库在 github.com/calesthio/OpenMontage,README 里的示例 prompt 标注了预期成本,make demo 可以零配置渲染演示视频。