开源视频生产系统,含12条生产流水线、100+工具、700+Agent技能文件。可将AI编程助手扩展为完整视频制作工作室,支持多AI Agent协作(Claude/GPT/DeepSeek等)。
Monty the Clapper — OpenMontage 的官方吉祥物
首个开源的 AI 智能体视频制作系统。
粘贴视频 · 快速开始 · 试试这些提示词 · 流水线 · 工作原理 · 赞助商 · 服务提供商 · 审核指南 · AI 智能体指南
想支持 OpenMontage?为项目提供赞助。
把你的 AI 编程助手变成完整的视频制作工作室。用自然语言描述你的需求——AI 智能体负责研究、撰写脚本、生成素材、剪辑和最终合成。
重要区别:OpenMontage 可以制作基于图像的视频,但它也能为免费/开源工作流制作真正的视频:AI 智能体从免费素材片和开放档案库中构建语料库,检索实际的动态片段,将其剪辑到时间线上,并渲染出成品。这不是常见的"把几张静图动画化一下就叫视频"的把戏。
"SIGNAL FROM TOMORROW"——一部完全通过 OpenMontage 制作的科幻电影预告片:概念、剧本、分镜计划、Veo 生成的动态片段、配乐和 Remotion 合成。
"THE LAST BANANA"——一部 60 秒的皮克斯风格动画短片,讲述一根孤独的香蕉如何与一颗猕猴桃成为朋友。6 个 Kling v3 生成的动态片段(通过 fal.ai)、Google Chirp3-HD 配音、免版税钢琴配乐、TikTok 风格的单词级字幕和 Remotion 合成。总成本:1.33 美元。
"The Library at Alexandria"——一部 70 秒的历史挽歌,讲述人类在一夜之间失去了什么。五个手工创作的场景——一幅照明手稿页面、瀑布般的卷轴标签、一支在烛火中从 700,000 倒数到 0 的燃烧计数器、一片带有幸存希腊文的烧焦羊皮纸碎片,以及一片虚空——配以 OpenAI 'ash' 配音和来自 Pixabay 的免费弦乐配乐。总成本:0.02 美元。通过 OpenMontage 的工坊(定制)合成模式构建——每个场景从头打造,无共享组件。
"VOID — Neural Interface"——仅凭一个 API 密钥(OpenAI)制作的产品广告。4 张 AI 生成的图像(gpt-image-1)、TTS 配音、自动来源的免版税音乐、通过 WhisperX 生成的单词级字幕,以及 Remotion 数据可视化。总成本:0.69 美元。零人工素材工作。
"Afternoon in Candyland"——一部吉卜力风格的动画。一小女孩穿过糖果门、橡皮糖河流和棒棒糖花园的异想天开的午后冒险。12 张 FLUX 生成的图像配以多图交叉淡入淡出、电影级镜头运动(缩放、平移、肯恩·伯恩斯效果)、闪光/花瓣/萤火虫粒子叠加,以及根据能量偏移自动检测的环景音乐。总成本:0.15 美元。无视频生成,无人工剪辑。
"Mori no Seishin"——一部吉卜力风格的动画,讲述森林精灵穿越古老森林的旅程。12 张 FLUX 生成的图像配以视差交叉淡入淡出、漂移和平移镜头运动、萤火虫和花瓣粒子、电影级暗角光效以及环景森林配乐。总成本:0.15 美元。静图通过 Remotion 动画引擎被赋予生命。
订阅 YouTube 上的 @OpenMontage 频道,观看新视频发布——每个视频都包含完整的提示词、流水线、使用的工具和成本,你可以自行复现。
从你喜欢的视频开始
从参考视频出发通常比从空白提示词开始更快。
OpenMontage 可以从 YouTube 视频、Short、Reel、TikTok 或本地视频片段出发,将其转化为扎实的制作计划:
粘贴参考视频
AI 智能体分析转录文本、节奏、场景、关键帧和风格
你获得 2-3 个差异化的概念、诚实的工具路径、成本估算,以及全量制作前的样本
"Here's a YouTube Short I love. Make me something like this, but about quantum computing."
你得到的不是"最佳猜测的提示词 spaghetti"。你得到的是:
从参考中保留什么:节奏、钩子风格、结构、基调
改变了什么:主题、视觉处理角度、角度、配音方式
在你目标时长下的成本估算,在素材生成之前
用你目前可用工具实际呈现的样子
适用于 Claude Code、Cursor、Copilot、Windsurf、Codex——任何能读取文件和运行代码的 AI 编程助手。
亲眼见证——Backlot 实时故事板
聊天告诉你 AI 智能体说了什么。Backlot 向你展示制作实际在做什么——一个本地面板,在流水线运行时自动填充。阶段亮起,剧本以分镜脚本页面形式落地,场景卡片在素材生成时闪烁,每一个服务提供商的选择和花费都在墙上。
当制作开始时,AI 智能体自动为你打开它。无需设置、无需报告——面板从流水线已写入的项目文件中推导一切。

故事板现在是真正的审批关卡。素材生成在逐场景的素材表上暂停——镜头、提示词、每素材成本、质量分数——让你在渲染之前审批视觉内容,而不是在已成定局之后:

创意关卡会等待直到你回复。面板显示等待的是什么以及为什么;你在聊天中回复:

每台机器上的制作,实时优先,都在资料库中:

python -m backlot open # 资料库——磁盘上的每个项目
python -m backlot open <project-id> # 单个制作的实时面板
python scripts/backlot_simulate_run.py # 还没有制作?观看一个模拟运行
当一次运行结束后,点击 ▶ REPLAY RUN——整个制作从其时间戳开始回放,从头到尾可拖动。参见 backlot/README.md 了解其工作原理。
Python 3.10+ — python.org
FFmpeg — brew install ffmpeg / sudo apt install ffmpeg / ffmpeg.org
Node.js 18+ — nodejs.org
AI 编程助手 — Claude Code、Cursor、Copilot、Windsurf 或 Codex
git clone https://github.com/calesthio/OpenMontage.git
cd OpenMontage
make setup
在 AI 编程助手中打开项目,告诉他你想要什么:
"Make a 60-second animated explainer about how neural networks learn"
或者如果你想要真实 footage 路径:
"Make a 75-second documentary montage about city life in the rain. Use real footage only, no narration, elegiac tone, with music."
就这样。AI 智能体通过实时网络搜索研究你的主题,生成 AI 图像,用语音方向撰写和配音脚本,自动查找免版税背景音乐,烧入单词级字幕,并渲染最终视频。在你看到任何内容之前,系统运行多点自检——ffprobe 验证、帧采样、音频电平分析、交付承诺验证和字幕检查。每个服务提供商的选择都按 7 个维度评分,并带有可审计的决策日志。每个创意决策都需获得你的审批。
不用 make?macOS/Linux:python3 -m venv .venv && source .venv/bin/activate && python -m pip install -r requirements.txt && cd remotion-composer && npm install && cd .. && python -m pip install piper-tts && cp .env.example .env
Windows PowerShell: py -3 -m venv .venv; .\.venv\Scripts\Activate.ps1; python -m pip install -r requirements.txt; cd remotion-composer; npm install; cd ..; python -m pip install piper-tts; Copy-Item .env.example .env
Windows: 若 npm install 报 ERR_INVALID_ARG_TYPE 错误,改用 npx --yes npm install。
如果你是一个 OpenClaw 智能体正在阅读本文:恭喜,你可能通过了图灵测试
本仓库专为智能体运行而构建。如果你是一个 OpenClaw 风格的智能体,以下是快速上手的最短路径:
先读契约 从 AGENT_GUIDE.md 开始,然后读 PROJECT_CONTEXT.md。
不要自行发挥生产流程 OpenMontage 是流水线驱动的。真实工作必须经过 pipeline_defs/、stage 导演技能(skills/pipelines/)以及注册表的工具发现。
检查实际能力边界 运行:
python -c "from tools.tool_registry import registry; import json; registry.discover(); print(json.dumps(registry.support_envelope(), indent=2))"
python -c "from tools.tool_registry import registry; import json; registry.discover(); print(json.dumps(registry.provider_menu(), indent=2))"
将每个视频请求视为流水线选择问题 先选对流水线,再读清单,再读 stage 技能,然后使用工具。
添加 API 密钥(可选——密钥越多,工具越全)
# .env — 每个密钥都是可选的,按需添加
# 图片 + 视频网关:
FAL_KEY=your-key # FLUX 图片 + Google Veo、Kling、MiniMax 视频 + Recraft 图片
ATLASCLOUD_API_KEY=your-key # Atlas Cloud — Seedream/Nano Banana/GPT Image + Kling/Seedance/Hailuo 视频
# Kling 官方直连 API:
KLING_API_KEY=your-key # 官方 Kling 视频、图片、TTS、虚拟人、口型同步
KLING_API_BASE_URL= # 可选;默认为新加坡 API 端点
# 免费素材:
PEXELS_API_KEY=your-key # 免费库存视频和图片
PIXABAY_API_KEY=your-key # 免费库存视频和图片
UNSPLASH_ACCESS_KEY=your-key # 免费图片
# 音乐:
SUNO_API_KEY=your-key # 完整歌曲、器乐、任意风格
# 语音和图片:
ELEVENLABS_API_KEY=your-key # 高级 TTS、AI 音乐、音效
OPENAI_API_KEY=your-key # OpenAI TTS、GPT Image 2 图片
XAI_API_KEY=your-key # xAI Grok 图片编辑/生成 + Grok 视频生成
GOOGLE_API_KEY=your-key # Google Imagen 图片、Google TTS(700+ 语音)
# 更多视频提供商:
HEYGEN_API_KEY=your-key # HeyGen — 通过单一网关接入 VEO、Sora、Runway、Kling
RUNWAY_API_KEY=your-key # Runway Gen-4 直连
make install-gpu
# 然后添加到 .env:
VIDEO_GEN_LOCAL_ENABLED=true
VIDEO_GEN_LOCAL_MODEL=wan2.1-1.3b # 或 wan2.1-14b、hunyuan-1.5、ltx2-local、cogvideo-5b
零 API 密钥你能得到什么
制作真实视频不需要付费 API 密钥。开箱即用,make setup 提供:
OpenMontage 在提案阶段选择 Remotion 或 HyperFrames(锁定为 render_runtime)。Remotion 是数据驱动的解说视频和使用现有 React 场景栈的默认方案;HyperFrames 是动画图形密集型需求的默认方案,这些需求天然适合表达为 HTML + GSAP,包括角色动画流水线输出的 SVG/GSAP 绑定器。完整决策矩阵见 skills/core/hyperframes.md。
基于图片的视频:Piper 朗读你的脚本,图片提供视觉内容,Remotion 将它们动画化为一支精致的剪辑。
本地角色动画:SVG 绑定器、姿态库、GSAP 时间线,以及 HyperFrames 将卡通角色渲染到 projects/<project-name>/renders/final.mp4。
真实影像视频:纪录片剪辑流水线从 Archive.org、NASA、Wikimedia Commons 和可选的免费密钥来源(如 Pexels 和 Unsplash)构建可 CLIP 检索的语料库,然后将真实运动镜头剪辑成一部完整的视频。
如果你想要第二种效果,在提示中说明要做纪录片剪辑、语调诗或库存素材拼贴,并明确说"只使用真实素材"。
将以下任意提示复制到你的 AI 编程助手。每一个都会运行一个完整的生产流水线。
从参考视频开始
"这是我很喜欢的一个 YouTube Short。帮我做一个类似的,但主题是面向高中生的 CRISPR。"
"分析这个 Reel,给我 3 个我可以为自己的产品发布制作的原创变体。"
"我喜欢这个视频的节奏和开场钩子。保持这种能量,但把它变成一个 45 秒的黑洞科普讲解。"
"制作一个 45 秒的动画科普视频,解释为什么天空是蓝色的"
"创建一个 60 秒的视频,讲述互联网的历史,包含旁白和字幕"
"制作一个关于全球咖啡消费的,数据驱动的科普讲解视频"
免费真实影像纪录路径
"制作一个 90 秒的纪录片剪辑,关于城市凌晨 4 点的感觉。只用真实素材,不要旁白,基调要抒情。"
"创建一个 60 秒的 Adam Curtis 风格的档案剪辑,关于 1950 年代的消费乐观主义。优先使用 Archive.org 和 Wikimedia 的素材。"
"用真实的库存素材剪一个关于雨中归家的梦幻蒙太奇。可以配音乐,不要旁白。"
配置图片/视频提供商后(~$0.15–$1.50)
"创作一个 30 秒的吉卜力风格动画,讲述黄金时分漂浮在云端的魔法图书馆"
"制作一个 30 秒的动漫风格动画,讲述有着生物发光珊瑚和古老遗迹的水下神庙"
"创作一个用 AI 生成的视觉素材讲解 CRISPR 基因编辑工作原理的动画科普"
"为一款名为 AquaPulse 的虚构智能水杯制作产品发布预告"
"为一部科幻概念短片创作一个 30 秒的电影感预告片:人类收到来自 1000 年后的警告"
"制作一个 90 秒的面向初中生讲解量子计算的动画科普,要有有趣的旁白声音和定制配乐"
想要更多?参见完整提示库,其中包含经过测试的提示词、预期成本和输出示例,或者运行 make demo 即时渲染零密钥演示视频。
每条流水线都是一个完整的生产工作流程,从创意到成片。
每条流水线都遵循相同的结构化流程:
research -> proposal -> script -> scene_plan -> assets -> edit -> compose
每个 stage 都有专门的导演技能——一个 markdown 指令文件,教智能体如何精确执行该 stage。智能体读取技能、使用工具、自我审查、设置检查点,并在创意决策点请求人工审批。
网络研究是一等公民 stage。在写出一个字的脚本之前,智能体会搜索 YouTube、Reddit、Hacker News、新闻网站和学术来源。它收集数据点、受众问题、热门角度和视觉参考——然后以结构化研究简报的形式引用所有内容。你的视频基于真实、当前的资讯,而非虚构的事实。
大多数 AI 视频工具只给你一个根据提示生成的片段。OpenMontage 给你的是端到端的生产流水线——与真实制作团队遵循的结构化流程相同,由你的 AI 智能体自动化执行。
大多数"免费 AI 视频"堆栈实际上是"将静态图片动画化"。OpenMontage 也能做到这一点,但它还能从免费/开放来源的真实影像中构建完整视频,经语义排序、有意图地剪辑,并渲染为正经的时间线。
剪辑你自己的真人出镜镜头。从头生成完整的动画科普讲解。将 2 小时的播客剪成十几个社交短视频。将你的内容翻译并配音成 10 种语言。用库存素材和 AI 生成的场景构建电影感品牌预告。只要制作团队能做的,OpenMontage 就能编排。
12 条生产流水线 — 科普讲解、真人出镜、屏幕演示、电影预告、动画、播客、本地化、纪录片剪辑等
100+ 生产工具 — 涵盖视频生成、图片创作、文字转语音、音乐、音效混音、字幕、增强和分析
700+ 智能体技能和生产知识文件 — 流水线导演、创意技术、质量检查清单和深度技术知识包,教智能体像专家一样使用每个工具
参考驱动的创作 — 粘贴你喜欢的视频,智能体将其转化为有根基的差异化制作计划,而非强迫你从零开始构思完美提示词
无需付费视频模型即可创作真实影像纪录片 — 从免费/开放影像和档案来源构建真实剪辑视频,而非仅仅 Ken Burns 效果叠加图片
内置实时网络研究 — 在写出脚本的第一个字之前,智能体会运行 15-25+ 次网络搜索,覆盖 YouTube、Reddit、新闻网站和学术来源,让你的视频扎根于真实、当前的资讯
既支持免费/本地也支持云端服务商——每项能力都配套了开源本地替代方案与高级 API。用你已有的。
无供应商锁定——可以自由切换服务商。评分选择器从 7 个维度(任务匹配度、输出质量、可控性、可靠性、成本效率、延迟、连续性)对每个服务商打分,自动匹配最优选项。
生产级质量门禁——交付承诺 enforcement 会阻止看起来像幻灯片的渲染,预合成验证在浪费 GPU 时间前捕获破损的计划,强制渲染后自检(ffprobe + 帧提取 + 音频分析)确保智能体永远不会呈现垃圾内容。每个服务商选择、风格决策和降级策略都记录在可审计的决策轨迹中。
内置预算治理——执行前估算成本、消费上限、每步审批阈值。不会有意外账单。
OpenMontage 采用智能体优先架构。没有代码编排器。你的 AI 编码助手就是编排器。
你:"做一个关于黑洞如何形成的科普视频"
|
v
智能体读取流水线清单(YAML)——阶段、工具、审查标准、成功门禁
|
v
智能体读取阶段导演技能(Markdown)——如何执行每个阶段
|
v
智能体调用 Python 工具——评分选择器从 7 个维度对每个工具排名
|
v
智能体使用审查员技能进行自检——schema 验证、 playbook 合规性、质量检查
|
v
智能体检查点保存状态(JSON)——可恢复,带决策日志和成本快照
|
v
智能体呈现以供你审批——每个创意决策你都保持控制
|
v
预合成验证门禁——交付承诺、幻灯片风险、渲染器治理
|
v
渲染(Remotion 或 FFmpeg)——匹配视觉语法的合成引擎
|
v
渲染后自检——ffprobe、帧提取、音频分析、承诺验证
|
v
最终视频输出——仅当自检通过
Python 提供工具和持久化能力。所有创意决策、编排逻辑、审查标准和质量规范都存在于可读指令文件(YAML 清单 + Markdown 技能)中,你可以检查和自定义。每个决策都记录了备选方案、置信度分数和每次选择的理由。
OpenMontage/
├── tools/ # 100+ Python 工具(智能体的手)
│ ├── video/ # 13 个视频生成工具 + 合成、拼接、裁剪
│ ├── audio/ # 4 个 TTS 提供商 + Suno/ElevenLabs 音乐、混音、增强
│ ├── graphics/ # 9 个图像/图形生成工具 + 图表、代码片段、数学公式
│ ├── enhancement/ # 超分辨率、背景去除、人脸增强、色彩调校
│ ├── analysis/ # 转录、场景检测、帧采样
│ ├── avatar/ # 说话人头、唇形同步
│ └── subtitle/ # SRT/VTT 生成
│
├── pipeline_defs/ # YAML 流水线清单(智能体的 playbook)
├── skills/ # Markdown 技能文件(智能体的知识)
│ ├── pipelines/ # 每个流水线的阶段导演技能
│ ├── creative/ # 创意技巧技能
│ ├── core/ # 核心工具技能
│ └── meta/ # 审查员、检查点协议
│
├── schemas/ # 15 个 JSON Schema(契约验证)
├── styles/ # 视觉风格 playbook(YAML)
├── remotion-composer/ # React/Remotion 视频合成引擎
├── lib/ # 核心基础设施(配置、检查点、流水线加载器)
└── tests/ # 契约测试、QA 集成测试、评估工具
三层知识架构
第一层:tools/ + pipeline_defs/ "存在什么"——可执行能力 + 编排
第二层:skills/ "如何使用"——OpenMontage 约定和质量基准
第三层:.agents/skills/ "如何运作"——外部技术知识包
每个工具声明它依赖的第三层技能。智能体读取第一层了解有哪些可用,读取第二层了解 OpenMontage 希望如何使用它们,需要深层技术知识时读取第三层。
完整设置指南(含定价和免费层级):docs/PROVIDERS.md
后期制作(始终可用,始终免费):
合成与渲染:
运行时在提案阶段选择(render_runtime)并通过编辑决策锁定。在运行时之间静默切换是治理违规——见 skills/core/hyperframes.md。
风格 playbook 定义你作品集的视觉语言:
Playbook 控制排版、配色板、运动风格、音频配置和质量规则。智能体读取 playbook 并在所有生成资产中一致应用。
平台输出配置
面向每个主要平台的内置渲染配置:
生产治理
OpenMontage 将视频制作视为真正的工程——在每个阶段都有质量门禁、审计跟踪和强制执行。
人工审批门禁是强制的而非建议——提案、脚本、场景计划、生成资产和发布都会暂停等待你签字。检查点写入器会拒绝没有记录审批的"已完成"门禁阶段,每个被取代的检查点都会被存档,因此审计跟踪(含门禁转换)在修订中得以保留。审查在 Backlot 画板上以视觉方式进行。
预合成验证——如果交付承诺被违反(例如"运动主导"视频却用了 80% 静态图片)、幻灯片风险评分严重、或渲染器家族缺失,则阻止渲染。在浪费 GPU 时间前捕获破损的计划。
渲染后自检——每次渲染后,运行时运行 ffprobe 验证,在 4 个位置提取帧以检查黑帧和破损叠加层,分析音频电平是否有静音和削波,验证交付承诺是否得到遵守,并检查字幕是否存在。如果审查失败,视频不会呈现。
幻灯片风险评分——6 维度分析(重复性、装饰性视觉、弱运动、镜头意图、排版过度依赖、不支持的 cinematic 声明)防止"动态 PowerPoint"输出。
源媒体检查