通过 AI 编码 agent 实现视频自动剪辑,去除语气词、自动调色、烧录字幕、生成动画覆盖层,全程在本地由 Claude Code 驱动。

介绍 video-use —— 用 Claude Code 编辑视频。100% 开源。
把原始素材丢进一个文件夹,和 Claude Code 聊天,就能拿回 final.mp4。适用于任何内容——口播、混剪、教程、旅行、访谈——无需预设、无需菜单。
在 Browser Use Cloud 试用 video-use。
自动切除填充词(嗯、啊、重复起头)和镜头之间的无效空白
自动为每个片段调色(暖色电影感、中性高反差,或任意自定义 ffmpeg 调色链)
每个剪辑点 30ms 音频淡入淡出,彻底消除爆音
按你的风格烧字幕——默认 2 词大写块,完全可自定义
通过 HyperFrames、Remotion、Manim 或 PIL 生成动画叠加层——在并行子 agent 中生成,每个动画一个独立进程
在向你展示任何内容之前,对每个剪辑边界处的渲染输出进行自我评估
在 project.md 中持久化会话记忆,下次继续时从上次断点开始
粘贴到 Claude Code、Codex、Hermes、Openclaw 或任何有 shell 访问权限的 agent:
Set up https://github.com/browser-use/video-use for me.
Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.
Agent 会处理克隆、依赖安装、skill 注册,并提示你输入一次 ElevenLabs API key(在 elevenlabs.io/app/settings/api-keys 获取)。
然后让 agent 指向原始素材文件夹:
cd /path/to/your/videos
claude # or codex, hermes, etc.
如果你想从自己的 VPS 或 Telegram 长期运行编辑能力,可以通过 Browser Use Box 运行 agent。看 15 秒演示。
把这些素材剪成一条发布视频
它清点素材来源、提出剪辑策略、等待你确认,然后在与源文件同目录下生成 edit/final.mp4。所有输出都放在 <videos_dir>/edit/——skill 目录保持整洁。
如果你想手动操作:
# 1. Clone and symlink into your agent's skills directory
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. Install deps
cd ~/Developer/video-use
uv sync # or: pip install -e .
brew install ffmpeg # required
brew install yt-dlp # optional, for downloading online sources
# 3. Add your ElevenLabs API key
cp .env.example .env
$EDITOR .env # ELEVENLABS_API_KEY=...
LLM 从不看视频。它读视频——通过两层机制,共同赋予它以单词边界精度进行剪辑所需的一切。
第一层——音频转录(始终加载)。每个源文件调用一次 ElevenLabs Scribe,获得单词级时间戳、说话人分离和音频事件((笑声)、(掌声)、(叹息))。所有素材打包成一份约 12KB 的 takes_packed.md——这是 LLM 的主要阅读视图。
## C0103 (duration: 43.0s, 8 phrases)
[002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
[006.08-006.74] S0 We fixed this.
第二层——视觉合成(按需加载)。timeline_view 为任意时间范围生成胶片条 + 波形图 + 单词标签 PNG。只在决策点调用——模糊的停顿、重拍对比、剪辑点合理性检查。
朴素方案:30,000 帧 × 1,500 tokens = 45M tokens 噪音。Video Use:12KB 文本 + 几张 PNG。
这和 browser-use 让 LLM 读取结构化 DOM 而不是截图是同一套思路——只是换成了视频。
Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
│
└─ issue? fix + re-render (max 3)
自我评估循环在每个剪辑边界处对渲染输出运行 timeline_view——捕捉视觉跳帧、音频爆音、隐藏字幕。只有通过评估后,你才会看到预览。
文本 + 按需视觉。无帧转储。转录稿即界面。
音频为主,视觉为辅。剪辑点来自语音边界和静音间隙。
提问 → 确认 → 执行 → 自我评估 → 持久化。未经策略审批,绝不触碰剪辑。
对内容类型零假设。先观察,再提问,然后编辑。
12 条硬规则,艺术自由在其他地方。制作正确性不可妥协。品味则不然。
参见 SKILL.md 获取完整制作规则和剪辑技巧。