这个项目做什么的?网页链接▁▁▁▁▁▁▁▁▁video-use 是一个开源项目,用来让 AI 编程代理(coding agents) 通过对话方式编辑视频。
◆ 一句话概括
把一堆原始素材扔进文件夹,然后跟 Claude Code、Codex 等 AI 代理聊天说“帮我剪成一个发布视频”,它就会自动帮你剪辑,最后输出 final.mp4。
◆ 主要能做什么
• 自动剪掉语气词(umm、uh)、假起头、多余静音• 自动给每个片段调色(电影感暖色、中性对比等,或自定义 ffmpeg 滤镜)• 每个剪辑点加 30ms 音频淡入淡出,避免爆音• 自动烧录字幕(默认 2 词一组大写,可自定义风格)• 生成动画叠加层(支持 HyperFrames、Remotion、Manim、PIL 等,用子代理并行生成)• 渲染后自我检查每个剪辑点(视觉跳跃、音频爆音、字幕遮挡等),有问题会自动重剪(最多 3 次)• 会话记忆会保存在 project.md 里,下次接着上次的进度继续
适用内容:talking head、蒙太奇、教程、旅行、访谈等,不依赖预设模板。
◆ 工作原理(核心思路很聪明)
AI 并不真正“看”视频,而是:
1. 用 ElevenLabs Scribe 把音频转成带时间戳、说话人、事件标注的文字稿(压缩成很小的 takes_packed.md)2. 需要时再按需生成时间线缩略图 + 波形图3. 基于文字稿做剪辑决策 → 生成 EDL → 用 ffmpeg 渲染 → 自我评估
这和他们另一个项目 browser-use(让 AI 通过结构化 DOM 而不是截图来操作浏览器)思路一致:用更高效的表示方式,而不是把海量原始帧塞给模型。
◆ 使用方式
它设计成 skill,挂在 Claude Code / Codex 等支持 shell 的代理上。安装后,进入素材文件夹,直接跟代理说话就行。
需要:
• ffmpeg(必须)• ElevenLabs API key(用于转录,音频会发到 ElevenLabs,视频本身留在本地)
项目目前约 2.2 万 stars,MIT 协议,来自 browser-use 团队。
简单说:这是一个“用自然语言指挥 AI 帮你剪视频”的工具,而不是传统视频编辑软件。