把一堆口误、停顿和重复拍摄的素材丢进文件夹,再用一句话让AI剪成成片——开源项目 video-use 想把这件事交给 Claude Code、Codex 等编码Agent完成。它会先提出剪辑方案,获准后调用 FFmpeg——一套可用命令完成剪切、调色、混音和字幕处理的工具——最终输出 MP4。项目一天新增320星,说明创作工具链的Agent化正在迅速吸引注意。
最值得看的设计是:Agent并不逐帧“观看”视频,而是先“阅读”素材。video-use 用 ElevenLabs Scribe 生成带单词时间码、说话人和笑声等事件的文字稿;遇到停顿是否该删、两次重拍该选哪段等疑难位置,才按需查看带画面缩略图、波形和文字标签的时间线图片。项目方估算,逐帧处理3万帧约需4500万 tokens(模型处理信息的计量单位),而这套方法只需约12KB文字和少量图片。Agent据此生成剪辑决策,再渲染、自检切口,发现问题便重新处理,最多三轮。至于不同素材上的实际成片质量,现有材料没有提供独立评测。