browser-use 团队最近开源的 video-use,已经冲到 1.6 万+ Star,而且还是免费的。
它最有意思的地方,是不让模型反复看视频画面。
先用 ElevenLabs Scribe 把视频解析成带时间戳的文本,让模型直接在“文字时间线”上完成剪辑。
几个细节挺狠👇
① 切点自动处理淡音
每个剪辑点补 30ms 淡化,减少突兀的爆音。
② 复杂效果交给专门工具
需要动画就调用 Manim / Remotion,不让一个 Agent 什么都干。
③ 渲染后自动验片
发现问题自己回炉,最多连续修 3 次。
核心思路其实很简单:
把视频变成模型更容易处理的“文本骨架”,再让 Agent 动手剪。
所以它不只是“让 Codex 会剪视频”,更像是在换一种 AI 剪辑的工作方式。
现在连视频都能交给 Agent 了,你还在手动拖时间轴?
#howto入门codex #howto实现一万种vibecoding #howto入门vibecoding #ai #AI工具 #大模型 #codex #howto用好AI #人工智能 #科技
