别再怀疑用Codex剪视频的可靠性了,这玩法最近确实火出圈。 browser-use团队刚开源的video-use,免费且已斩获16.5k star。 亲测后反馈,这工具还省Token,确实有点门道。 它不让大模型死盯画面,而是先用ElevenLabs Scribe把视频压缩成一份12KB的时间戳文本,像改Word文档一样在文字层动刀。 拆解下特点: 1️⃣ 每个切口自动补30ms音频淡化,咔哒爆音直接抹平 2️⃣ 要特效就派子任务跑…

browser-use 团队开源了 AI 视频剪辑工具 video-use,通过将视频先转为带时间戳的文本再编辑,大幅降低 Token 消耗。这个思路正在改变 AI 视频剪辑的底层逻辑,已获 16.5k star。

一句话看懂:browser-use 团队开源了 AI 视频剪辑工具 video-use,通过将视频先转为带时间戳的文本再编辑,大幅降低 Token 消耗。这个思路正在改变 AI 视频剪辑的底层逻辑,已获 16.5k star。

事件核心:发生了什么

近期,browser-use 团队正式开源了视频剪辑工具 video-use,项目上线后迅速在开发者社区发酵,目前已在 GitHub 上收获 16.5k star,完全免费。该工具的核心亮点在于改变了传统 AI 剪辑“让大模型盯着画面处理”的高成本路径——它先调用 ElevenLabs Scribe 将视频内容压缩成一份约 12KB 的带时间戳文本文件,让大模型像编辑 Word 文档一样在文字层进行剪辑操作,而不是逐帧分析视频流。

从已公开的实测反馈来看,video-use 在细节处理上做了针对性优化:每个剪切点自动填充 30ms 音频淡化,能有效消除常见的咔哒爆音;需要特效时,系统会派出子任务调用 Manim 或 Remotion 分别渲染,分工明确;渲染完成后还会自动质检,若有瑕疵会自动打回重做,最多重试 3 次。由于绕开了对视频帧的直接计算,这套流程在 Token 消耗上比传统方案节省不少,甚至被测试者认为“有点门道”。

为什么重要

这件事的意义在于,它为 AI 视频剪辑提供了一条可复用的效率路线。过去,大模型处理视频往往意味着数以千万计的 Token 烧在画面理解上,成本高且响应慢。video-use 选择把视频“降维”成文本——先语音识别转写、再在文字层完成结构编辑、最后渲染合成——本质上是用信息压缩换取了推理效率。

这一思路如果成立,可能会带动更多 AI 工具从“重画面”转向“重文本骨架”。对开源生态而言,browser-use 团队将这套方法直接公开,等于给开发者提供了一个高质量参考实现,后续可能会有大量同类工具跟进或二次开发,进而推动 AI 剪辑成本的行业性下探。

对用户/开发者/创作者的影响

对于普通创作者来说,video-use 最直观的价值是降低了 AI 剪辑的试错成本。免费开源意味着不需要为每个剪辑任务支付高额 API 费用,尤其适合处理长访谈、播客视频、课程录像等以语音为主的内容——这类素材转成文本后信息损失很小,但剪辑效率提升明显。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对于开发者,这个项目提供了一套完整的“文本层剪辑 + 子任务渲染 + 自动质检”流程参考,可以直接集成到自己的工具链中。特别是其“子任务分发”机制,让大模型不必事无巨细处理所有计算,而是把动画生成、渲染等重活拆给 Manim 或 Remotion,这种分工模式本身就有很强的复用价值。

值得关注的后续

目前公开信息显示,video-use 仍处于早期开源阶段,有几点值得继续观察:
1. 稳定性与扩展性:项目 16.5k star 的热度能否转化为持续的社区贡献,以及它对更长视频、多语言内容(尤其是中文)的支持是否达到可用水平;
2. API 成本结构:虽然文本骨架思路省 Token,但 ElevenLabs Scribe 的转写费用、以及 Manim/Remotion 渲染所依赖的计算资源,是否会成为新的成本瓶颈,需要实际测试验证;
3. 竞品跟进:主流剪辑工具(如剪映、Premiere 的 AI 功能)是否会参考这种“先转文字再剪辑”的路径,或者推出同样低 Token 消耗的替代方案,这将决定该思路能否成为行业标准。

来源:@bkdgiffug

celebrityanime
celebrityanime
文章: 21246

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注