<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>Ai - 标签 - Simon's Blog</title><link>https://blog.leeissonba.com/tags/ai/</link><description>Ai - 标签 - Simon's Blog</description><generator>Hugo -- gohugo.io</generator><language>zh-CN</language><managingEditor>leeissonba@gmail.com (Simon)</managingEditor><webMaster>leeissonba@gmail.com (Simon)</webMaster><copyright>Simon</copyright><lastBuildDate>Sun, 12 Jul 2026 22:45:00 +0800</lastBuildDate><atom:link href="https://blog.leeissonba.com/tags/ai/" rel="self" type="application/rss+xml"/><item><title>AI 在视频生成和智能剪辑方向的应用调研</title><link>https://blog.leeissonba.com/ai-video-generation-editing-survey/</link><pubDate>Sun, 12 Jul 2026 22:45:00 +0800</pubDate><author>leeissonba@gmail.com (Simon)</author><guid>https://blog.leeissonba.com/ai-video-generation-editing-survey/</guid><description><![CDATA[<div class="featured-image">
                <img src="https://blog.leeissonba.com/images/posts/ai-video-generation-editing-survey/featured.jpg" alt="AI 在视频生成和智能剪辑方向的应用调研" referrerpolicy="no-referrer">
            </div><p>最近对 AI 在视频生成和智能剪辑方向做了一些研究，这篇文章进行一下相关记录。</p>
<p>主要了解了一下这些开源的工具/技术：video-use、OpenMontage、Remotion、dots.tts、HyperFrames。这些分别是什么呢：</p>
<table>
	<thead>
			<tr>
					<th>工具</th>
					<th>描述</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>video-use</td>
					<td>用 AI coding agent 精剪已有素材（转写 → 切点 → 调色/字幕/叠加 → 成片）的开源工作流。</td>
			</tr>
			<tr>
					<td>OpenMontage</td>
					<td>把 coding agent 变成整间视频制片厂，从调研、脚本、配音到合成的端到端生产系统。</td>
			</tr>
			<tr>
					<td>Remotion</td>
					<td>用 React 写可编程视频，按帧渲染成 MP4 的开源框架。</td>
			</tr>
			<tr>
					<td>dots.tts</td>
					<td>小红书开源的本地 TTS 模型，用文字（可加参考音）生成高质量语音。</td>
			</tr>
			<tr>
					<td>HyperFrames</td>
					<td>用 HTML/CSS/GSAP 写浏览器动画构图，再确定性抓帧渲染成视频的工具。</td>
			</tr>
	</tbody>
</table>
<h2 id="video-use">Video-USE</h2>
<blockquote>
<p><a href="https://github.com/browser-use/video-use" target="_blank" rel="noopener noreffer ">https://github.com/browser-use/video-use</a></p>
</blockquote>
<h3 id="安装">安装</h3>
<p>安装依赖相对来说比较简单，当然你也可以通过提示词直接让你的 agent 安装它。</p>
<div class="code-block code-line-numbers open" style="counter-reset: code-block 0">
    <div class="code-header language-text">
        <span class="code-title"><i class="arrow fas fa-angle-right" aria-hidden="true"></i></span>
        <span class="ellipses"><i class="fas fa-ellipsis-h" aria-hidden="true"></i></span>
        <span class="copy" title="复制到剪贴板"><i class="far fa-copy" aria-hidden="true"></i></span>
    </div><div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">Set up https://github.com/browser-use/video-use for me.
</span></span><span class="line"><span class="cl">
</span></span><span class="line"><span class="cl">Read install.md first to install this repo, wire up ffmpeg,
</span></span><span class="line"><span class="cl">register the skill with whichever agent you&#39;re running under,
</span></span><span class="line"><span class="cl">and set up the ElevenLabs API key — ask me to paste it when you need it.
</span></span><span class="line"><span class="cl">Then read SKILL.md for daily usage, and always read helpers/
</span></span><span class="line"><span class="cl">because that&#39;s where the editing scripts live.
</span></span><span class="line"><span class="cl">After install, don&#39;t transcribe anything on your own —
</span></span><span class="line"><span class="cl">just tell me it&#39;s ready and wait for me to drop footage into a folder.</span></span></code></pre></div></div>
<p>手动安装：</p>
<div class="code-block code-line-numbers open" style="counter-reset: code-block 0">
    <div class="code-header language-bash">
        <span class="code-title"><i class="arrow fas fa-angle-right" aria-hidden="true"></i></span>
        <span class="ellipses"><i class="fas fa-ellipsis-h" aria-hidden="true"></i></span>
        <span class="copy" title="复制到剪贴板"><i class="far fa-copy" aria-hidden="true"></i></span>
    </div><div class="highlight"><pre tabindex="0" class="chroma"><code class="language-bash" data-lang="bash"><span class="line"><span class="cl"><span class="c1"># 1. Clone and symlink into your agent&#39;s skills directory</span>
</span></span><span class="line"><span class="cl">git clone https://github.com/browser-use/video-use ~/Developer/video-use
</span></span><span class="line"><span class="cl">ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        <span class="c1"># Claude Code</span>
</span></span><span class="line"><span class="cl"><span class="c1"># ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex</span>
</span></span><span class="line"><span class="cl">
</span></span><span class="line"><span class="cl"><span class="c1"># 2. Install deps</span>
</span></span><span class="line"><span class="cl"><span class="nb">cd</span> ~/Developer/video-use
</span></span><span class="line"><span class="cl">uv sync                         <span class="c1"># or: pip install -e .</span>
</span></span><span class="line"><span class="cl">brew install ffmpeg             <span class="c1"># required</span>
</span></span><span class="line"><span class="cl">brew install yt-dlp             <span class="c1"># optional, for downloading online sources</span>
</span></span><span class="line"><span class="cl">
</span></span><span class="line"><span class="cl"><span class="c1"># 3. Add your ElevenLabs API key</span>
</span></span><span class="line"><span class="cl">cp .env.example .env
</span></span><span class="line"><span class="cl"><span class="nv">$EDITOR</span> .env                    <span class="c1"># ELEVENLABS_API_KEY=...</span></span></span></code></pre></div></div>
<p>其整体目录结构如下：</p>
<p><img src="https://blog.leeissonba.com/images/posts/ai-video-generation-editing-survey/image-20260712215207727.png" alt="" referrerpolicy="no-referrer"></p>
<h3 id="初尝试">初尝试</h3>
<p>它的工作原理主要是以音频为主（口播类），通过识别音频转成文字，模型去分析文本，写脚本，渲染，生成交付。当然，这是个 SKILL，你可以和 vibe-coding 一样，交互式地去控制整个剪辑的节奏和方向。试用下来还是很有感觉的。</p>
<p>我使用了 cc-switch 来管理 SKILL，AGENT 使用的 Cursor（当然任意 agent 都可以）。</p>
<p><img src="https://blog.leeissonba.com/images/posts/ai-video-generation-editing-survey/image-20260712215338858.png" alt="" referrerpolicy="no-referrer"></p>
<p>这是一个 8 分钟左右的口播原素材，以下是其分析的结果。它会分析出来整体口播的内容并将其内容结构分析出来，然后一些口误/重复/啰嗦的部分会标注出来，便于后续剪辑。底层调用的 ffmpeg 来实现，音频转录用的 ElevenLabs。</p>
<p><img src="https://blog.leeissonba.com/images/posts/ai-video-generation-editing-survey/image-20260712215633323.png" alt="" referrerpolicy="no-referrer"></p>
<p>提供剪辑策略，并询问你的建议。</p>
<p><img src="https://blog.leeissonba.com/images/posts/ai-video-generation-editing-survey/image-20260712220120985.png" alt="" referrerpolicy="no-referrer"></p>
<p>edit 里就是它操作过程中产生的文件，包括文字动画、分段、脚本、验证及成片等。</p>
<p><img src="https://blog.leeissonba.com/images/posts/ai-video-generation-editing-survey/image-20260712220242553.png" alt="" referrerpolicy="no-referrer"></p>
<p>这是 project.md 的内容，它的作用是记录下来你们的对话过程，便于你下次继续该工程。</p>
<div class="code-block code-line-numbers open" style="counter-reset: code-block 0">
    <div class="code-header language-markdown">
        <span class="code-title"><i class="arrow fas fa-angle-right" aria-hidden="true"></i></span>
        <span class="ellipses"><i class="fas fa-ellipsis-h" aria-hidden="true"></i></span>
        <span class="copy" title="复制到剪贴板"><i class="far fa-copy" aria-hidden="true"></i></span>
    </div><div class="highlight"><pre tabindex="0" class="chroma"><code class="language-markdown" data-lang="markdown"><span class="line"><span class="cl">Session 1 — 2026-07-11
</span></span><span class="line"><span class="cl">
</span></span><span class="line"><span class="cl">Strategy: 将 8分34秒竖屏口播素材压缩为 3 分钟以内的柬埔寨摆地摊分析视频。结构：开场设问 → 政策风险（2019法令+打车平台案例）→ 机会（信息差）→ 建议（选品/长期主义）→ 收尾（旅游签探市场+平价主义）。跳切去除口误和重复，保留打车平台被下架的核心案例。
</span></span><span class="line"><span class="cl">
</span></span><span class="line"><span class="cl">Decisions:
</span></span><span class="line"><span class="cl">
</span></span><span class="line"><span class="cl">16 段 EDL，总时长 2:58（178.3s）
</span></span><span class="line"><span class="cl">调色 neutral_punch，无字幕，无动画
</span></span><span class="line"><span class="cl">跳过重复口误段（打车平台操作重复、赋能段重复、长段啰嗦）
</span></span><span class="line"><span class="cl">输出 preview.mp4（1080×1920，24fps，-14 LUFS）
</span></span><span class="line"><span class="cl">Reasoning log:
</span></span><span class="line"><span class="cl">
</span></span><span class="line"><span class="cl">打车案例保留 RIDE1-3 连贯叙事，删 RIDE2 中「好几万嘟嘟车」冗余
</span></span><span class="line"><span class="cl">ADV3/ADV4 赋能段与 CLOSE 风土人情段为控时长暂删，保留 ADV1+ADV2 核心建议
</span></span><span class="line"><span class="cl">词边界 + 50/80ms padding，30ms 音频淡入淡出
</span></span><span class="line"><span class="cl">Session 1 — 2026-07-11 (update)
</span></span><span class="line"><span class="cl">
</span></span><span class="line"><span class="cl">Added: 中文字幕（126条 ASS，Heiti SC，底部安全区）、6 个话题动画卡片（橙金配色，顶部弹出）。输出 final.mp4。
</span></span><span class="line"><span class="cl">
</span></span><span class="line"><span class="cl">Outstanding: 如需更多动画或调整卡片样式/时间点，反馈即可。
</span></span><span class="line"><span class="cl">
</span></span><span class="line"><span class="cl">Session 2 — 2026-07-11
</span></span><span class="line"><span class="cl">
</span></span><span class="line"><span class="cl">Strategy: 从零合成 Hugo + LoveIt + Wrangler CLI 教程视频（3 分钟紧凑版）。终端动画展示各步骤命令，ElevenLabs 男声（Daniel）旁白，键盘/whoosh/成功音效，PIL 字幕 overlay 烧录（本机 ffmpeg 无 libass）。
</span></span><span class="line"><span class="cl">
</span></span><span class="line"><span class="cl">Decisions:
</span></span><span class="line"><span class="cl">
</span></span><span class="line"><span class="cl">7 段结构：开场 → 安装/建站 → LoveIt 主题 → 写文章 → 本地预览 → Wrangler 部署 → 收尾
</span></span><span class="line"><span class="cl">1920×1080<span class="ni">@24fps</span>，Catppuccin 终端配色，Menlo 等宽字体
</span></span><span class="line"><span class="cl">总时长 1:50（110s），紧凑节奏
</span></span><span class="line"><span class="cl">输出 edit/hugo-tutorial/final.mp4
</span></span><span class="line"><span class="cl">Reasoning log:
</span></span><span class="line"><span class="cl">
</span></span><span class="line"><span class="cl">amix duration=longest 修复 whoosh 段被截断至 0.33s 的问题
</span></span><span class="line"><span class="cl">PIL RGBA overlay 替代 subtitles filter（ffmpeg 未编译 libass）
</span></span><span class="line"><span class="cl">Outstanding: 如需延长至满 3 分钟或替换为真实录屏，反馈即可。</span></span></code></pre></div></div>
<h3 id="总结">总结</h3>
<p>看完成片，确实效果不错。处理一些简单的剪辑工作（粗剪），我觉得是够了。视频就不便于展示了，有兴趣可以自行尝试。这个工具主要是消耗 token（看你接的是什么 LLM，实测 DeepSeek V4 也可用，简单测试一次消耗大概一两块吧）和 ElevenLabs 的 API 点数。注册 ElevenLabs 初用户是有 10000 点数，这一次剪辑用掉了大概 500 左右。</p>
<h2 id="openmontage">OpenMontage</h2>
<blockquote>
<p><a href="https://github.com/calesthio/OpenMontage" target="_blank" rel="noopener noreffer ">https://github.com/calesthio/OpenMontage</a></p>
</blockquote>
<p>安装过程就先不写了，测试下来还是蛮有意思。它会在本地开启一个 web 服务，给你展示看板任务，让你知道它实时进展。</p>
<p>我这里给它下发的任务是，“制作一个 60 秒的动画科普视频，解释台风天气是如何形成的”，下图是它提供的任务看板，还是挺炫酷的。</p>
<p><img src="https://blog.leeissonba.com/images/posts/ai-video-generation-editing-survey/screenshot-2026-07-12-173854.png" alt="" referrerpolicy="no-referrer"></p>
<p>文本生成音频，调用的本地的小红书开源的 TTS 模型 dots.tts，https://huggingface.co/spaces/rednote-hilab/dots.tts，这里可以试用。也就是把脚本里写的分镜里的文本转成音频合成到视频里。</p>
<p><img src="https://blog.leeissonba.com/images/posts/ai-video-generation-editing-survey/screenshot-2026-07-12-174023.png" alt="" referrerpolicy="no-referrer"></p>
<p>它最后会在 projects 目录下生成当前的工程目录，生成的成片在 exports 下。</p>
<p><img src="https://blog.leeissonba.com/images/posts/ai-video-generation-editing-survey/image-20260712222748939.png" alt="" referrerpolicy="no-referrer"></p>
<p>我们来看一下成片：</p>
<p><video controls playsinline preload="metadata" src="https://blog.leeissonba.com/videos/posts/ai-video-generation-editing-survey/typhoon-formation-explainer.mp4"></video></p>
<h3 id="总结-1">总结</h3>
<p>做出来的效果一般，一眼就可以看出来是 AI 流水线出来的产物。不过应付一些简单的需求也是够了。不过，我也只是简单测试一下，没有在提示词上进行调优，后续再深入使用一下吧。</p>]]></description></item></channel></rss>