以前做一条视频,脚本、配音、剪辑、字幕,每一步都要单独学习,光是入门就足以让人放弃。现在,这些工作可以直接交给 Codex。
你只需要给它一篇文章,或者一个明确的主题,再把对应的视频 Skills 交给它,Codex 就可以继续完成口播、声音、时间轴、分镜、字幕、动效和成片。你不需要先学会剪辑,也不需要看懂代码,只要能把自己想要的视频说清楚,就可以开始。
这篇文章就把整套流程从头跑一遍:先做一条不出镜的文章视频,再介绍真人口播的剪辑方法。第一次接触视频,也可以照着跑出自己的第一版。
整个流程可以简单理解为:
文章或主题 → 口播稿 → 配音 → 时间轴 → 分镜 → HyperFrames → 检查成片
先把视频 Skills 交给 Codex
Skill 可以理解成一份给 Codex 看的工作说明书。它告诉 Codex,遇到口播、配音、分镜或者剪辑任务时,应该调用什么工具、按照什么顺序完成,以及最后检查哪些问题。
安装时不需要自己研究一堆命令。直接把对应的 GitHub 仓库链接交给 Codex,让它先阅读项目说明,再完成安装和环境检查即可。
这套流程里,HyperFrames 已经提供了几种不同的分工:/faceless-explainer 负责把文章或主题整理成不出镜讲解,/hyperframes-creative 负责口播节奏和分镜,/media-use 管理图片、声音和字幕,/hyperframes-animation 负责画面变化。通常你只需要告诉 Codex“使用 /hyperframes 做这条视频”,它就可以继续选择需要的部分。
如果需要额外的视觉风格,也可以再加入其他 Skills。比如想做拼贴式知识视频,可以参考 HyperFrames Community Skills 里的 vox-explainer;想做手写或绘制出现的效果,可以使用 p5-paint-animation;想做产品介绍、界面演示和宣传片,可以参考 video-shotcraft。
这些都是扩展项,第一条视频不用全部安装。
新建一个文件夹,例如 codex-video,在 Codex 里打开它。把文章、图片以及后面生成的音频都放进去,再把 HyperFrames 的仓库交给 Codex,让它完成准备工作。接下来,你只需要一步一步确认结果。
第一步:把文章或主题变成口播稿
口播稿是整条视频的骨架。画面再漂亮,如果开头没有抓住人,后面的内容也很难被看完。
如果你只有一个主题,可以直接让 Codex 写。例如:
我要做一条 60 秒竖版视频,主题是“第一次用 Codex 做视频”。
观众只会使用 Codex,没有写过口播稿,也没有剪过视频。
开头先告诉他最终能做出什么,再讲清楚:生成口播、选择声音、用 HyperFrames 做画面、检查成片。
每句话尽量能直接念出来,不写书面化小标题,不堆概念。
结尾让他先用一个主题跑通第一条视频。
现在只交付口播稿,暂时不要做分镜和视频。
主题越具体,口播越容易写。与其说“做 AI 视频”,不如直接限定成“把一篇工具测评做成 60 秒竖版讲解”,这样 Codex 才知道哪些内容应该留下。
如果已经有文章,就把文章保存成 article.md,然后让 Codex 改成适合说出口的版本:
请读取 article.md,把它改成一条 90 秒口播稿。
保留文章的核心判断和最有用的案例,不要逐段缩写全文。
开头先说读者能得到什么,中间只保留三步方法,每一步都用能听懂的句子讲。
文章里的链接、脚注和排版符号不要读出来。
请把最后需要我核对的事实单独列出来。
先只生成 narration.md。
如果文章存在明显的翻译腔、机械排比或者过于书面的句子,可以把 humanizer-zh 交给 Codex,让它在不改变事实和个人判断的情况下进一步调整。
不过改完以后最好自己读一遍。很多文字看起来没有问题,但真正念出来时,嘴巴会告诉你哪里不自然。
如果你只有素材,还没有想好口播和画面,也可以直接从 HyperFrames 的 /faceless-explainer 开始,让它根据主题、文章或者笔记整理讲解方向、旁白和分镜。
无论选择哪种方式,口播最好遵循一个简单结构:
钩子 → 问题 → 方法 → 下一步
比如这篇教程的开头可以直接说:
“装好 Codex 不知道干什么?你可以先用它做一条视频。给它一篇文章,它能继续处理口播、声音、字幕和画面。今天先跑通最短的一条流程。”
第二步:确定最终声音
口播定稿以后,再决定由谁来念。
第一次做视频,普通 TTS 已经足够。你可以使用已有的文字转语音功能,也可以把开源的 edge-tts 交给 Codex,让它完成安装、选择中文声音并生成音频和字幕。
建议先生成十几秒测试音频,确认声音、语速和停顿,再生成全文。普通 TTS 的优势就是快,特别适合先验证内容和画面流程。
如果以后想长期使用自己的声音,可以考虑 CosyVoice。它可以根据一段参考录音生成具有相近说话人特征的新口播。
这里需要准备三个文件:
reference.wav:本人或已经获得授权的参考录音;reference.txt:参考录音实际说出的完整文字;narration.md:这次视频的新口播。
参考文本必须和录音完全对应。录音也尽量保持安静、清晰、自然,背景音乐、回声和很重的降噪都会影响效果。
安装 CosyVoice 时,直接把官方仓库交给 Codex:
请帮我安装 CosyVoice:
https://github.com/QwenAudio/CosyVoice
请先阅读官方 README,再检查当前电脑环境并完成安装。
安装好后只生成一条短测试音频,不要直接生成整篇口播。
安装完成后先听测试音频。正式生成时,也不要一次把整篇文章全部塞进去,而是按语义拆成几段,每段先试听,确认专有名词、英文和数字的读法,再合成最终音频。
如果暂时不需要复刻声音,可以直接跳过 CosyVoice。后面的 HyperFrames 只需要最终音频,不关心声音来自哪一种 TTS。
第三步:让画面跟着最终声音走
现在应该已经有两个核心文件:narration.md 和 final.wav。
从这一刻开始,final.wav 才是视频真正的时间尺。
先根据最终音频建立时间轴,再生成字幕。口播稿决定字幕写什么,音频转写决定字幕什么时候出现。
不要按照字数平均分配时间。同样是十个字,有的半秒就能说完,有的中间可能停两次,所以字幕、关键词和镜头都应该跟着真实声音走。
可以直接告诉 Codex:
请以 final.wav 为准建立时间轴。
用 narration.md 核对字幕文字,用音频转写结果取得每句话的真实开始和结束时间。
输出 captions.srt 和 timing.json。
如果口播稿与实际声音不一致,请列出差异,不要自行猜测。
这样做的好处是,后面即使修改画面,也不会因为重新估算时间而反复返工。
第四步:根据口播制作分镜
分镜其实不用学太多专业术语。把口播切成 4~8 段,每段只回答一个问题:
观众听到这句话的时候,画面上最应该看到什么?
文章里已经存在的截图、照片、图表或者角色卡,优先使用。先让观众看清整体,再放大正在讲的部分。没有素材的地方,可以用关键词、步骤卡、对比、时间线和简单信息图补充。
让 Codex 根据口播和时间轴生成分镜:
请根据 narration.md、timing.json 和 assets 文件夹制作分镜表。
每个镜头写清楚:
对应口播、开始时间、结束时间、主要画面、需要的素材、字幕位置。
原文已有图片必须安排实际展示;
缺少素材的地方先标记,不要用无关图片填满。
如果不知道动效应该怎么做,可以参考 HyperFrames Launches 里的完整项目,或者使用 video-shotcraft 里的镜头配方。
第一条视频不要追求每秒都有复杂动画。先把信息讲清楚,再用一两个简单动效增强节奏。
第五步:让 HyperFrames 做出第一版
现在已经有了口播、最终声音、字幕时间和分镜,可以正式交给 HyperFrames:
使用 /hyperframes,把当前项目做成一条 9:16 竖版讲解视频。
请读取 narration.md、final.wav、captions.srt、timing.json、storyboard.md 和 assets 文件夹。
画面跟随真实音频时间,字幕不要挡住主要内容。
优先使用 assets 里的原图和角色卡,缺少素材的镜头用简洁的信息图。
先完成前 15 秒样片并打开预览,我确认方向后再继续全片。
这里特别建议先做 15 秒样片,不要直接渲染整条视频。
看这 15 秒,重点检查三个问题:开头够不够快,字幕是否清楚,画面有没有真正解释口播。
如果方向正确,再继续生成全片。
之后修改时,也不要只说“高级一点”“好看一点”。最好告诉 Codex 具体位置,例如:
“第 6 秒的标题太小。”
“这张截图至少停留 3 秒。”
“字幕挡住了人物。”
“第一个镜头进入太慢。”
这种反馈会比抽象的审美要求更容易执行。
最终确认以后,再让 Codex 渲染:
把当前确认的版本渲染成 final.mp4。
完成后检查文件能否正常播放,并检查声音、字幕和画面是否完整。
预览页面能打开,只能说明项目可以运行。真正完成的标准是 final.mp4 已经生成,并且你从头到尾看过一遍,确认声音没有截断、字幕没有错位、图片没有被错误裁切。
HyperFrames 和 Remotion 怎么选?
两者都可以把文字、声音、图片和时间轴做成视频,但适合的工作方式不同。
HyperFrames 更像是根据这一期内容重新组织画面,适合快速做文章视频、知识视频和解释型内容。
Remotion 更适合先做一套固定栏目模板,然后每一期往固定位置填内容。
如果想走 Remotion 路线,可以把 Remotion Agent Skills 交给 Codex,让它完成安装,然后使用 /remotion-create 创建视频、/remotion-studio 预览、/remotion-render 渲染。
上游生成的 narration.md、final.wav、字幕、时间轴和图片都可以继续使用,不需要重新做一遍。
我的建议是:第一条先用 HyperFrames 跑通。连续做了几期以后,如果发现镜头结构已经稳定,再让 Codex 把它整理成 Remotion 的固定栏目。
如果你拍了真人口播,再加入 video-use
前面的流程完全可以不出镜。等你开始拍真人口播时,可以把 narration.md 放在相机旁边,按段拍摄。说错了就停一下,从这句话重新说,不需要每次从头开始。
video-use 更适合处理已经拍好的真人素材。它可以先转写视频,找出每段说了什么,再整理重复、停顿、说错和重新开始的部分,最后再进入剪辑。
安装时直接让 Codex 阅读仓库:
请帮我安装 https://github.com/browser-use/video-use。
先阅读 install.md,完成依赖、FFmpeg 和 Codex Skill 注册。
安装后先不要转写任何视频,等我把素材放进文件夹。
拍摄完成后,把原视频放进单独的素材文件夹:
请使用 video-use 处理这个文件夹里的真人口播。
先盘点素材并转写,找出重复、停顿、说错和重新开始的位置。
先给我一份剪辑方案,列出准备保留和删除的片段;我确认后再剪。
定稿后添加中文字幕,并在讲到步骤时使用 assets 里的对应图片补充画面。
最后输出预览版,检查无误后再输出 final.mp4。
这样,真人口播的流程就是:
口播稿 → 真人拍摄 → video-use 整理有效片段 → 字幕和补充画面 → 成片
HyperFrames 和 video-use 也可以组合起来:video-use 负责把真人口播剪顺,HyperFrames 再负责标题、步骤卡、截图演示、片头片尾等信息画面。
最后,把一条视频变成一套内容系统
真正有价值的并不是用 Codex 做出一条视频,而是让同一套流程可以持续生产。
比如你可以固定做一个主题:每周拆一个 AI 工具、每次解决一个办公问题,或者每期解释一个行业案例。内容对象越明确,后面越容易形成固定结构。
整个循环其实很简单:
目标用户的问题 → 选择具体主题 → 写口播 → 做视频 → 看评论和完播反馈 → 决定下一条
获客的钩子也应该落在具体结果上。
“我用 AI 做了一条视频”,只能证明你会使用工具。
“我把一篇 3000 字的工具测评,做成一条 60 秒的新手教程”,才会让真正需要这件事的人停下来。
所以第一阶段不要急着搭一套复杂的自动化系统。先选一个你能够连续讲十期的主题,用 Codex 跑通第一条:
口播定稿 → 声音生成 → 时间轴对齐 → 分镜 → HyperFrames 出片 → 检查成片
第二条开始复用文件结构,第三条开始保留固定片头、字幕样式和镜头结构。
做到这一步,Codex 才真正从“帮你做过一条视频”,变成一个可以持续帮你生产内容的工作流。