如果让 AI 做一支产品宣传片,你可能会想到这样的流程:
给 AI 一段产品介绍 → AI 生成几个画面 → 配上音乐 → 导出视频。
但真正做过产品视频的人会发现,“能生成视频”和“能做出一支像样的产品宣传片”是两回事。
产品视频真正难的地方,不只是动画,而是如何把产品页面、镜头语言、视觉设计、节奏、声音和后期制作组织成一个完整的生产流程。
最近看到的开源项目 video-shotcraft,正是在解决这个问题。
它不是一个简单的视频生成器,而是一个面向 Claude Code、Codex 等 AI Agent 的「电影感产品视频制作技能库」:把大量成熟的镜头运动方式整理成可复用的 Shot Recipe,再配合 Remotion 实现、完整视频模板、音效素材和生产流程,让 AI Agent 不只是“写代码做动画”,而是能够按照一套相对完整的影视制作方法来完成产品视频。
截至目前,这个项目已经包含 152 张镜头配方卡、209 个动态预览、209 种运动样式,以及一套完整的可运行宣传片模板。GitHub 仓库目前已经获得超过 6200 个 Star,并拥有 500+ Fork。
一、它到底解决了什么问题?
传统的产品视频制作,大致可以拆成几个阶段:
产品理解 → 创意 → Styleframe → 分镜 → 素材采集 → 动画 → 音效 → 剪辑 → 渲染 → QA
任何一个环节做得不好,最终效果都会打折扣。
例如:
- 产品截图是假的,观众一眼就能看出来;
- 动画很炫,但没有突出产品功能;
- 镜头之间没有节奏;
- BGM 和画面没有卡点;
- SFX 乱加,声音变得廉价;
- 所有元素都在动,没有“停顿”和“呼吸”;
- 字体、颜色和产品本身的 Design System 完全不一致。
所以,真正的问题不是:
“AI 能不能生成一个动画?”
而是:
AI 能不能理解产品,并选择合适的镜头语言,把整个视频生产过程串起来?
video-shotcraft 的思路非常有意思:不要让 Agent 每次从零发明动画,而是给它一套可以检索、组合和复用的“镜头语言”。
二、把“视频制作经验”变成 Shot Recipe
video-shotcraft 最核心的设计,就是 Shot Recipe。
项目目前整理了 152 张镜头配方卡,每张卡不是简单地告诉 AI:
“做一个飞入动画。”
而是把一个镜头需要的关键信息结构化下来,包括:
- 镜头用途
- 情绪和能量
- 推荐时长
- 动画参数
- 实现方式
- 注意事项
- 已有的 Remotion Demo
- 动态预览
这其实是在做一件非常重要的事情:
把原本依赖设计师经验的“运动设计知识”,变成 Agent 可以调用的知识库。
例如,一个产品功能展示镜头可能需要:
页面出现 → 卡片飞入 → 排列 → 镜头推进 → 主体聚焦 → 信息停留
如果完全让 LLM 自己发挥,它很容易出现:
缩放 + 旋转 + 发光 + 粒子 + 弹跳 + Blur + Camera Shake……
看起来“很 AI”,但不一定高级。
而 Shot Recipe 的作用,就是告诉 Agent:
这个场景应该使用什么运动语法,以及这个运动应该怎么实现。
这和程序员调用组件库其实非常类似。
以前是:
从零写动画。
现在变成:
从镜头库选择一种运动语言 → 调整参数 → 适配产品素材。
三、为什么它选择 Remotion?
video-shotcraft 的底层视频实现采用了 Remotion。
Remotion 的核心思路,是使用 React/TypeScript 来描述视频。
这对于 AI Agent 非常重要。
传统视频软件中的很多操作是:
时间线 → 拖动 → 调参数 → 预览 → 再调整。
而对于 Coding Agent 来说,更自然的工作方式是:
读取代码 → 修改参数 → 渲染 → 检查 → 再修改。
因此,Remotion 非常适合作为 AI Agent 的视频执行层。
video-shotcraft 的 Demo 本身就是 TSX 实现,并且大量动画使用标准化的 t(normalized progress)来驱动。
于是,一个镜头可以被抽象成:
输入素材 + 动画参数 + 时间进度 → 输出画面
这就让“镜头”成为一种可编程资产。
四、最值得注意的一点:真实产品页面,而不是 AI 手搓 UI
这是我认为 video-shotcraft 最有价值的设计原则之一。
项目明确强调:
复刻既有页面必须使用真实截图。
也就是说,如果视频是在介绍一个 SaaS 产品,不应该让 AI 自己重新画一个“看起来像”的 Dashboard。
正确的做法是:
真实产品页面 → 浏览器自动化 → 高清截图 → 元素级素材 → Remotion 运镜
项目的生产流程会启动产品本地开发服务器,然后使用无头浏览器采集页面,并进一步获得页面纹理以及元素位置数据。
这样做有一个非常明显的好处:
视频里的产品,真的就是用户正在使用的那个产品。
这会极大提高产品视频的可信度。
五、2.5D:为什么产品截图也能拍出“电影感”?
如果只有一张网页截图,普通做法可能就是:
放大 → 缩小 → 左右移动。
很快就会变成 PPT。
video-shotcraft 的方法则更接近 2.5D 摄影。
可以把一个网页理解成很多不同的视觉层:
Camera
│
├── Background
│
├── Page
│ ├── Header
│ ├── Content
│ └── Cards
│
└── Foreground
然后通过:
- Camera Zoom
- Pan
- Orbit
- Perspective
- Depth
- Parallax
- Rotation
让原本平面的页面产生空间感。
例如:
镜头先看到整个页面 → 缓慢推进 → 主体区域进入视觉中心 → 周围内容产生轻微视差 → 最后停在产品核心功能上。
这时候观众看到的已经不再是“网页截图”,而更像是摄影机正在拍摄一个真实的产品空间。
六、真正的“电影感”,不是加更多特效
项目的设计原则中有一句非常值得关注:
电影感来自运镜、光影、节奏与声音的配合,而不是炫技动画。
这是很多 AI 视频容易踩的坑。
AI 很容易认为:
高级 = 更多动画。
于是:
- 每个元素都飞;
- 每个元素都发光;
- 每个文字都弹;
- 每个转场都加 Blur;
- 每个镜头都 Camera Shake。
结果往往恰恰相反。
video-shotcraft 更强调:
一个镜头只讲一个动效
例如一个镜头选择“飞入”,那么飞入就是这个镜头的主角。
而不是:
飞入 + 旋转 + 发光 + 粒子 + 弹跳 + Shake。
这种克制其实非常接近传统 Motion Design 的方法。
高级感很多时候来自“少做什么”,而不是“还能加什么”。
七、另一个关键:让画面“停下来”
AI 生成动画有一个天然倾向:
一直动。
因为对模型来说,“运动”似乎意味着“有内容”。
但专业视频恰恰需要大量 Hold。
video-shotcraft 对这一点有非常明确的规则:
- 品牌字标落定后需要至少约 1 秒 Hold;
- 批量动画结束后留出静止时间;
- 开场主体动作要给予足够时间;
- 时间线上提前预留休息帧。
原因很简单。
如果画面一直动:
观众没有时间理解信息。
真正的产品视频节奏应该是:
动作 → 落定 → 理解 → 下一动作
而不是:
动作 → 动作 → 动作 → 动作 → 动作……
所以“停顿”本身也是一种设计。
八、BGM 不只是背景音乐,而是时间轴
另一个非常有意思的部分,是 video-shotcraft 对 Beat Sync 的处理。
很多视频所谓“卡点”,实际上只是:
每隔几帧做一次动画。
这不是真正的音乐卡点。
项目的思路是先分析音乐本身,包括:
- BPM
- Phase
- Kick
- Snare
- Hi-hat
- 瞬态
然后把这些信息映射到视频时间轴。
最终,镜头时间不再简单写成:
0s
2s
4s
6s
而更接近:
beatF(1)
beatF(2)
beatF(4)
beatF(8)
这样可以让:
镜头切换、元素出现、Camera Move、Impact、SFX
真正发生在音乐的节奏节点上。
项目还提出了渲染后回测切点误差的思路,目标是将误差控制在较小的帧数范围内。
这其实说明了一件事:
视频节奏也是可以被工程化的。
九、声音设计:SFX 不是“最后随便加一下”
很多自动生成的视频会忽略声音。
实际上,同一个画面:
没有声音
和
有精准的 Impact / Riser / Sparkle / UI Click
完全是两种感觉。
video-shotcraft 甚至把 SFX 按场景和材质进行了分类。
目前项目包含 149 个 SFX,并按照:
- transition
- impact
- riser
- camera
- UI
- text
- paper
- film
- light
- data
- sci-fi
- mech
- glass
- fluid
- crowd
- counter
等类别组织。
这种分类方式很像一个设计师自己的“声音词典”。
例如:
UI 元素出现 → UI sound
纸张翻页 → paper sound
镜头冲击 → impact
光效出现 → sparkle / light
镜头推进 → riser
于是声音也成为镜头语言的一部分。
十、152 张镜头卡只是“词汇”,不是完整分镜
这是理解这个项目非常重要的一点。
Shot Recipe 并不等于完整视频。
它更像:
电影语言中的词汇。
例如:
- Fly-in
- Stack
- Orbit
- Zoom
- Flip
- Reveal
- Spotlight
- Parallax
这些是“词”。
真正的视频则是:
词 → 句子 → 段落 → 故事
所以 video-shotcraft 还提供了完整的 Production Pipeline。
它希望 Agent 先理解产品:
产品是什么?
↓
最值得展示什么?
↓
视觉方向是什么?
↓
哪些功能适合哪些镜头?
↓
完整 Storyboard
↓
素材采集
↓
动画实现
↓
声音设计
↓
渲染
↓
QA
这比单纯“让 AI 写 Remotion 代码”高了一个层级。
十一、它实际上提供了三种创作模式
项目并没有强迫所有视频走同一种流程,而是设计了三种模式。
1. Ink Press 模板
这是最适合快速出片的路线。
项目提供了一套已经验证过的完整宣传片模板:
- 36.2 秒
- 1920 × 1080
- 30fps
- 10 个镜头
- 2.5D 页面运镜
- Title Card
- 转场
- SFX
用户只需要告诉 Agent:
用 video-shotcraft 的 Ink Press 模板给我的产品做宣传片。
然后替换:
- 产品截图
- 产品文案
- Logo
- 品牌颜色
即可快速得到一支结构完整的视频。
2. 自主自由创作
如果不想使用固定模板,可以让 Agent 自己决定:
- 视频结构
- 视觉方向
- 镜头选择
- 素材处理
- 音频
- 节奏
- 最终实现
这更像:
AI 导演模式。
用户给产品和目标,Agent 自己完成整个创作链路。
3. 共同创作
如果你希望自己参与创意决策,则可以采用共同创作模式。
Agent 会在几个关键节点停下来:
产品简报 → 需求决策 → Visual Direction → Shot Mapping → Storyboard
然后由人确认。
之后:
素材采集 → Remotion 实现 → SFX → Render → QA
则交给 Agent 执行。
这实际上解决了一个非常现实的问题:
AI 不是所有决策都应该自己做。
创意方向和商业目标,往往需要人参与。
而具体执行,则可以高度自动化。
十二、Gallery 是这个项目另一个很聪明的设计
如果让用户直接阅读 152 张 Markdown 镜头卡,会非常痛苦。
所以项目提供了一个在线 Gallery。
用户可以:
- 浏览镜头;
- 查看动态 Preview;
- 搜索;
- 按类别过滤;
- 查看不同 Variant;
- 复制 Shot Card 名称。
这个设计实际上把:
“我想要一个什么样的动画?”
变成了一个视觉选择问题。
用户不需要描述:
“我希望一个有一点 3D 空间感,然后从右侧快速进入,再有一个轻微缓动的卡片堆叠……”
只需要:
“我要这个。”
然后把 Shot Card 名称交给 Agent。
这对于人与 AI 协作非常重要。
十三、从“Prompt Engineering”走向“Asset Engineering”
我认为 video-shotcraft 最值得关注的地方,其实不是 152 张镜头卡。
而是它背后的方法:
不要只优化 Prompt,要把 AI 的可调用资产准备好。
传统 AI 工作流:
Prompt
↓
LLM
↓
代码
↓
结果
而 video-shotcraft 更接近:
Product
↓
Knowledge / Rules
↓
Shot Recipes
↓
Reference Implementations
↓
Assets
↓
Agent
↓
Remotion
↓
Render
↓
QA
这就是一种典型的 Agent Skill Engineering。
AI 的能力不再完全依赖模型本身。
而是:
模型 + 工具 + 知识 + 模板 + 可复用资产 + 验收规则
共同组成最终能力。
十四、为什么这种模式可能比“AI 一键生成视频”更实用?
现在很多 AI 视频工具强调:
输入一句话 → 输出一支视频。
这种方式非常适合:
- 创意探索;
- 概念视频;
- 社交媒体内容;
- 氛围片;
- 非结构化内容。
但产品视频有一个特殊要求:
必须准确。
产品页面不能随便改。
Logo 不能变。
功能不能编。
UI 不能出现不存在的按钮。
文字不能乱写。
所以产品视频其实更适合:
Agent + Code + Real Assets
而不是完全依赖:
Text → Generative Video
video-shotcraft 的路线,本质上就是:
让 AI 负责创意和工程组织,让真实产品资产负责事实准确性,让 Remotion 负责确定性的画面生成。
这对于 SaaS、开发者工具、桌面软件、AI 产品尤其有价值。
十五、从这个项目还能看到一个更大的趋势
如果把 video-shotcraft 放到整个 AI Agent 生态里看,它代表的可能并不只是“AI 做视频”。
而是一个更大的方向:
Agent Skill 正在从“提示词”变成“专业工作流”
一个成熟的 Agent Skill,可能包含:
Skill
├── Rules
├── Knowledge
├── Templates
├── Recipes
├── Components
├── Assets
├── Tools
├── Examples
└── QA
这和传统软件工程非常像。
过去我们会给程序员:
API + SDK + Component Library
现在也可以给 Agent:
Skill + Recipe + Template + Asset Library + Toolchain
然后让 Agent 站在这些能力之上完成工作。
video-shotcraft 就是一个很直观的案例。
十六、如何开始使用?
最简单的方法,其实就是直接把仓库地址交给 Claude Code 或 Codex:
Install this skill for me:
https://github.com/Vincentwei1021/video-shotcraft
也可以使用 skills CLI:
npx skills add Vincentwei1021/video-shotcraft
或者直接 Clone:
git clone https://github.com/Vincentwei1021/video-shotcraft.git
cd video-shotcraft
然后根据使用的 Agent 建立 Skill 链接。
安装完成后,就可以直接提出类似这样的需求:
Use video-shotcraft to create a promo for my desktop product.
或者指定镜头:
Use the deck-deal-flyin and row-embed shot cards
to present this feature.
甚至可以直接说:
Use video-shotcraft to make a promo for my product
with the Ink Press template.
项目 README 给出的完整安装和使用方式也比较清晰。
十七、它目前最适合什么场景?
从项目本身的定位来看,它最适合:
SaaS 产品
例如:
- AI 工具
- 项目管理软件
- CRM
- 数据分析平台
- 协作工具
开发者工具
例如:
- IDE
- API 平台
- CLI
- DevTool
- AI Coding 产品
桌面应用
尤其适合有大量真实 UI,需要突出交互体验的产品。
产品发布视频
例如:
New Feature Launch
Product Update
Version Release
Product Demo
Landing Page Hero Video
而且单个 Shot Recipe 本身并不局限于产品宣传片,也可以被应用在:
- Brand Film
- Feature Demo
- Launch Video
- Social Video
- UI Motion
等场景。
十八、我认为它真正有价值的地方
如果只把 video-shotcraft 看成:
“一个有 152 个动画的 Remotion 项目”
其实低估了它。
它真正有意思的是把一个过去高度依赖人工经验的领域,拆成了可以被 Agent 执行的生产系统:
设计经验
↓
镜头配方
↓
代码实现
↓
模板
↓
素材库
↓
声音设计
↓
生产流程
↓
自动化 QA
这是一种非常典型的:
Knowledge → Workflow → Agent → Production
路径。
AI Agent 最终真正改变的,可能并不是“让 AI 会做更多事情”,而是:
把一个专业人士脑中的隐性工作流,逐渐变成机器可以执行的显性系统。
结语:未来的 AI 视频,可能不是“生成”,而是“制作”
过去我们讨论 AI 视频,经常围绕一个问题:
“哪个模型生成的视频最逼真?”
但对于产品团队而言,真正重要的问题可能是:
“AI 能不能从我的产品出发,完成一支可以发布的视频?”
这两个问题完全不同。
前者关注的是 Generation。
后者关注的是 Production。
video-shotcraft 选择的正是第二条路线。
它没有试图让 AI 凭空想象一个漂亮的视频,而是给 Agent 一套镜头语言、真实产品素材、Remotion 实现、声音资产、模板和质量标准。
最终让 AI 从一个:
“动画代码生成器”
逐渐变成:
“懂镜头语言的产品视频制作助手”。
这可能也是 Agent Skills 一个非常值得关注的发展方向:
未来的专业 AI,不一定是一个更大的模型,而可能是一个被精心设计过的“模型 + 工作流 + 工具 + 资产 + 验收体系”。
而 video-shotcraft,正好提供了一个很具体、也很漂亮的案例。




暂无评论内容