《AI Agent 开始当导演:一个 GitHub 项目如何让 Claude Code 自动制作电影感产品视频》

如果让 AI 做一支产品宣传片,你可能会想到这样的流程:

给 AI 一段产品介绍 → AI 生成几个画面 → 配上音乐 → 导出视频。

但真正做过产品视频的人会发现,“能生成视频”和“能做出一支像样的产品宣传片”是两回事。

产品视频真正难的地方,不只是动画,而是如何把产品页面、镜头语言、视觉设计、节奏、声音和后期制作组织成一个完整的生产流程。

最近看到的开源项目 video-shotcraft,正是在解决这个问题。

它不是一个简单的视频生成器,而是一个面向 Claude Code、Codex 等 AI Agent 的「电影感产品视频制作技能库」:把大量成熟的镜头运动方式整理成可复用的 Shot Recipe,再配合 Remotion 实现、完整视频模板、音效素材和生产流程,让 AI Agent 不只是“写代码做动画”,而是能够按照一套相对完整的影视制作方法来完成产品视频。

截至目前,这个项目已经包含 152 张镜头配方卡、209 个动态预览、209 种运动样式,以及一套完整的可运行宣传片模板。GitHub 仓库目前已经获得超过 6200 个 Star,并拥有 500+ Fork。

video-shotcraft GitHub 仓库


一、它到底解决了什么问题?

传统的产品视频制作,大致可以拆成几个阶段:

产品理解 → 创意 → Styleframe → 分镜 → 素材采集 → 动画 → 音效 → 剪辑 → 渲染 → QA

任何一个环节做得不好,最终效果都会打折扣。

例如:

  • 产品截图是假的,观众一眼就能看出来;
  • 动画很炫,但没有突出产品功能;
  • 镜头之间没有节奏;
  • BGM 和画面没有卡点;
  • SFX 乱加,声音变得廉价;
  • 所有元素都在动,没有“停顿”和“呼吸”;
  • 字体、颜色和产品本身的 Design System 完全不一致。

所以,真正的问题不是:

“AI 能不能生成一个动画?”

而是:

AI 能不能理解产品,并选择合适的镜头语言,把整个视频生产过程串起来?

video-shotcraft 的思路非常有意思:不要让 Agent 每次从零发明动画,而是给它一套可以检索、组合和复用的“镜头语言”。


二、把“视频制作经验”变成 Shot Recipe

video-shotcraft 最核心的设计,就是 Shot Recipe。

项目目前整理了 152 张镜头配方卡,每张卡不是简单地告诉 AI:

“做一个飞入动画。”

而是把一个镜头需要的关键信息结构化下来,包括:

  • 镜头用途
  • 情绪和能量
  • 推荐时长
  • 动画参数
  • 实现方式
  • 注意事项
  • 已有的 Remotion Demo
  • 动态预览

这其实是在做一件非常重要的事情:

把原本依赖设计师经验的“运动设计知识”,变成 Agent 可以调用的知识库。

例如,一个产品功能展示镜头可能需要:

页面出现 → 卡片飞入 → 排列 → 镜头推进 → 主体聚焦 → 信息停留

如果完全让 LLM 自己发挥,它很容易出现:

缩放 + 旋转 + 发光 + 粒子 + 弹跳 + Blur + Camera Shake……

看起来“很 AI”,但不一定高级。

而 Shot Recipe 的作用,就是告诉 Agent:

这个场景应该使用什么运动语法,以及这个运动应该怎么实现。

这和程序员调用组件库其实非常类似。

以前是:

从零写动画。

现在变成:

从镜头库选择一种运动语言 → 调整参数 → 适配产品素材。


三、为什么它选择 Remotion?

video-shotcraft 的底层视频实现采用了 Remotion

Remotion 的核心思路,是使用 React/TypeScript 来描述视频。

这对于 AI Agent 非常重要。

传统视频软件中的很多操作是:

时间线 → 拖动 → 调参数 → 预览 → 再调整。

而对于 Coding Agent 来说,更自然的工作方式是:

读取代码 → 修改参数 → 渲染 → 检查 → 再修改。

因此,Remotion 非常适合作为 AI Agent 的视频执行层。

video-shotcraft 的 Demo 本身就是 TSX 实现,并且大量动画使用标准化的 t(normalized progress)来驱动。

于是,一个镜头可以被抽象成:

输入素材 + 动画参数 + 时间进度 → 输出画面

这就让“镜头”成为一种可编程资产。


四、最值得注意的一点:真实产品页面,而不是 AI 手搓 UI

这是我认为 video-shotcraft 最有价值的设计原则之一。

项目明确强调:

复刻既有页面必须使用真实截图。

也就是说,如果视频是在介绍一个 SaaS 产品,不应该让 AI 自己重新画一个“看起来像”的 Dashboard。

正确的做法是:

真实产品页面 → 浏览器自动化 → 高清截图 → 元素级素材 → Remotion 运镜

项目的生产流程会启动产品本地开发服务器,然后使用无头浏览器采集页面,并进一步获得页面纹理以及元素位置数据。

这样做有一个非常明显的好处:

视频里的产品,真的就是用户正在使用的那个产品。

这会极大提高产品视频的可信度。


五、2.5D:为什么产品截图也能拍出“电影感”?

如果只有一张网页截图,普通做法可能就是:

放大 → 缩小 → 左右移动。

很快就会变成 PPT。

video-shotcraft 的方法则更接近 2.5D 摄影。

可以把一个网页理解成很多不同的视觉层:

Camera
  │
  ├── Background
  │
  ├── Page
  │    ├── Header
  │    ├── Content
  │    └── Cards
  │
  └── Foreground

然后通过:

  • Camera Zoom
  • Pan
  • Orbit
  • Perspective
  • Depth
  • Parallax
  • Rotation

让原本平面的页面产生空间感。

例如:

镜头先看到整个页面 → 缓慢推进 → 主体区域进入视觉中心 → 周围内容产生轻微视差 → 最后停在产品核心功能上。

这时候观众看到的已经不再是“网页截图”,而更像是摄影机正在拍摄一个真实的产品空间。


六、真正的“电影感”,不是加更多特效

项目的设计原则中有一句非常值得关注:

电影感来自运镜、光影、节奏与声音的配合,而不是炫技动画。

这是很多 AI 视频容易踩的坑。

AI 很容易认为:

高级 = 更多动画。

于是:

  • 每个元素都飞;
  • 每个元素都发光;
  • 每个文字都弹;
  • 每个转场都加 Blur;
  • 每个镜头都 Camera Shake。

结果往往恰恰相反。

video-shotcraft 更强调:

一个镜头只讲一个动效

例如一个镜头选择“飞入”,那么飞入就是这个镜头的主角。

而不是:

飞入 + 旋转 + 发光 + 粒子 + 弹跳 + Shake。

这种克制其实非常接近传统 Motion Design 的方法。

高级感很多时候来自“少做什么”,而不是“还能加什么”。


七、另一个关键:让画面“停下来”

AI 生成动画有一个天然倾向:

一直动。

因为对模型来说,“运动”似乎意味着“有内容”。

但专业视频恰恰需要大量 Hold。

video-shotcraft 对这一点有非常明确的规则:

  • 品牌字标落定后需要至少约 1 秒 Hold;
  • 批量动画结束后留出静止时间;
  • 开场主体动作要给予足够时间;
  • 时间线上提前预留休息帧。

原因很简单。

如果画面一直动:

观众没有时间理解信息。

真正的产品视频节奏应该是:

动作 → 落定 → 理解 → 下一动作

而不是:

动作 → 动作 → 动作 → 动作 → 动作……

所以“停顿”本身也是一种设计。


八、BGM 不只是背景音乐,而是时间轴

另一个非常有意思的部分,是 video-shotcraft 对 Beat Sync 的处理。

很多视频所谓“卡点”,实际上只是:

每隔几帧做一次动画。

这不是真正的音乐卡点。

项目的思路是先分析音乐本身,包括:

  • BPM
  • Phase
  • Kick
  • Snare
  • Hi-hat
  • 瞬态

然后把这些信息映射到视频时间轴。

最终,镜头时间不再简单写成:

0s
2s
4s
6s

而更接近:

beatF(1)
beatF(2)
beatF(4)
beatF(8)

这样可以让:

镜头切换、元素出现、Camera Move、Impact、SFX

真正发生在音乐的节奏节点上。

项目还提出了渲染后回测切点误差的思路,目标是将误差控制在较小的帧数范围内。

这其实说明了一件事:

视频节奏也是可以被工程化的。


九、声音设计:SFX 不是“最后随便加一下”

很多自动生成的视频会忽略声音。

实际上,同一个画面:

没有声音

有精准的 Impact / Riser / Sparkle / UI Click

完全是两种感觉。

video-shotcraft 甚至把 SFX 按场景和材质进行了分类。

目前项目包含 149 个 SFX,并按照:

  • transition
  • impact
  • riser
  • camera
  • UI
  • text
  • paper
  • film
  • light
  • data
  • sci-fi
  • mech
  • glass
  • fluid
  • crowd
  • counter

等类别组织。

这种分类方式很像一个设计师自己的“声音词典”。

例如:

UI 元素出现 → UI sound
纸张翻页 → paper sound
镜头冲击 → impact
光效出现 → sparkle / light
镜头推进 → riser

于是声音也成为镜头语言的一部分。


十、152 张镜头卡只是“词汇”,不是完整分镜

这是理解这个项目非常重要的一点。

Shot Recipe 并不等于完整视频。

它更像:

电影语言中的词汇。

例如:

  • Fly-in
  • Stack
  • Orbit
  • Zoom
  • Flip
  • Reveal
  • Spotlight
  • Parallax

这些是“词”。

真正的视频则是:

词 → 句子 → 段落 → 故事

所以 video-shotcraft 还提供了完整的 Production Pipeline。

它希望 Agent 先理解产品:

产品是什么?
      ↓
最值得展示什么?
      ↓
视觉方向是什么?
      ↓
哪些功能适合哪些镜头?
      ↓
完整 Storyboard
      ↓
素材采集
      ↓
动画实现
      ↓
声音设计
      ↓
渲染
      ↓
QA

这比单纯“让 AI 写 Remotion 代码”高了一个层级。


十一、它实际上提供了三种创作模式

项目并没有强迫所有视频走同一种流程,而是设计了三种模式。

1. Ink Press 模板

这是最适合快速出片的路线。

项目提供了一套已经验证过的完整宣传片模板:

  • 36.2 秒
  • 1920 × 1080
  • 30fps
  • 10 个镜头
  • 2.5D 页面运镜
  • Title Card
  • 转场
  • SFX

用户只需要告诉 Agent:

用 video-shotcraft 的 Ink Press 模板给我的产品做宣传片。

然后替换:

  • 产品截图
  • 产品文案
  • Logo
  • 品牌颜色

即可快速得到一支结构完整的视频。


2. 自主自由创作

如果不想使用固定模板,可以让 Agent 自己决定:

  • 视频结构
  • 视觉方向
  • 镜头选择
  • 素材处理
  • 音频
  • 节奏
  • 最终实现

这更像:

AI 导演模式。

用户给产品和目标,Agent 自己完成整个创作链路。


3. 共同创作

如果你希望自己参与创意决策,则可以采用共同创作模式。

Agent 会在几个关键节点停下来:

产品简报 → 需求决策 → Visual Direction → Shot Mapping → Storyboard

然后由人确认。

之后:

素材采集 → Remotion 实现 → SFX → Render → QA

则交给 Agent 执行。

这实际上解决了一个非常现实的问题:

AI 不是所有决策都应该自己做。

创意方向和商业目标,往往需要人参与。

而具体执行,则可以高度自动化。


十二、Gallery 是这个项目另一个很聪明的设计

如果让用户直接阅读 152 张 Markdown 镜头卡,会非常痛苦。

所以项目提供了一个在线 Gallery。

用户可以:

  • 浏览镜头;
  • 查看动态 Preview;
  • 搜索;
  • 按类别过滤;
  • 查看不同 Variant;
  • 复制 Shot Card 名称。

在线 Motion Gallery

这个设计实际上把:

“我想要一个什么样的动画?”

变成了一个视觉选择问题。

用户不需要描述:

“我希望一个有一点 3D 空间感,然后从右侧快速进入,再有一个轻微缓动的卡片堆叠……”

只需要:

“我要这个。”

然后把 Shot Card 名称交给 Agent。

这对于人与 AI 协作非常重要。


十三、从“Prompt Engineering”走向“Asset Engineering”

我认为 video-shotcraft 最值得关注的地方,其实不是 152 张镜头卡。

而是它背后的方法:

不要只优化 Prompt,要把 AI 的可调用资产准备好。

传统 AI 工作流:

Prompt
  ↓
LLM
  ↓
代码
  ↓
结果

而 video-shotcraft 更接近:

Product
   ↓
Knowledge / Rules
   ↓
Shot Recipes
   ↓
Reference Implementations
   ↓
Assets
   ↓
Agent
   ↓
Remotion
   ↓
Render
   ↓
QA

这就是一种典型的 Agent Skill Engineering

AI 的能力不再完全依赖模型本身。

而是:

模型 + 工具 + 知识 + 模板 + 可复用资产 + 验收规则

共同组成最终能力。


十四、为什么这种模式可能比“AI 一键生成视频”更实用?

现在很多 AI 视频工具强调:

输入一句话 → 输出一支视频。

这种方式非常适合:

  • 创意探索;
  • 概念视频;
  • 社交媒体内容;
  • 氛围片;
  • 非结构化内容。

但产品视频有一个特殊要求:

必须准确。

产品页面不能随便改。

Logo 不能变。

功能不能编。

UI 不能出现不存在的按钮。

文字不能乱写。

所以产品视频其实更适合:

Agent + Code + Real Assets

而不是完全依赖:

Text → Generative Video

video-shotcraft 的路线,本质上就是:

让 AI 负责创意和工程组织,让真实产品资产负责事实准确性,让 Remotion 负责确定性的画面生成。

这对于 SaaS、开发者工具、桌面软件、AI 产品尤其有价值。


十五、从这个项目还能看到一个更大的趋势

如果把 video-shotcraft 放到整个 AI Agent 生态里看,它代表的可能并不只是“AI 做视频”。

而是一个更大的方向:

Agent Skill 正在从“提示词”变成“专业工作流”

一个成熟的 Agent Skill,可能包含:

Skill
├── Rules
├── Knowledge
├── Templates
├── Recipes
├── Components
├── Assets
├── Tools
├── Examples
└── QA

这和传统软件工程非常像。

过去我们会给程序员:

API + SDK + Component Library

现在也可以给 Agent:

Skill + Recipe + Template + Asset Library + Toolchain

然后让 Agent 站在这些能力之上完成工作。

video-shotcraft 就是一个很直观的案例。


十六、如何开始使用?

最简单的方法,其实就是直接把仓库地址交给 Claude Code 或 Codex:

Install this skill for me:
https://github.com/Vincentwei1021/video-shotcraft

也可以使用 skills CLI:

npx skills add Vincentwei1021/video-shotcraft

或者直接 Clone:

git clone https://github.com/Vincentwei1021/video-shotcraft.git

cd video-shotcraft

然后根据使用的 Agent 建立 Skill 链接。

安装完成后,就可以直接提出类似这样的需求:

Use video-shotcraft to create a promo for my desktop product.

或者指定镜头:

Use the deck-deal-flyin and row-embed shot cards
to present this feature.

甚至可以直接说:

Use video-shotcraft to make a promo for my product
with the Ink Press template.

项目 README 给出的完整安装和使用方式也比较清晰。


十七、它目前最适合什么场景?

从项目本身的定位来看,它最适合:

SaaS 产品

例如:

  • AI 工具
  • 项目管理软件
  • CRM
  • 数据分析平台
  • 协作工具

开发者工具

例如:

  • IDE
  • API 平台
  • CLI
  • DevTool
  • AI Coding 产品

桌面应用

尤其适合有大量真实 UI,需要突出交互体验的产品。

产品发布视频

例如:

New Feature Launch
Product Update
Version Release
Product Demo
Landing Page Hero Video

而且单个 Shot Recipe 本身并不局限于产品宣传片,也可以被应用在:

  • Brand Film
  • Feature Demo
  • Launch Video
  • Social Video
  • UI Motion

等场景。


十八、我认为它真正有价值的地方

如果只把 video-shotcraft 看成:

“一个有 152 个动画的 Remotion 项目”

其实低估了它。

它真正有意思的是把一个过去高度依赖人工经验的领域,拆成了可以被 Agent 执行的生产系统:

设计经验
   ↓
镜头配方
   ↓
代码实现
   ↓
模板
   ↓
素材库
   ↓
声音设计
   ↓
生产流程
   ↓
自动化 QA

这是一种非常典型的:

Knowledge → Workflow → Agent → Production

路径。

AI Agent 最终真正改变的,可能并不是“让 AI 会做更多事情”,而是:

把一个专业人士脑中的隐性工作流,逐渐变成机器可以执行的显性系统。


结语:未来的 AI 视频,可能不是“生成”,而是“制作”

过去我们讨论 AI 视频,经常围绕一个问题:

“哪个模型生成的视频最逼真?”

但对于产品团队而言,真正重要的问题可能是:

“AI 能不能从我的产品出发,完成一支可以发布的视频?”

这两个问题完全不同。

前者关注的是 Generation

后者关注的是 Production

video-shotcraft 选择的正是第二条路线。

它没有试图让 AI 凭空想象一个漂亮的视频,而是给 Agent 一套镜头语言、真实产品素材、Remotion 实现、声音资产、模板和质量标准。

最终让 AI 从一个:

“动画代码生成器”

逐渐变成:

“懂镜头语言的产品视频制作助手”。

这可能也是 Agent Skills 一个非常值得关注的发展方向:

未来的专业 AI,不一定是一个更大的模型,而可能是一个被精心设计过的“模型 + 工作流 + 工具 + 资产 + 验收体系”。

而 video-shotcraft,正好提供了一个很具体、也很漂亮的案例。

项目主页:Vincentwei1021/video-shotcraft

© 版权声明
THE END
喜欢就支持一下吧
点赞8 分享
评论 抢沙发

    暂无评论内容