Generative-Media-Skills:让 AI Agent 真正具备“生成媒体”的能力

当 AI Agent 从“会聊天”逐渐走向“会做事”,一个越来越重要的问题开始浮现:Agent 除了生成文字,还能不能直接完成图片、视频、音频和设计任务?

SamurAIGPT 开源的 Generative-Media-Skills 正是在解决这个问题。

Generative-Media-Skills GitHub 仓库 将大量生成式媒体能力封装成适合 AI Agent 调用的 Skills,使 Claude Code、Cursor、Gemini CLI、OpenCode 等 Agent 不仅能够理解用户的创意需求,还可以进一步把需求转换为实际的媒体生产流程。

截至 2026 年 8 月,该项目 GitHub 页面显示已经获得超过 4,100 个 Stars 和超过 470 个 Forks,并且仍在持续更新。

一、它解决的不是“生成图片”,而是“让 Agent 完成创作”

传统的 AI 图片或视频工具通常遵循这样的模式:

用户输入 Prompt → 模型生成结果 → 用户下载

这种模式对于单次创作已经足够,但对于 AI Agent 来说远远不够。

Agent 真正需要的是:

理解需求 → 选择合适模型 → 准备素材 → 生成 → 编辑 → 检查结果 → 继续下一步

例如用户说:

“把这张产品照片制作成一个 10 秒的高端广告视频。”

这句话实际上包含了多个任务:

  1. 理解产品和品牌定位;
  2. 分析原始产品图片;
  3. 设计视觉风格;
  4. 规划镜头;
  5. 生成关键画面;
  6. 将图片转换成视频;
  7. 加入适合的运动效果;
  8. 最终输出广告素材。

Generative-Media-Skills 的核心价值,就是把这些复杂任务组织成 Agent 可以理解和执行的技能流程

因此,它更像一个面向 AI Agent 的“创意生产层”,而不仅仅是一个 API 封装。


二、Core + Library:项目最值得关注的架构

这个项目采用了非常清晰的 Core / Library 双层架构。

Core:提供基础能力

/core 中主要是底层原语,包括:

  • 媒体文件上传;
  • 图片编辑;
  • 平台认证;
  • API 调用;
  • 结果轮询。

这些能力本身并不负责复杂的创意决策,而是提供稳定的基础设施。

项目将底层调用交给 muapi-cli,因此开发者不需要为每一个模型重新编写 curl、JSON 解析以及结果轮询逻辑。

这对于 Agent 尤其重要。

Agent 更希望得到这样的接口:

生成图片
生成视频
编辑图片
上传素材
获取结果

而不是面对大量 API endpoint、HTTP headers 和 JSON response。

Library:提供“专家知识”

真正有意思的是 /library

这里并不是简单地堆放 API 示例,而是把专业创作知识编码成 AI Agent 可以执行的 Skill。

例如项目目前提供:

  • Cinema Director
  • Nano-Banana
  • UI Designer
  • Logo Creator
  • Seedance 2
  • AI Clipping
  • YouTube Shorts

这些 Skill 相当于给 Agent 增加了一层“专业能力”。

比如一个普通模型可能只知道:

“生成一个电影感的视频。”

而 Cinema Director 类型的 Skill 可以进一步把创意转化为摄影机运动、构图、镜头语言、光线、景别和节奏等具体指令。

这就是项目非常重要的设计思想:

模型负责生成,Skill 负责把创意变成可执行的专业工作流。


三、41 个 Recipe,把复杂创作变成可执行流程

项目目前提供了 41 个工作流 Recipe,覆盖 Motion、Social、Visual 等方向。

其中最值得注意的是,它们并不是简单的 Shell 命令集合。

README 将 Recipe 描述为由 LLM 负责执行的端到端工作流。每个 Skill 都通过 SKILL.md 描述输入和步骤,然后由 Claude Code、Cursor 或 MCP 等 Agent 根据这些步骤调用底层能力。

这意味着:

Skill 本身更像一份“AI 创作 SOP”。

例如一个产品广告工作流,可以抽象成:

产品图片
   ↓
分析产品特征
   ↓
确定视觉方向
   ↓
设计广告画面
   ↓
生成关键帧
   ↓
关键帧 → 视频
   ↓
生成动态效果
   ↓
输出广告素材

对于 Agent 来说,这比单独调用一次“文生图 API”强大得多。


四、从视频到社交媒体:覆盖完整内容生产链

Generative-Media-Skills 的另一个特点,是它没有把重点局限在某一种媒体。

1. 视频生成

项目包含大量视频方向的 Skill,例如:

  • 3D Logo Animation
  • AI Fight Scene Generator
  • Animal Vlogger Video
  • Cartoon Dance Animation
  • Character Story Video
  • Drone-Style Video
  • Jewelry Product Video
  • Music Video
  • One-Shot Video
  • Cinematic Product Ad
  • UGC Video Factory

这意味着 Agent 可以从“一个想法”出发,一直走到视频成片。

尤其是 UGC Video Factory 这样的流程,本质上已经非常接近商业广告生产:

人物照片 + 产品照片 + 脚本 → 竖屏 UGC 广告视频。


2. 图片与设计

视觉方向的 Skill 同样丰富。

例如:

  • Action Figure Generator
  • Amazon Product Listing Pack
  • Brand Kit
  • Brochure Designer
  • Fashion Try-On
  • Floor Plan Rendering
  • Interior Design
  • Logo Generator
  • Storyboard Generator
  • YouTube Thumbnail

这让 Agent 的角色从“图片生成器”进一步变成了一个小型设计工作室。

例如电商卖家可以提出:

“帮我为这个产品制作完整的 Amazon 图片素材。”

Agent 就可以按照既定 Skill,生成主图、生活方式图片、信息图、对比图和细节特写,而不需要用户分别设计几十个 Prompt。


五、真正的杀手级能力:组合,而不是单点模型

目前生成式 AI 最大的问题之一,是模型非常多。

图片有 Midjourney、Flux、Gemini 等;

视频有 Kling、Seedance、Veo 等;

音乐又有 Suno 等。

用户真正头疼的往往不是:

“有没有模型?”

而是:

我到底应该怎么把这些模型组合起来?

Generative-Media-Skills 的答案是通过 Skill 来解决。

README 显示项目可以访问超过 100 个 AI 模型,并覆盖 Midjourney、Flux Kontext、Seedance、Kling、Veo 等不同类型的生成能力。

因此,模型不再是用户直接面对的核心对象。

用户面对的是:

“制作一个产品广告。”

Agent 再决定背后应该使用什么模型、什么参数以及什么流程。

这实际上是从 Model-centricTask-centric 的转变。


六、为什么 MCP 也很重要?

项目还提供 MCP Server。

README 中给出的方式是:

muapi mcp serve

通过 MCP,可以把这些媒体能力直接暴露给 Claude Desktop、Cursor 或其他兼容 MCP 的 Agent。

这带来的变化非常明显。

传统方式:

ChatGPT / Claude
      ↓
告诉用户怎么调用 API
      ↓
用户自己运行脚本

MCP + Skills:

用户
 ↓
AI Agent
 ↓
理解创意
 ↓
选择 Skill
 ↓
调用媒体工具
 ↓
生成素材
 ↓
返回结果

换句话说,AI 从“指导用户使用工具”变成了“自己使用工具完成工作”。

这可能才是 Agent 时代生成式媒体真正值得关注的方向。


七、快速体验

项目的安装流程也相对直接。

首先安装 muapi-cli

npm install -g muapi-cli

然后配置 API Key:

muapi auth configure

接着安装全部 Skills:

npx skills add SamurAIGPT/Generative-Media-Skills --all

也可以只安装特定 Skill:

npx skills add SamurAIGPT/Generative-Media-Skills \
  --skill muapi-media-generation

项目还支持针对特定 Agent 安装,例如 Claude Code 和 Cursor。

完成后,就可以直接进行基础图片生成:

muapi image generate \
  "a cyberpunk city at night" \
  --model flux-dev

或者进入更高级的 Skill 工作流。

例如电影场景可以使用 Cinema Director:

bash scripts/generate-film.sh \
  --subject "a cybernetic dragon over Tokyo" \
  --intent "epic" \
  --model "kling-v3.0-pro" \
  --duration 10 \
  --view

这些例子说明,项目试图建立的是从自然语言创意 → Agent Skill → CLI/API → 媒体结果的完整链路。


八、它真正代表了什么?

如果只把 Generative-Media-Skills 看成一个“AI 图片/视频生成工具合集”,其实低估了它。

它更值得关注的地方在于:

第一,Prompt 正在变成 Workflow

过去:

写一个好 Prompt。

现在:

设计一个完整 Workflow。

未来:

让 Agent 自己选择和执行 Workflow。


第二,Skill 正在成为 Agent 的“专业知识插件”

一个通用大模型知道很多事情,但不意味着它天然就是摄影师、导演、设计师或广告创意总监。

Skill 可以把这些领域知识结构化。

例如:

用户意图
   ↓
专业 Skill
   ↓
创作策略
   ↓
模型选择
   ↓
参数与 Prompt
   ↓
生成

因此 Skill 层实际上承担了“专业经验”的角色。


第三,AI 创作开始从单模型走向模型编排

未来真正强大的 AI 创作系统,可能不是:

“最强的一个模型。”

而是:

“能够根据任务,自动组合最合适模型的 Agent。”

一个广告项目可能同时需要:

LLM
 ↓
脚本

Image Model
 ↓
视觉素材

Video Model
 ↓
动态镜头

Audio Model
 ↓
配乐 / 音效 / 配音

Editing
 ↓
最终成片

Generative-Media-Skills 已经在尝试把这种模式标准化。


九、谁最适合使用?

这个项目尤其适合以下几类人。

AI 开发者

如果你正在开发 Claude Code、Cursor 或其他 Agent,可以直接借鉴它的 Skill 组织方式。

内容创作者

如果你需要批量制作图片、短视频、广告、社交媒体素材,Recipe 模式可以明显减少重复 Prompt 工作。

电商团队

产品广告、商品图、Amazon Listing、UGC 广告等工作流都非常贴近实际商业需求。

设计师

Logo、Brand Kit、UI、室内设计、宣传册等 Skill 可以作为创意探索工具。

Agent 开发者

更重要的是,这个项目提供了一个值得研究的范式:

如何把“人类专家的创作流程”转换成 Agent 能够执行的 Skill。


十、结语:下一代 AI 创作工具,也许不是一个 App

Generative-Media-Skills 最值得关注的地方,并不是它集合了多少模型,而是它展示了一种新的产品形态:

AI Agent + Skills + Models + Workflow。

模型提供能力,Skill 提供专业知识,Workflow 负责组织步骤,而 Agent 则负责理解用户意图并执行整个过程。

这意味着未来我们使用 AI 创作时,可能不再需要:

打开图片工具 → 写 Prompt → 下载 → 打开视频工具 → 再写 Prompt → 编辑 → 导出。

而可能只需要告诉 Agent:

“把我的产品做成一套完整的社交媒体广告 campaign。”

剩下的事情,由 Agent 自己完成。

从这个角度来看,Generative-Media-Skills 并不只是一个生成式媒体工具箱,而是在探索一种更重要的方向:

让 AI 从“生成内容”走向“完成创意任务”。

项目 GitHub 仓库

© 版权声明
THE END
喜欢就支持一下吧
点赞10 分享
评论 抢沙发

    暂无评论内容