当 AI Agent 从“会聊天”逐渐走向“会做事”,一个越来越重要的问题开始浮现:Agent 除了生成文字,还能不能直接完成图片、视频、音频和设计任务?
SamurAIGPT 开源的 Generative-Media-Skills 正是在解决这个问题。
Generative-Media-Skills GitHub 仓库 将大量生成式媒体能力封装成适合 AI Agent 调用的 Skills,使 Claude Code、Cursor、Gemini CLI、OpenCode 等 Agent 不仅能够理解用户的创意需求,还可以进一步把需求转换为实际的媒体生产流程。
截至 2026 年 8 月,该项目 GitHub 页面显示已经获得超过 4,100 个 Stars 和超过 470 个 Forks,并且仍在持续更新。
一、它解决的不是“生成图片”,而是“让 Agent 完成创作”
传统的 AI 图片或视频工具通常遵循这样的模式:
用户输入 Prompt → 模型生成结果 → 用户下载
这种模式对于单次创作已经足够,但对于 AI Agent 来说远远不够。
Agent 真正需要的是:
理解需求 → 选择合适模型 → 准备素材 → 生成 → 编辑 → 检查结果 → 继续下一步
例如用户说:
“把这张产品照片制作成一个 10 秒的高端广告视频。”
这句话实际上包含了多个任务:
- 理解产品和品牌定位;
- 分析原始产品图片;
- 设计视觉风格;
- 规划镜头;
- 生成关键画面;
- 将图片转换成视频;
- 加入适合的运动效果;
- 最终输出广告素材。
Generative-Media-Skills 的核心价值,就是把这些复杂任务组织成 Agent 可以理解和执行的技能流程。
因此,它更像一个面向 AI Agent 的“创意生产层”,而不仅仅是一个 API 封装。
二、Core + Library:项目最值得关注的架构
这个项目采用了非常清晰的 Core / Library 双层架构。
Core:提供基础能力
/core 中主要是底层原语,包括:
- 媒体文件上传;
- 图片编辑;
- 平台认证;
- API 调用;
- 结果轮询。
这些能力本身并不负责复杂的创意决策,而是提供稳定的基础设施。
项目将底层调用交给 muapi-cli,因此开发者不需要为每一个模型重新编写 curl、JSON 解析以及结果轮询逻辑。
这对于 Agent 尤其重要。
Agent 更希望得到这样的接口:
生成图片
生成视频
编辑图片
上传素材
获取结果
而不是面对大量 API endpoint、HTTP headers 和 JSON response。
Library:提供“专家知识”
真正有意思的是 /library。
这里并不是简单地堆放 API 示例,而是把专业创作知识编码成 AI Agent 可以执行的 Skill。
例如项目目前提供:
- Cinema Director
- Nano-Banana
- UI Designer
- Logo Creator
- Seedance 2
- AI Clipping
- YouTube Shorts
这些 Skill 相当于给 Agent 增加了一层“专业能力”。
比如一个普通模型可能只知道:
“生成一个电影感的视频。”
而 Cinema Director 类型的 Skill 可以进一步把创意转化为摄影机运动、构图、镜头语言、光线、景别和节奏等具体指令。
这就是项目非常重要的设计思想:
模型负责生成,Skill 负责把创意变成可执行的专业工作流。
三、41 个 Recipe,把复杂创作变成可执行流程
项目目前提供了 41 个工作流 Recipe,覆盖 Motion、Social、Visual 等方向。
其中最值得注意的是,它们并不是简单的 Shell 命令集合。
README 将 Recipe 描述为由 LLM 负责执行的端到端工作流。每个 Skill 都通过 SKILL.md 描述输入和步骤,然后由 Claude Code、Cursor 或 MCP 等 Agent 根据这些步骤调用底层能力。
这意味着:
Skill 本身更像一份“AI 创作 SOP”。
例如一个产品广告工作流,可以抽象成:
产品图片
↓
分析产品特征
↓
确定视觉方向
↓
设计广告画面
↓
生成关键帧
↓
关键帧 → 视频
↓
生成动态效果
↓
输出广告素材
对于 Agent 来说,这比单独调用一次“文生图 API”强大得多。
四、从视频到社交媒体:覆盖完整内容生产链
Generative-Media-Skills 的另一个特点,是它没有把重点局限在某一种媒体。
1. 视频生成
项目包含大量视频方向的 Skill,例如:
- 3D Logo Animation
- AI Fight Scene Generator
- Animal Vlogger Video
- Cartoon Dance Animation
- Character Story Video
- Drone-Style Video
- Jewelry Product Video
- Music Video
- One-Shot Video
- Cinematic Product Ad
- UGC Video Factory
这意味着 Agent 可以从“一个想法”出发,一直走到视频成片。
尤其是 UGC Video Factory 这样的流程,本质上已经非常接近商业广告生产:
人物照片 + 产品照片 + 脚本 → 竖屏 UGC 广告视频。
2. 图片与设计
视觉方向的 Skill 同样丰富。
例如:
- Action Figure Generator
- Amazon Product Listing Pack
- Brand Kit
- Brochure Designer
- Fashion Try-On
- Floor Plan Rendering
- Interior Design
- Logo Generator
- Storyboard Generator
- YouTube Thumbnail
这让 Agent 的角色从“图片生成器”进一步变成了一个小型设计工作室。
例如电商卖家可以提出:
“帮我为这个产品制作完整的 Amazon 图片素材。”
Agent 就可以按照既定 Skill,生成主图、生活方式图片、信息图、对比图和细节特写,而不需要用户分别设计几十个 Prompt。
五、真正的杀手级能力:组合,而不是单点模型
目前生成式 AI 最大的问题之一,是模型非常多。
图片有 Midjourney、Flux、Gemini 等;
视频有 Kling、Seedance、Veo 等;
音乐又有 Suno 等。
用户真正头疼的往往不是:
“有没有模型?”
而是:
“我到底应该怎么把这些模型组合起来?”
Generative-Media-Skills 的答案是通过 Skill 来解决。
README 显示项目可以访问超过 100 个 AI 模型,并覆盖 Midjourney、Flux Kontext、Seedance、Kling、Veo 等不同类型的生成能力。
因此,模型不再是用户直接面对的核心对象。
用户面对的是:
“制作一个产品广告。”
Agent 再决定背后应该使用什么模型、什么参数以及什么流程。
这实际上是从 Model-centric 向 Task-centric 的转变。
六、为什么 MCP 也很重要?
项目还提供 MCP Server。
README 中给出的方式是:
muapi mcp serve
通过 MCP,可以把这些媒体能力直接暴露给 Claude Desktop、Cursor 或其他兼容 MCP 的 Agent。
这带来的变化非常明显。
传统方式:
ChatGPT / Claude
↓
告诉用户怎么调用 API
↓
用户自己运行脚本
MCP + Skills:
用户
↓
AI Agent
↓
理解创意
↓
选择 Skill
↓
调用媒体工具
↓
生成素材
↓
返回结果
换句话说,AI 从“指导用户使用工具”变成了“自己使用工具完成工作”。
这可能才是 Agent 时代生成式媒体真正值得关注的方向。
七、快速体验
项目的安装流程也相对直接。
首先安装 muapi-cli:
npm install -g muapi-cli
然后配置 API Key:
muapi auth configure
接着安装全部 Skills:
npx skills add SamurAIGPT/Generative-Media-Skills --all
也可以只安装特定 Skill:
npx skills add SamurAIGPT/Generative-Media-Skills \
--skill muapi-media-generation
项目还支持针对特定 Agent 安装,例如 Claude Code 和 Cursor。
完成后,就可以直接进行基础图片生成:
muapi image generate \
"a cyberpunk city at night" \
--model flux-dev
或者进入更高级的 Skill 工作流。
例如电影场景可以使用 Cinema Director:
bash scripts/generate-film.sh \
--subject "a cybernetic dragon over Tokyo" \
--intent "epic" \
--model "kling-v3.0-pro" \
--duration 10 \
--view
这些例子说明,项目试图建立的是从自然语言创意 → Agent Skill → CLI/API → 媒体结果的完整链路。
八、它真正代表了什么?
如果只把 Generative-Media-Skills 看成一个“AI 图片/视频生成工具合集”,其实低估了它。
它更值得关注的地方在于:
第一,Prompt 正在变成 Workflow
过去:
写一个好 Prompt。
现在:
设计一个完整 Workflow。
未来:
让 Agent 自己选择和执行 Workflow。
第二,Skill 正在成为 Agent 的“专业知识插件”
一个通用大模型知道很多事情,但不意味着它天然就是摄影师、导演、设计师或广告创意总监。
Skill 可以把这些领域知识结构化。
例如:
用户意图
↓
专业 Skill
↓
创作策略
↓
模型选择
↓
参数与 Prompt
↓
生成
因此 Skill 层实际上承担了“专业经验”的角色。
第三,AI 创作开始从单模型走向模型编排
未来真正强大的 AI 创作系统,可能不是:
“最强的一个模型。”
而是:
“能够根据任务,自动组合最合适模型的 Agent。”
一个广告项目可能同时需要:
LLM
↓
脚本
Image Model
↓
视觉素材
Video Model
↓
动态镜头
Audio Model
↓
配乐 / 音效 / 配音
Editing
↓
最终成片
Generative-Media-Skills 已经在尝试把这种模式标准化。
九、谁最适合使用?
这个项目尤其适合以下几类人。
AI 开发者
如果你正在开发 Claude Code、Cursor 或其他 Agent,可以直接借鉴它的 Skill 组织方式。
内容创作者
如果你需要批量制作图片、短视频、广告、社交媒体素材,Recipe 模式可以明显减少重复 Prompt 工作。
电商团队
产品广告、商品图、Amazon Listing、UGC 广告等工作流都非常贴近实际商业需求。
设计师
Logo、Brand Kit、UI、室内设计、宣传册等 Skill 可以作为创意探索工具。
Agent 开发者
更重要的是,这个项目提供了一个值得研究的范式:
如何把“人类专家的创作流程”转换成 Agent 能够执行的 Skill。
十、结语:下一代 AI 创作工具,也许不是一个 App
Generative-Media-Skills 最值得关注的地方,并不是它集合了多少模型,而是它展示了一种新的产品形态:
AI Agent + Skills + Models + Workflow。
模型提供能力,Skill 提供专业知识,Workflow 负责组织步骤,而 Agent 则负责理解用户意图并执行整个过程。
这意味着未来我们使用 AI 创作时,可能不再需要:
打开图片工具 → 写 Prompt → 下载 → 打开视频工具 → 再写 Prompt → 编辑 → 导出。
而可能只需要告诉 Agent:
“把我的产品做成一套完整的社交媒体广告 campaign。”
剩下的事情,由 Agent 自己完成。
从这个角度来看,Generative-Media-Skills 并不只是一个生成式媒体工具箱,而是在探索一种更重要的方向:
让 AI 从“生成内容”走向“完成创意任务”。




暂无评论内容