如何在 Claude Code 中构建 AI 视频工作室

@EXM7777
英语1天前 · 2026年7月28日
363K
708
55
33
2.3K

TL;DR

本指南详细介绍了使用 Claude Code 和 Higgsfield 进行 AI 视频制作的专业六阶段工作流。内容涵盖风格提取、帧生成、Agent 提示词工程以及自动化剪辑流程。

我把 Claude Code 变成了一个真正的电影工作室,现在我要把整套系统交给你:技能、提示词、循环逻辑,以及把它们串联起来的六阶段流水线

每个阶段都依赖工具链的不同部分:模型靠技能,体量靠子 Agent,剪辑靠 bash,重复性工作靠精心设计的循环

今天,我来教你用 Higgsfield Supercomputer、Claude Code 和 Seedance 2.0 制作像这样的短片:

Machina - inline image

本文内容包括:

  • 引擎:所有模型集中在一个平台,两种接入方式
  • 阶段 1:从真实电影中提取风格契约
  • 阶段 2:批量生成帧,锁定角色和场景
  • 阶段 3:Agent 编写每一个镜头提示词
  • 阶段 4:运动控制,以及消除静态画面的语法
  • 阶段 5:子 Agent 集群并行执行生成任务
  • 阶段 6:配乐、从文本文件剪辑、4K 母版

如果你想获取本文背后的完整制作工具包——提示词项目、风格圣经和即用型 Agent 简报——欢迎加入 weeklyaiops.com 上的实时 AI 运营社区

为什么循环本身就是产品

过去,一个专业镜头就是一次赌博,因为每次尝试都花费真金白银和好几天时间,所以没人敢实验,结果所有镜头看起来都一样

AI 视频打破了这种循环:描述一个镜头,几分钟内生成,观看,改三个词,重新生成

尝试的成本降得太低,以至于尝试一切成了策略

但打破的循环只有在你拥有自动执行它的工具时才有价值,因为每个镜头重复五十次,二十个镜头就是一千次决策,而人类点击一千次生成按钮会变成一个非常疲惫的操作员,最终产出的仍然是劣质内容

所以系统将工作一分为二:

  • 你负责品味:哪些帧感觉对,哪些镜头保留,电影想成为什么样子
  • Agent 负责吞吐量:编写提示词、提交生成任务、轮询作业、重试失败、组装剪辑

在当前时间线上,这种技能被称为 循环工程,我们正在用它搭建这套系统

Machina - inline image

Agent 循环就是一个重复执行直到满足条件的任务,而这个制作流程是三层嵌套循环:

  • 镜头循环:生成、观看、改变一个变量、重新生成,直到镜头达到要求
  • 集群循环:遍历镜头列表,只要有空闲槽位就提交任务,收集成功的成果
  • 会话循环:记录每一次生成,这样下一个制作可以从本次学到的所有经验开始

你只需设计一次循环,Agent 就能运行一整夜——这就是使用一个模型和运营一个工作室的区别

你看到的每一部"Agent 制作的电影",包括这一部,都是这样分工的:Agent 负责规划、提示和重试,人类负责挑选和指导

目前还没有人展示过一部从头到尾由 Agent 完成、没有任何人类参与的值得观看的电影,下面的系统也不会假装是那样的

廉价的生成并没有让好的视频变得容易……它把整个工作转移到了品味上

接下来的所有内容都围绕着那句话展开

Machina - inline image

引擎:一个平台,两个入口

这个制作流程涉及图像模型、视频模型、音乐生成和放大——将成品素材提升到 4K 的步骤——通常意味着五个订阅、五个标签页、五个渲染队列和五个可能丢失文件的地方

Higgsfield 将几乎所有模型放在一个界面上,只需一次登录和一个积分池,整个平台专为 Agent 化使用而设计,这正是这套系统所需要的,因为 Agent 无法同时管理五个不同的登录账号

有两个入口:

  • Supercomputer 是简单入口:一个在平台上运行的 Agent,自动规划你的制作,自行选择每个任务的最佳模型,并剪辑你的场景。你描述你想要的内容,它处理路由,并且它像 Claude Code 一样通过技能运行。如果你不使用终端,从这里开始
  • CLI 是控制入口:它让所有模型都可以从 Claude Code 或你已有的任何工具链中调用,这意味着你自己的 Agent 掌控整个流水线:生成什么、何时生成、使用哪个模型、以什么顺序生成

如果你是 AI 视频新手,不知道一个好镜头需要多少次迭代,Supercomputer 使用完全免费:规划、测试和修改不消耗任何积分,你只需在渲染最终视频时付费,因此免费计划足以覆盖所有探索

CLI 设置只需三条命令:

  • npm install -g @higgsfield/cli
  • higgsfield auth login
  • npx skills add higgsfield-ai/skills

技能包教会 Claude Code 何时使用哪个模型、如何保持角色一致性,以及如何提交和轮询作业。从这一刻起,你的终端就是工作室

一条命令即可提交任何模型并等待结果:

  • higgsfield generate create seedance_2_0 --prompt "缓慢推进,船帆撕裂" --start-image ./frame.png --duration 5 --resolution 1080p --wait

只需更换模型名称,同样的结构就能覆盖整个制作流程:gpt_image_2 用于帧、nano_banana_2 用于角色编辑、sonilo_music 配合 --duration 用于配乐、upScaler 用于 4K 母版

承载流水线的关键参数:

  • --start-image 设置图像到视频的第一帧,本地文件路径会自动上传
  • --end-image 锁定最后一帧,用于连接链式镜头
  • --wait 阻塞直到片段完成并输出结果 URL,--json 使输出对 Agent 可读
  • higgsfield model list --json 显示所有可调用的模型,higgsfield model get seedance_2_0 --json 显示该模型接受的具体参数

而通过 Claude Code 运行这一切只需一个文本文件,无需集成:

  • 将路由规则写入项目的 CLAUDE.md:每个任务类型使用哪个模型、分辨率阶梯、并发上限
  • Agent 读取一次规则,它生成的每个子 Agent 都会继承这些规则
  • 通过 bash 提交生成任务,使用 higgsfield generate get 检查状态,并将结果记录到每个运行周期的独立文件中

下面所有内容都通过这个入口运行

Machina - inline image

阶段 1:从电影中提取品味,而不是凭空创造

将品味引入 AI 视频最快的方法,不是从想象中描述情绪,而是从已经打动过数百万人的镜头中提取它们

你的素材库,请收藏这些:

挑选 5 到 10 个承载你确切感觉的镜头

然后执行提取操作:将每个镜头输入像 Gemini 3.1 Pro 这样的视觉模型,让它极其详细地命名镜头的参数……镜头感、光照方向和来源、色调、颗粒、对比度、构图、氛围、时代标志

输出结果就是我所说的 风格契约:一个固定的视觉语言段落,逐字粘贴到项目中每个图像和视频提示词中,这样每一次生成都朝着同一部电影的方向靠拢

因为你不再指望模型理解 "电影感"

你直接递给它一个已经打动了无数人的镜头的精确测量成分

"电影感" 是 AI 视频中最浪费的词,模型已经见过数百万张标注了该词的图像,所以它毫无意义……真正有效的是成对的强化描述:"有依据的暖色照明、35mm 胶片颗粒、浅景深、提亮暗部"

那一段文字决定了下游所有内容的外观

Machina - inline image

阶段 2:永远先有帧,再有运动

永远不要凭想象生成视频

先生成静态帧,直到帧正确,然后动画化胜出的那一帧。因为一帧的成本只是片段的一小部分,只需几秒钟而不是几分钟,所以所有探索都在廉价层完成

帧的通过流程如下:

  • 将同一个镜头概要连同你的风格契约一起输入多个扩散模型并排运行。在同一个界面上这很简单:相同的提示词,五个模型,对比
  • 为每个节拍尝试大量帧:不同的构图、场景内不同的时刻、不同的天气
  • 优化胜出的帧:Nano Banana 用于精细编辑和一致性检查,Soul Cinema 用于照片级角色外观,GPT-Images-2 用于密集的艺术指导
  • 锁定必须保持一致的内容:每个角色的参考表(正面、四分之三、侧面,分别裁剪,因为网格会让视频模型误将面板视为不同的人)、每个服装或状态变化的单独表格、每个场景的多角度表格

如果你不想自己操作,这个阶段也是 Supercomputer 发挥价值的地方:它自行在多个模型上测试相同的概要,查看输出并迭代,无需你监控任何事情

三个比任何工具选择都更重要的帧规则:

  • 物体比面部更能承载情感,因为面部会在不同生成之间漂移,而物体是锁定的。所以当一个故事节拍可以通过撕裂的船帆或断裂的桨而不是表情来实现时,交给物体
  • 一个不可能的东西放在一个普通的地方,就是能让人停下滑动的构图
  • 给角色一个代价:一个人走路是素材,一个人跛行着走向某物是一个故事

然而帧只完成了一半工作,因为一个漂亮的帧如果不动,仍然是劣质内容……

Machina - inline image

阶段 3:Agent 编写镜头脚本

每个镜头都需要一个提示词,而批量编写提示词正是你要委托的工作

我使用 Fable 5 Medium 作为脚本编写者:它读取节拍表和风格契约,用固定的模板为每个镜头编写提示词……场景背景、参考资料、构图、摄影机、灯光、音频、风格锁定,每次都是相同的顺序

锁定,因为镜头之间的一致性来自重复的参考图像和重复的语言,而不是来自种子或运气

脚本遵循的提示词规则,每条都值得单独借鉴:

  • 每个镜头一个动词:"他转身" 生成良好,"他转身、向前走、伸手说话" 会崩溃
  • 五个小动作比一个形容词更好:"茫然凝视、缓慢眨眼、啜饮咖啡、抬头看" 读起来像一个人,"他看起来很困惑" 读起来像一张库存照片
  • 主体运动和相机运动始终用单独的句子描述,因为一个从句同时承载两者会导致每个人都归咎于模型的抖动混乱
  • 仅凭文本生成的提示词长度为 120 到 280 个词,动画化参考图像的提示词保持在 80 个词以下,因为超过这个长度,文本开始与图像冲突,你的角色会漂移
  • 约束保持正面表述:"画面稳定、清晰锐利" 有效,"无模糊、无抖动" 会被忽略
Machina - inline image

阶段 4:运动控制,以及消除静态画面的语法

现在是片段

每个关键帧——你在阶段 2 中构建的锁定静止画面——通过 Seedance 2.0 图像到视频处理,将静止画面变成运动的片段,作为一个独立的 3 到 5 秒镜头。一分钟的电影需要 12 到 16 个这样的片段拼接而成,任何真正的电影都是这样工作的……剪辑师剪辑的是镜头,而不是片段

镜头隔离同时也是保持一致的技巧:身份漂移在连续场景超过 30 秒后就会出现,而独立的节拍永远不会达到这个时长

我的前两次运动尝试以同样的方式失败:人物僵硬地站着,而镜头从旁边漂过,这些片段技术上在动,但肉眼可见什么都没发生

解决方案是一个语法,三个部分,每个图像到视频提示词都需要:

  • 一个命名的相机运动
  • 一个场景内事件:在这五秒钟内发生了一些事情
  • 明确的 "没有僵硬的人物"

相同的关键帧,两个提示词:"缓慢推进,电影感" 会得到一个漂移的静止图像,"缓慢推进,船帆撕裂,船员们手忙脚乱地抓住它" 会得到一部电影

Machina - inline image

两个值得整节介绍的运动技巧:

  • 链式镜头:镜头 N 的最后一帧成为镜头 N+1 的参考帧,这样连续性得以延续,无需重新加载任何角色表
  • 在同一个生成中对高潮部分进行时间编码:[0-4 秒] 广角静态,[4-8 秒] 随着紧张感积累推进,[8-12 秒] 高潮处特写,[12-15 秒] 揭示。这样你在单个片段内部导演了剪辑
Machina - inline image

一个好片段只是一个样本,一部电影需要六十个这样的片段,这是一个体量问题

阶段 5:集群

这个阶段是 Claude Code 真正配得上"工作室"一词的地方

一个协调器会话拥有镜头列表

它按镜头类型生成子 Agent……生物、水面、室内、动作……每个子 Agent 根据风格契约编写自己的提示词,通过 CLI 提交生成任务,轮询作业,并报告成功的成果

因为所有模型都可以从同一个终端调用,集群可以并行处理整个镜头列表,跨越不同模型,而你可以做其他事情

集群的成败取决于一条毫不浪漫的规则……尊重并发上限

视频模型限制了同时运行的作业数量,因此 Agent 会检查正在进行的作业,并且仅在有空闲槽位时提交

一个懂得限流的 Agent 能在一夜之间完成……一个天真的循环会在一个小时内因速率限制而崩溃,这是正确的,上限使得整夜运行变得可预测

集群的迭代纪律:每个镜头 3 到 4 个候选项,然后每次只改变一个变量——相机、灯光或速度——绝不重写整个提示词,因为一次改变五个地方的失败不会教会你任何东西

Agent 记录每一次生成:提示词、模型、结果、保留或淘汰

你的制作变成了一个数据库,而第二个制作从第一个所学的所有经验开始

Machina - inline image

阶段 6:将蒙太奇变成代码

组装比你想象的要简单

  • 先做音乐:根据剪辑的情感弧线(而不是情绪)简要描述配乐——建立、高潮、平静、解决——一次性生成,然后根据配乐调整剪辑
  • 剪辑本身就是一个文本文件:每行一个片段,包含其时长和音频标志。ffmpeg——Claude Code 已经知道如何驱动的免费命令行视频工具——读取该文件并渲染影片

文件中的每一行都是一个镜头名称、保留的秒数和音频标志……在我上一个剪辑的文件中,17-scylla-deck 的音频被标记为静音,因为它生成的喊叫声与弦乐冲突;而两行之后的海浪环境音保持启用,因为它增强了场景的真实感

逐片段音频在正好与配乐冲突的地方被静音,在增加真实感的地方保留

这意味着整个编辑过程是可复现的,并且在几秒钟内就可更改,无需时间线软件,无需剪辑师

  • 只在最后对成品剪辑进行一次放大,永远不要对单个片段进行放大
  • 探索时生成 720p,保留时用 1080p,只有最终母版才用 4K。在能回答你问题的最低分辨率处停下来

如果从终端驱动 ffmpeg 和放大器的流水线超出了你的需求,这个阶段也是 Supercomputer 的领地:将成功的片段交给它,它会自行组装剪辑并渲染 4K 母版

最后的剪辑是一种坦诚:任何会让你忍不住想查看手机的片段都会删除,不管它花了你多少钱

Machina - inline image

这套系统真正的用途是什么

电影只是演示……系统才是资产

同样的六个阶段可以制作产品广告、批量用户生成内容、品牌影片、发布视频,因为流水线中没有任何部分知道自己是在制作电影

一个现成的系统在速度上取胜:当某个热点在你的细分领域出现时,窗口期以小时计,一个拥有风格契约、锁定角色和生成集群的操作员,在其他人还在打开标签页时就已经发布了

整个构建,压缩版:

  1. 使用视觉模型从真实电影中提取风格契约
  2. 在多个扩散模型上批量生成帧,优化,将角色和场景锁定到表格中
  3. Fable 5 Medium 从单个锁定模板编写每个镜头的提示词
  4. Seedance 2.0 将关键帧动画化为独立的 3-5 秒片段:相机运动 + 事件 + 无僵硬人物
  5. 子 Agent 通过 Higgsfield CLI 并行执行生成任务,限流并记录
  6. 配乐,从文本文件用 ffmpeg 剪辑,一次放大母版

跳过阶段 1,其他所有阶段都会产生漂亮的画面,但什么也表达不了

这套系统的第一部电影花了一个晚上的时间……你从安装 CLI 的那天晚上就可以开始……

或者免费试用 Higgsfield Supercomputer (Higgsfield AI 赞助了本文,但这东西确实令人印象深刻)——它能够自主工作,从规划镜头、编写提示词、选择模型到最终制作

每个读到这篇文章的人都可以租用相同的模型,所以电影的质量完全取决于你输入系统的内容

品味输入,电影输出

二次创作

使用 YouMind 创作爆款文章

收集素材、拆解爆点、生成视觉资产、撰写内容,并在一个 AI 工作空间里完成分发。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章