Tôi đã biến Claude Code thành một studio phim hoạt động và tôi sẽ trao cho bạn toàn bộ hệ thống: kỹ năng, lời nhắc, vòng lặp, và quy trình sản xuất sáu giai đoạn kết nối chúng lại với nhau
mỗi giai đoạn dựa vào một phần khác nhau của bộ khung: kỹ năng cho các mô hình, tác nhân phụ cho khối lượng, bash cho việc cắt ghép, và các vòng lặp được thiết kế cho mọi thứ lặp đi lặp lại
hôm nay, tôi sẽ dạy bạn sản xuất phim ngắn như thế này bằng Higgsfield Supercomputer, Claude Code và Seedance 2.0:

đây là những gì có trong bài viết này:
- động cơ: mọi mô hình trên một nền tảng, và hai cách truy cập
- giai đoạn 1: trích xuất một hợp đồng phong cách từ điện ảnh thực tế
- giai đoạn 2: khung hình ở khối lượng lớn, nhân vật và địa điểm được khóa
- giai đoạn 3: tác nhân viết lời nhắc cho từng cảnh quay
- giai đoạn 4: chuyển động, và ngữ pháp loại bỏ các cảnh đông cứng
- giai đoạn 5: đội tàu tác nhân phụ chạy tạo sinh song song
- giai đoạn 6: nhạc nền, dựng phim từ một tệp văn bản, master 4K
nếu bạn muốn bộ công cụ sản xuất đầy đủ đằng sau bài viết này, bảng lời nhắc, kinh thánh phong cách và các bản tóm tắt tác nhân sẵn sàng chạy, đó là những gì cộng đồng AI ops thời gian thực tại weeklyaiops.com dành cho
tại sao vòng lặp là sản phẩm
một cảnh quay chuyên nghiệp từng là một canh bạc, bởi vì mỗi lần thử đều tốn tiền thật và ngày thật, vì vậy không ai thử nghiệm và mọi thứ đều trông giống nhau
video AI đã thu gọn vòng lặp đó: mô tả một cảnh quay, tạo nó trong vài phút, xem nó, thay đổi ba từ, tạo lại
chi phí thử nghiệm đã giảm xuống đến mức thử mọi thứ trở thành chiến lược
nhưng một vòng lặp thu gọn chỉ có lợi nếu có thứ gì đó chạy nó cho bạn, bởi vì năm mươi chu kỳ cho mỗi cảnh quay qua hai mươi cảnh quay là một nghìn quyết định, và một con người nhấp nút tạo một nghìn lần là một người vận hành rất mệt mỏi, và công việc vẫn cho ra sản phẩm kém chất lượng
vì vậy hệ thống chia công việc làm hai:
- bạn sở hữu gu thẩm mỹ: khung hình nào cảm thấy đúng, cảnh quay nào sống sót, bộ phim muốn trở thành gì
- tác nhân sở hữu năng suất: viết lời nhắc, gửi yêu cầu tạo sinh, kiểm tra trạng thái công việc, thử lại các lỗi, lắp ráp các đoạn cắt
tên gọi cho kỹ năng này trên dòng thời gian hiện tại là kỹ thuật vòng lặp, và chúng tôi đang sử dụng nó cho thiết lập này

một vòng lặp tác nhân là một công việc mà tác nhân lặp lại cho đến khi một điều kiện được đáp ứng, và quá trình sản xuất này là các vòng lặp lồng nhau sâu ba cấp:
- vòng lặp cảnh quay: tạo, xem, thay đổi một biến, tạo lại, cho đến khi cảnh quay xứng đáng có vị trí của nó
- vòng lặp đội tàu: duyệt danh sách cảnh quay, gửi bất cứ nơi nào có khe trống, thu thập những cảnh thắng cuộc
- vòng lặp phiên: ghi lại mọi lần tạo sinh, để quá trình sản xuất tiếp theo bắt đầu từ mọi thứ mà quá trình này đã học
bạn thiết kế các vòng lặp một lần và tác nhân chạy chúng suốt đêm, đó là sự khác biệt giữa việc sử dụng một mô hình và vận hành một studio
mọi "bộ phim do tác nhân tạo ra" bạn sẽ thấy, bao gồm cả bộ phim này, đều phân chia chính xác theo cách này: tác nhân lên kế hoạch, viết lời nhắc và thử lại, con người chọn lọc và chỉ đạo
không ai đã cho thấy một bộ phim có thể xem được do tác nhân tạo ra từ đầu đến cuối mà không có con người tham gia, và hệ thống dưới đây không giả vờ là một bộ phim như vậy
tạo sinh rẻ tiền không làm cho video tốt trở nên dễ dàng... nó đã chuyển toàn bộ công việc vào gu thẩm mỹ
mọi thứ tiếp theo đều được xây dựng xung quanh câu nói đó

động cơ: một nền tảng, hai cánh cửa
quá trình sản xuất này chạm đến các mô hình hình ảnh, mô hình video, tạo nhạc và nâng cấp độ phân giải, bước nâng cảnh quay đã hoàn thiện lên 4K, điều này thường có nghĩa là năm gói đăng ký, năm tab, năm hàng đợi kết xuất, và năm nơi để làm mất một tệp
higgsfield đặt hầu hết mọi mô hình trên một bề mặt, đằng sau một lần đăng nhập và một nhóm tín dụng duy nhất, và toàn bộ nền tảng được xây dựng cho việc sử dụng tác nhân, chính xác những gì hệ thống này cần, bởi vì một tác nhân không thể điều khiển năm lần đăng nhập riêng biệt
có hai cánh cửa để vào:
- supercomputer là cánh cửa dễ dàng: một tác nhân chạy trên chính nền tảng, lên kế hoạch sản xuất của bạn, tự động chọn mô hình tốt nhất cho từng nhiệm vụ, và cắt ghép các cảnh của bạn, bạn mô tả những gì bạn muốn và nó xử lý việc định tuyến, và nó chạy trên các kỹ năng giống như cách claude code làm, vì vậy nếu bạn không sống trong terminal, hãy bắt đầu ở đây
- CLI là cánh cửa kiểm soát: nó làm cho mọi mô hình có thể truy cập được từ claude code hoặc bất kỳ bộ khung nào bạn đã chạy, điều đó có nghĩa là tác nhân của bạn nắm giữ toàn bộ quy trình, những gì được tạo ra, khi nào, với mô hình nào, theo thứ tự nào
và nếu bạn mới làm quen với video AI và không biết một cảnh quay tốt cần bao nhiêu lần lặp, supercomputer không tốn gì để chạy: lập kế hoạch, thử nghiệm và làm lại không tiêu tốn tín dụng, bạn chỉ trả tiền khi kết xuất video cuối cùng, vì vậy gói miễn phí bao gồm tất cả việc khám phá
thiết lập CLI là ba lệnh:
- npm install -g @higgsfield/cli
- higgsfield auth login
- npx skills add higgsfield-ai/skills
gói kỹ năng dạy claude code khi nào nên sử dụng mô hình nào, cách giữ cho các nhân vật nhất quán, và cách gửi và kiểm tra trạng thái công việc, vì vậy từ thời điểm này terminal của bạn là studio
một lệnh gửi bất kỳ mô hình nào và chờ kết quả:
- higgsfield generate create seedance_2_0 --prompt "slow dolly in as the sail tears loose" --start-image ./frame.png --duration 5 --resolution 1080p --wait
đổi tên mô hình và cùng một hình thức bao phủ toàn bộ quá trình sản xuất: gpt_image_2 cho khung hình, nano_banana_2 cho chỉnh sửa nhân vật, sonilo_music với --duration cho nhạc nền, bộ nâng cấp cho master 4K
các cờ mang quy trình:
- --start-image đặt khung hình đầu tiên cho image-to-video, và một đường dẫn tệp cục bộ tự động tải lên
- --end-image khóa khung hình cuối cùng, đó là cách các cảnh quay chuỗi kết nối
- --wait chặn cho đến khi clip hoàn tất và in url kết quả, và --json làm cho đầu ra có thể đọc được cho tác nhân
- higgsfield model list --json hiển thị mọi mô hình bạn có thể gọi, và higgsfield model get seedance_2_0 --json hiển thị các cài đặt chính xác mà một mô hình chấp nhận
và chạy tất cả từ claude code chỉ cần một tệp văn bản, không phải một tích hợp:
- viết các quy tắc định tuyến vào CLAUDE.md của dự án: mô hình nào cho loại công việc nào, thang độ phân giải, giới hạn đồng thời
- tác nhân đọc các quy tắc một lần và mọi tác nhân phụ nó tạo ra đều kế thừa chúng
- các lần tạo sinh được gửi qua bash, được kiểm tra bằng higgsfield generate get, và được ghi lại vào một tệp cho mỗi lần chạy
mọi thứ dưới đây đều chạy qua cánh cửa đó

giai đoạn 1: trích xuất gu thẩm mỹ từ điện ảnh, đừng phát minh ra nó
cách nhanh nhất để mang gu thẩm mỹ vào video AI là ngừng mô tả tâm trạng từ trí tưởng tượng và bắt đầu trích xuất chúng từ những cảnh quay đã thành công với hàng triệu người
nguồn của bạn, hãy đánh dấu những trang này:
- frameset.app cho ảnh tĩnh phim và video, có thể tìm kiếm theo ống kính, ánh sáng, chuyển động
- shotdeck.com và fancaps.net cho ảnh tĩnh từng khung hình từ hầu hết mọi bộ phim
- savee.com và cosmos.so cho hình ảnh và bảng tâm trạng
- eyecannndy.com cho các chuyển cảnh và kỹ thuật máy quay
chọn năm đến mười cảnh quay mang cảm xúc chính xác bạn muốn
sau đó thực hiện thao tác trích xuất: cung cấp mỗi cảnh quay cho một mô hình thị giác như Gemini 3.1 Pro và yêu cầu nó đặt tên cho các tham số của cảnh quay một cách cực kỳ chi tiết... cảm giác ống kính, hướng và nguồn ánh sáng, bảng màu, hạt, độ tương phản, phân cảnh, bầu không khí, dấu hiệu thời đại
đầu ra trở thành thứ tôi gọi là hợp đồng phong cách: một đoạn văn cố định về ngôn ngữ thị giác được dán vào mọi lời nhắc hình ảnh và video cho dự án, từng chữ một, để mọi lần tạo sinh đều hướng về cùng một bộ phim
bởi vì bạn không còn hy vọng một mô hình hiểu "cinematic"
bạn đang trao cho nó các thành phần đo lường được của một cảnh quay đã từng lay động con người
"cinematic" một mình là từ bị lãng phí nhất trong video AI, các mô hình đã thấy hàng triệu hình ảnh được gắn thẻ với nó, vì vậy nó chẳng có nghĩa lý gì... các cặp củng cố mới là thứ hiệu quả: "motivated warm lighting, 35mm grain, shallow depth of field, lifted blacks"
một đoạn văn đó quyết định mọi thứ phía sau trông như thế nào

giai đoạn 2: khung hình trước chuyển động, luôn luôn
không bao giờ tạo video từ trí tưởng tượng
tạo các khung hình tĩnh cho đến khi khung hình đúng, sau đó làm hoạt hình khung hình thắng cuộc, bởi vì một khung hình chỉ tốn một phần nhỏ chi phí của một clip và mất vài giây thay vì vài phút, vì vậy tất cả việc khám phá của bạn xảy ra ở lớp rẻ
bước khung hình trông như thế này:
- chạy cùng một bản tóm tắt cảnh quay qua một số mô hình khuếch tán song song với hợp đồng phong cách của bạn được đính kèm, và trên một bề mặt, điều này rất đơn giản: cùng một lời nhắc, năm mô hình, so sánh
- thử RẤT NHIỀU khung hình cho mỗi nhịp, các bố cục khác nhau, các khoảnh khắc khác nhau bên trong cảnh, thời tiết khác nhau
- tinh chỉnh những khung hình thắng cuộc: Nano Banana cho các chỉnh sửa phẫu thuật và các lần chuyển nhất quán, Soul Cinema cho các diện mạo nhân vật nhiếp ảnh, GPT-Images-2 cho chỉ đạo nghệ thuật dày đặc
- khóa những gì phải giữ nguyên: một bảng tham chiếu cho mỗi nhân vật (mặt chính diện, ba phần tư, mặt nghiêng, được cắt riêng, vì các lưới làm các mô hình video bối rối khi đọc các bảng như những người khác nhau), một bảng riêng cho mỗi thay đổi trang phục hoặc trạng thái, các bảng nhiều góc cho mỗi địa điểm
bước này cũng là nơi supercomputer thể hiện giá trị của nó nếu bạn không muốn tự điều khiển: nó tự động kiểm tra cùng một bản tóm tắt qua các mô hình, xem đầu ra và lặp lại mà bạn không cần giám sát bất cứ điều gì
ba quy tắc khung hình quyết định nhiều hơn bất kỳ lựa chọn công cụ nào:
- đồ vật truyền tải cảm xúc tốt hơn khuôn mặt, bởi vì khuôn mặt thay đổi giữa các lần tạo sinh còn đồ vật thì cố định, vì vậy khi một nhịp câu chuyện có thể rơi vào một cánh buồm rách hoặc một mái chèo gãy thay vì một biểu cảm, hãy giao nó cho đồ vật
- một điều không thể ở một nơi bình thường là bố cục ngăn dừng cuộn
- cho nhân vật một cái giá phải trả: một nhân vật đi bộ là cảnh quay, một nhân vật đi khập khiễng về phía thứ gì đó là một câu chuyện
nhưng các khung hình chỉ là một nửa công việc, bởi vì một khung hình đẹp không chuyển động vẫn là rác...

giai đoạn 3: tác nhân viết kịch bản cảnh quay
mỗi cảnh quay cần một lời nhắc, và viết lời nhắc ở khối lượng lớn chính xác là công việc bạn ủy thác
tôi sử dụng Fable 5 Medium làm người viết kịch bản: nó lấy bảng nhịp và hợp đồng phong cách và viết lời nhắc của mỗi cảnh quay trong một mẫu cố định... bối cảnh cảnh, tham chiếu, phân cảnh, máy quay, ánh sáng, âm thanh, khóa phong cách, cùng một thứ tự mỗi lần
cố định, bởi vì sự nhất quán giữa các cảnh quay đến từ các hình ảnh tham chiếu lặp lại và ngôn ngữ lặp lại, không bao giờ từ các hạt giống hoặc may mắn
các quy tắc lời nhắc mà kịch bản tuân theo, mỗi quy tắc đáng lấy riêng:
- một động từ cho mỗi cảnh quay: "anh ta quay đầu" tạo ra kết quả, "anh ta quay đầu, bước tới, đưa tay ra và nói" sụp đổ
- năm hành động nhỏ hiệu quả hơn một tính từ: "nhìn vô hồn, chớp mắt chậm, nhấp một ngụm cà phê, ngước lên" đọc như một con người, "anh ta trông bối rối" đọc như một bức ảnh có sẵn
- chuyển động của chủ thể và chuyển động của máy quay luôn được đặt trong các câu riêng biệt, bởi vì một mệnh đề mang cả hai là cách bạn có được thứ lộn xộn run rẩy mà mọi người đổ lỗi cho mô hình
- lời nhắc tạo từ văn bản một mình chạy từ 120 đến 280 từ, lời nhắc làm hoạt hình một hình ảnh tham chiếu giữ dưới 80 từ, bởi vì quá đó văn bản bắt đầu chống lại hình ảnh và nhân vật của bạn trôi
- các ràng buộc giữ nguyên tích cực: "hình ảnh ổn định, độ nét sắc nét" hiệu quả, "không mờ, không rung" bị bỏ qua

giai đoạn 4: chuyển động, và ngữ pháp loại bỏ các cảnh đông cứng
bây giờ đến các clip
mỗi khung hình chính, khung hình tĩnh đã khóa bạn xây dựng ở giai đoạn 2, đi qua Seedance 2.0 image-to-video, biến khung hình tĩnh đó thành một clip chuyển động, như một cảnh quay độc lập từ 3 đến 5 giây, và một phút phim là 12 đến 16 cảnh quay như vậy được ghép nối, đó là cách mọi bộ phim thực tế hoạt động... một biên tập viên cắt các cảnh quay, không phải các đoạn quay
sự độc lập của cảnh quay cũng là mẹo nhất quán: sự trôi dạt nhận dạng xuất hiện sau 30 giây của cảnh liên tục, và các nhịp độc lập không bao giờ đạt đến điều đó
hai lần chuyển động đầu tiên của tôi thất bại theo cùng một cách: các nhân vật đứng đông cứng trong khi máy quay trôi qua họ, các clip về mặt kỹ thuật chuyển động nhưng không làm gì cả
giải pháp là một ngữ pháp, ba phần, mọi lời nhắc image-to-video:
- một chuyển động máy quay được đặt tên
- một sự kiện trong cảnh: điều gì đó XẢY RA trong năm giây
- một "không có nhân vật đông cứng" rõ ràng
cùng một khung hình chính, hai lời nhắc: "slow dolly in, cinematic" cho bạn một hình ảnh tĩnh trôi, "slow dolly in as the sail tears loose and the crew scrambles to catch it" cho bạn một bộ phim

hai kỹ thuật chuyển động đáng giá cả phần:
- cảnh quay chuỗi: khung hình cuối cùng của cảnh N trở thành khung hình tham chiếu của cảnh N+1, để sự liên tục được duy trì mà không cần tải lại một bảng nhân vật nào
- đánh dấu thời gian cao trào bên trong một lần tạo sinh: [0-4s] rộng và tĩnh, [4-8s] đẩy vào khi căng thẳng xây dựng, [8-12s] cận cảnh ở đỉnh điểm, [12-15s] tiết lộ, để bạn chỉ đạo các đường cắt bên trong một clip duy nhất

một clip tốt chỉ là một mẫu, một bộ phim cần sáu mươi clip như vậy, và đó là một vấn đề về khối lượng
giai đoạn 5: đội tàu
đây là giai đoạn claude code xứng đáng với từ studio
một phiên điều phối sở hữu danh sách cảnh quay
nó tạo ra các tác nhân phụ theo nhóm cảnh quay... sinh vật, nước, nội thất, hành động... và mỗi tác nhân phụ tự viết lời nhắc của mình từ hợp đồng phong cách, gửi các lần tạo sinh của nó qua CLI, kiểm tra các công việc của nó và báo cáo lại những cảnh thắng cuộc
bởi vì mọi mô hình đều có thể truy cập từ cùng một terminal, đội tàu bao phủ toàn bộ danh sách cảnh quay song song, qua các mô hình, trong khi bạn làm việc khác
đội tàu sống hoặc chết dựa trên một quy tắc không hào nhoáng... tôn trọng tính đồng thời
các mô hình video giới hạn số lượng công việc chạy cùng lúc, vì vậy tác nhân kiểm tra các công việc đang hoạt động và chỉ gửi khi có một khe trống
một tác nhân điều tiết hoàn thành trong một đêm... một vòng lặp ngây thơ chết vì giới hạn tốc độ sau một giờ, điều này đúng, giới hạn là thứ làm cho lần chạy qua đêm có thể dự đoán được
kỷ luật lặp cho đội tàu: 3 đến 4 ứng viên cho mỗi cảnh quay, sau đó thay đổi MỘT biến cho mỗi lần... máy quay, ánh sáng hoặc tốc độ, không bao giờ viết lại hoàn toàn, bởi vì một thất bại mà bạn thay đổi năm thứ không dạy bạn điều gì
và tác nhân ghi lại mọi lần tạo sinh: lời nhắc, mô hình, kết quả, giữ lại hay loại bỏ
quá trình sản xuất của bạn trở thành một cơ sở dữ liệu, và lần sản xuất thứ hai bắt đầu từ mọi thứ lần thứ nhất học được

giai đoạn 6: dựng phim như mã
việc lắp ráp nhỏ hơn bạn nghĩ
- nhạc trước: tóm tắt nhạc nền dựa trên cung bậc cảm xúc của phần cắt theo các chuyển động, không phải tâm trạng (xây dựng, cao trào, lắng xuống, giải quyết), được tạo trong một lần, sau đó cắt phần cắt theo nhạc
- bản thân phần cắt là một tệp văn bản: một dòng cho mỗi clip với thời lượng của nó và một cờ âm thanh, và ffmpeg, công cụ video dòng lệnh miễn phí mà claude code đã biết cách điều khiển, đọc tệp và kết xuất phim
mỗi dòng của tệp đó là tên cảnh quay, số giây cần giữ, và một cờ âm thanh... 17-scylla-deck nằm trong tệp phần cắt cuối cùng của tôi với cờ âm thanh tắt tiếng, bởi vì tiếng hét được tạo của nó đã đụng độ với các dây đàn, và âm thanh biển hai dòng sau đó vẫn hoạt động vì nó bán được cảnh
âm thanh trên mỗi clip bị tắt tiếng chính xác ở nơi nó xung đột với nhạc nền, được giữ ở mọi nơi nó thêm tính chân thực
có nghĩa là toàn bộ bản chỉnh sửa có thể tái tạo và thay đổi trong vài giây, không cần phần mềm timeline, không cần biên tập viên
- nâng cấp độ phân giải một lần, cuối cùng, trên phần cắt đã hoàn thiện, không bao giờ trên các clip riêng lẻ
- tạo ở 720p khi khám phá, 1080p cho các cảnh giữ lại, 4K chỉ cho master cuối cùng, và bạn dừng lại ở độ phân giải thấp nhất trả lời câu hỏi bạn đang hỏi
nếu việc điều khiển ffmpeg và bộ nâng cấp từ terminal là quá nhiều quy trình so với bạn muốn, giai đoạn này cũng là lãnh địa của supercomputer: giao cho nó các clip chiến thắng và nó lắp ráp phần cắt và kết xuất master 4K
và bước cắt cuối cùng là sự trung thực tuyệt đối: bất kỳ clip nào bạn sẽ kiểm tra điện thoại sẽ bị xóa, bất kể nó tốn bao nhiêu

hệ thống này thực sự dùng để làm gì
bộ phim là bản demo... hệ thống là tài sản
sáu giai đoạn tương tự tạo ra quảng cáo sản phẩm, nội dung do người dùng tạo ở khối lượng lớn, phim thương hiệu, video ra mắt, bởi vì không có gì trong quy trình biết nó đang làm phim
và một hệ thống đứng vững luôn thắng về tốc độ: khi một khoảnh khắc chạm đến ngách của bạn, cửa sổ được tính bằng giờ, và một người vận hành với hợp đồng phong cách, các nhân vật đã khóa và một đội tàu tạo sinh sẽ xuất bản trong khi những người khác đang mở tab
toàn bộ quá trình xây dựng, được nén lại:
- trích xuất một hợp đồng phong cách từ điện ảnh thực tế bằng mô hình thị giác
- tạo khung hình ở khối lượng lớn qua một số mô hình khuếch tán, tinh chỉnh, khóa nhân vật và địa điểm thành các bảng
- Fable 5 Medium viết lời nhắc cho mọi cảnh quay từ một mẫu cố định
- Seedance 2.0 làm hoạt hình các khung hình chính như các cảnh quay độc lập 3-5s: chuyển động máy quay + sự kiện + không có nhân vật đông cứng
- các tác nhân phụ chạy các lần tạo sinh song song qua CLI higgsfield, được điều tiết, được ghi lại
- nhạc nền, cắt từ một tệp văn bản bằng ffmpeg, nâng cấp master một lần
bỏ qua giai đoạn 1 và mọi giai đoạn khác tạo ra cảnh quay đẹp nhưng chẳng có gì đặc biệt
bộ phim đầu tiên từ hệ thống này mất một phiên qua đêm... bộ phim của bạn bắt đầu vào buổi tối bạn cài đặt CLI...
hoặc dùng thử miễn phí Higgsfield Supercomputer (Higgsfield AI tài trợ cho bài viết này, nhưng thứ này thực sự ấn tượng) - nó có thể hoạt động tự động từ lập kế hoạch cảnh quay, viết lời nhắc, chọn mô hình đến sản xuất cuối cùng
mọi người đọc bài này đều có thể thuê các mô hình tương tự, vì vậy bộ phim chỉ tốt như những gì bạn cung cấp cho hệ thống
gu thẩm mỹ vào, phim ra





