Tự động hóa chỉnh sửa video với Codex: Hướng dẫn từng bước về quy trình làm việc trên Douyin giúp tôi kiếm hơn 7.000 USD

@xilo2991
TIẾNG TRUNG2 tuần trước · 05 thg 7, 2026
1.6M
3.2K
622
83
5.7K

TL;DR

Hướng dẫn chi tiết này giải thích quy trình làm việc dựa trên AI sử dụng Codex để tự động hóa việc chỉnh sửa video cho mạng xã hội bằng cách phân tích các video tham khảo thịnh hành và kết hợp chúng với các tài nguyên cục bộ.

Tôi đã sử dụng quy trình chỉnh sửa này hơn hai tháng và đã lặp lại không dưới 10 phiên bản. Trong bài viết này, tôi sẽ giải thích quy trình hoàn chỉnh và chi tiết một cách rõ ràng nhất có thể cho các bạn.

Bạn có thể theo dõi logic của bài viết hoặc gửi trực tiếp bài viết này cho Codex để AI tạo một Skill cho bạn.

Chào các bạn, tôi đến để gửi bản nháp đây!

Tuần trước, tôi đã viết một bài giới thiệu về Codex và rất biết ơn sự ủng hộ—nó đã đạt hơn một triệu lượt xem.

https://x.com/xilo2991/status/2070051136187621452

Lúc đó, nhiều bạn hỏi liệu tôi có thể chia sẻ quy trình chỉnh sửa tự động được đề cập trong bài viết không.

Tất nhiên rồi. Hôm nay, tôi ở đây để trò chuyện với các bạn về cách đạt được chỉnh sửa tự động với Codex để tối đa hóa hiệu quả tạo video.

Logic Nền Tảng Của Quy Trình

Dù bạn đang làm nội dung hay thương mại điện tử, cách dễ nhất để có được lượng truy cập nhanh là sao chép các hit lan truyền.

Bởi vì các hit lan truyền là nội dung đã được thị trường xác nhận, miễn là bạn theo kịp đủ nhanh, lượng truy cập nhìn chung sẽ không tệ. (Tất nhiên, hãy chú ý đến sự khác biệt giữa sao chép và đạo văn.)

Cốt lõi của quy trình này là sao chép các hit lan truyền.

Giả sử bạn thấy một video lan truyền và muốn tạo video của riêng mình theo nhịp điệu và cấu trúc đó. Cách truyền thống là tự vào CapCut (Jianying) và ghép từng khung hình với video tham chiếu, tìm tài liệu, căn thời gian và căn chỉnh phụ đề. Một video có thể mất hai hoặc ba giờ.

Nhưng với quy trình này, bạn chỉ cần chuẩn bị video tham chiếu và thư viện tài liệu của riêng mình; Codex có thể tự động hoàn thành phần còn lại.

Codex sẽ tự động xác định mọi chuyển cảnh trong video tham chiếu, tìm tài liệu phù hợp nhất từ thư viện của bạn, tự động tạo giọng đọc và phụ đề, và cuối cùng cung cấp cho bạn một bản nháp CapCut mà bạn có thể mở và chỉnh sửa.

Toàn bộ quá trình có thể chỉ mất vài phút.

Tôi chủ yếu sử dụng quy trình này khi làm video sản phẩm Douyin.

Trước Codex, tôi chỉ có thể chỉnh sửa tối đa 6 video mỗi ngày. Nhưng với Codex, tôi chỉ cần tìm các video lan truyền phù hợp làm tham chiếu và chuẩn bị tài liệu sản phẩm. Phần còn lại là tạo tự động, xem xét và tinh chỉnh.

Tôi có thể dễ dàng hoàn thành 30 video mỗi ngày, hiệu suất tăng ít nhất năm lần.

xilo - inline image

Nhưng hãy nói rõ: vị trí của quy trình này là sản xuất tự động, không phải sáng tạo cao cấp.

Nó phù hợp với các video kiểu mashup yêu cầu ghép nhiều đoạn, chẳng hạn như thương mại điện tử, tiếp thị hoặc Vlog mashup.

Video tham chiếu cung cấp cấu trúc và nhịp điệu, thư viện tài liệu của bạn cung cấp hình ảnh, giọng đọc và phụ đề được tạo tự động, và video cuối cùng được sản xuất tự động.

Nếu bạn muốn tạo nội dung gốc chất lượng cao yêu cầu ngôn ngữ điện ảnh rất chính xác, chuyển cảnh phức tạp và biểu cảm cảm xúc tinh tế, quy trình này có thể không phù hợp.

Bởi vì logic ghép tự động hiện tại chưa thể đạt được sự hiểu ngữ nghĩa và kiểm soát cảm xúc chính xác như vậy.

Tôi cũng đang nghiên cứu cách tối ưu hóa quy trình này cho video gốc và sẽ chia sẻ với các bạn khi nó ổn định.

Chuẩn Bị Quy Trình

OK, quay lại quy trình chỉnh sửa tự động. Dưới đây, tôi sẽ giải thích từng bước cách xây dựng quy trình này. Trước khi bắt đầu, bạn cần chuẩn bị hai thứ.

1. Cài Đặt Các Công Cụ Tương Ứng

Quy trình này dựa trên Codex, vì vậy trước tiên bạn cần có Codex. Nếu bạn chưa sử dụng, hãy xem bài giới thiệu của tôi tuần trước.

Cụ thể, quy trình này yêu cầu các công cụ cốt lõi sau:

  • FFmpeg: Được sử dụng cho các thao tác cơ bản như tách, ghép và chuyển đổi định dạng video. Đây là nền tảng và phải được cài đặt.
  • Môi trường Python: Vì toàn bộ quy trình được viết bằng Python, bạn cần ít nhất Python 3.8.
  • Công cụ giọng đọc: Nếu bạn muốn giọng đọc tự động, ổn định nhất là mô hình giọng nói Doubao của ByteDance; nếu bạn muốn sao chép giọng nói, hãy sử dụng VoxCPM, một công cụ mã nguồn mở miễn phí.
  • CapCut (Jianying): Bản nháp cuối cùng được tạo ở định dạng CapCut, vì vậy bạn cần cài đặt phiên bản desktop.

Trong số đó, FFmpeg và Python là các phụ thuộc cốt lõi.

Bạn có thể sao chép văn bản sau đây vào Codex để giúp bạn kiểm tra môi trường và cài đặt các công cụ còn thiếu:

text
1Vui lòng giúp tôi kiểm tra môi trường cần thiết cho chỉnh sửa video tự động:
2
31. Kiểm tra xem FFmpeg đã được cài đặt chưa; nếu chưa, hãy giúp tôi cài đặt.
42. Kiểm tra xem phiên bản Python có >= 3.8 không; nếu chưa, hãy giúp tôi cài đặt hoặc nâng cấp.
53. Kiểm tra xem CapCut (Jianying) Professional đã được cài đặt chưa; nếu chưa, hãy cho tôi biết liên kết tải xuống.
64. Cài đặt các phụ thuộc Python: opencv-python, numpy, pillow
7
8Sau khi kiểm tra, hãy cho tôi biết những gì đã sẵn sàng và những gì tôi cần xử lý thủ công.

Đối với giọng đọc, tùy thuộc vào nhu cầu của bạn. Nếu bạn đang làm video thương mại điện tử, mô hình giọng nói Doubao là ổn định nhất. Nó sử dụng cùng giọng nói AI với CapCut. Giá thấp—tạo video dài 1 phút tốn khoảng 0,4-0,8 RMB.

Nếu bạn muốn sử dụng giọng nói của riêng mình hoặc sao chép giọng của người khác, hãy sử dụng VoxCPM. Tìm liên kết trên GitHub và gửi cho Codex để cài đặt.

2. Tạo Thư Mục

Sau khi cài đặt những thứ này, bạn cần tạo một thư mục dự án. Tôi thường tổ chức như thế này:

text
1Thư mục Dự án/
2 assets/ # Thư viện tài liệu của bạn
3 work/ # Khu vực làm việc, tạo thư mục ngày cho mỗi lần chỉnh sửa
4 final/ # Sản phẩm cuối cùng
5 AGENTS.md # Tệp cấu hình dự án

Thư mục assets là thư viện của bạn. Đặt tất cả các tài liệu có thể hữu ích vào đó. Chúng có thể do AI tạo hoặc do bạn quay, nhưng chúng nên được chuẩn bị trước như các tài sản có thể tái sử dụng.

Tài liệu có thể được phân loại theo ngoại hình, chức năng hoặc bối cảnh.

Thư mục work dành cho các dự án đang hoạt động. Mỗi khi bạn tạo một video mới, hãy tạo một thư mục ngày như 2026-07-05 và đặt video tham chiếu, tệp trung gian và bản nháp cuối cùng vào đó.

AGENTS.md là tệp cấu hình chứa mục tiêu dự án, thông số kỹ thuật đầu ra và tiêu chí chấp nhận. Điều này rất quan trọng vì Codex sử dụng nó để hiểu nhu cầu của bạn.

xilo - inline image

PS: Tệp AGENTS của riêng tôi hơi dài, vì vậy tôi đặt nó ở cuối để tham khảo.

Xây Dựng Quy Trình Chỉnh Sửa

1. Giải Mã Video Tham Chiếu

Mục tiêu cốt lõi ở đây là tách video tham chiếu thành các cảnh quay độc lập và trích xuất khung hình chính cho mỗi cảnh làm cơ sở cho việc ghép tài liệu.

Tìm một video bạn muốn tham khảo. Tải xuống, đặt nó trong thư mục work và đặt tên rõ ràng.

Sau đó gửi nội dung này cho Codex:

text
1Tôi cần giải mã một video tham chiếu.
2
3Vị trí video tham chiếu: @(nhập tên tệp của bạn)
4
5Vui lòng giúp tôi:
61. Sử dụng FFmpeg để xác định chuyển cảnh (thông qua phân tích chênh lệch giữa các khung hình).
72. Trích xuất khung hình chính cho mỗi cảnh và lưu dưới dạng hình ảnh.
83. Trích xuất riêng bản âm thanh.
94. Tạo tệp recipe.json ghi lại thời gian bắt đầu, thời gian kết thúc, thời lượng và đường dẫn khung hình chính cho mỗi cảnh.
105. Nếu có văn bản, hãy tạo kịch bản giọng đọc dựa trên âm thanh, được phân đoạn theo cảnh.
11
12Sau khi hoàn thành, hãy làm theo yêu cầu của AGENTS.md, lưu vào thư mục tương ứng và cho tôi biết có bao nhiêu cảnh đã được xác định.

Tệp recipe.json này là cốt lõi của toàn bộ quy trình.

xilo - inline image

Sau khi giải mã, bạn sẽ thấy nhiều clip video nhỏ và ảnh chụp màn hình. Kiểm tra xem việc tách có hợp lý không. Nếu không, bạn có thể yêu cầu Codex điều chỉnh.

2. Lọc và Ghép Tài Liệu

Bước này là quan trọng nhất và thể hiện giá trị của tự động hóa.

Theo cách truyền thống, bạn sẽ tìm kiếm thư viện của mình từng cảnh một. Với quy trình này, bạn chỉ cần cho Codex biết thư viện của bạn ở đâu và nó thực hiện ghép hình ảnh.

Lời nhắc cho Codex:

text
1Tôi cần ghép và thay thế tài liệu từ thư viện.
2
3Thông tin dự án:
4- Đường dẫn recipe.json: (đường dẫn từ bước trước)
5- Đường dẫn thư viện tài liệu: assets/
6- Đường dẫn đầu ra: work/(đường dẫn của bạn)
7
8Yêu cầu ghép:
91. Đọc khung hình chính từ recipe.json.
102. Duyệt thư viện và trích xuất khung hình chính cho mỗi tài sản.
113. Đề xuất tài liệu phù hợp nhất thông qua màu sắc, độ sáng và bố cục (cung cấp điểm tin cậy).
124. Áp dụng quy tắc: tránh sử dụng cùng một tài liệu cho 3 cảnh liên tiếp; tránh bố cục lặp lại rõ ràng.
135. Tạo fragment_plan.json và matches.json.
146. Sao chép (không di chuyển) tài liệu đã chọn vào material/fragment01/, v.v.
15
16Nguyên tắc: Nếu độ tin cậy dưới 0.6, hãy đánh dấu là "thiếu tài liệu."

Codex tính toán độ tương tự dựa trên các đặc điểm hình ảnh. Các tài liệu có điểm cao được ưu tiên.

xilo - inline image

matches.json ghi lại kết quả cuối cùng. Một nguyên tắc chính: Tốt hơn là để trống một tài liệu hơn là ép buộc một tài liệu không liên quan.

3. Tạo Giọng Đọc

Sau khi ghép, hãy tạo giọng đọc. Vì Codex sử dụng OCR/ASR, hãy kiểm tra kịch bản trước để tìm lỗi.

Lời nhắc:

text
1Tôi cần tạo giọng đọc. Kịch bản là @(tệp script.txt của bạn)
2
3Yêu cầu:
41. Gọi API TTS Doubao để tạo âm thanh độc lập cho mỗi cảnh.
52. Đọc thời lượng thực tế của mỗi tệp âm thanh.
63. Nếu thời lượng khác với cảnh tham chiếu, hãy ghi lại sự khác biệt.
74. Hợp nhất thành final_voice.mp3.
85. Cập nhật recipe.json với thời lượng thực tế.

Codex sẽ điều chỉnh nhịp điệu video dựa trên âm thanh. Nếu giọng đọc mất 5 giây cho một cảnh tham chiếu 3 giây, cảnh video cuối cùng sẽ được kéo dài thành 5 giây.

xilo - inline image

4. Tạo Bản Nháp và Dự Án CapCut

Việc tạo bản nháp CapCut rất phức tạp vì định dạng nghiêm ngặt về ID và đường dẫn. Tôi đã đưa các quy tắc vào lời nhắc để tránh lỗi.

Lời nhắc:

text
1Tôi cần tạo video cuối cùng và bản nháp CapCut.
2
3Đầu vào:
4- recipe.json, matches.json, đường dẫn tài liệu, tệp giọng đọc, kịch bản.
5
6Đầu ra:
71. Kết xuất video xem trước: work/remix.mp4
82. Tệp phụ đề: work/captions.srt
93. Bản nháp CapCut: work/jianying_draft/
10
11Yêu cầu:
12- Ghép tài liệu theo recipe và matches.json.
13- Sử dụng thời lượng giọng đọc làm cơ sở.
14- Đảm bảo Content ID, Metadata ID và Root Index ID nhất quán và duy nhất.
15- Sử dụng đường dẫn tuyệt đối cho tài liệu.
xilo - inline image

Kiểm tra xem bản nháp có mở chính xác không, tài liệu có hiển thị không và phụ đề/âm thanh có đồng bộ không.

Lời Kết

Toàn bộ quy trình từ tham chiếu đến bản nháp mất khoảng 20-30 phút. Với thư viện đã sẵn sàng, có thể chỉ mất 5 phút mỗi video.

Khi quy trình đã trơn tru, hãy nói với Codex: Hãy giúp tôi đóng gói quy trình này thành một Skill. Lần sau, chỉ cần gọi Skill.

Tôi hy vọng điều này hữu ích. Chúc bạn may mắn! 🍀

(Mẫu AGENTS.md được lược bỏ trong bản dịch này để ngắn gọn nhưng có trong văn bản gốc.)

Viết lại trong YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral