การตัดต่อวิดีโออัตโนมัติด้วย Codex: คู่มือทีละขั้นตอนสู่เวิร์กโฟลว์ Douyin ที่ทำเงินได้กว่า 7,000 ดอลลาร์

@xilo2991
จีน2 สัปดาห์ที่ผ่านมา · 05 ก.ค. 2569
1.6M
3.2K
622
83
5.7K

TL;DR

คู่มือฉบับละเอียดนี้อธิบายถึงเวิร์กโฟลว์ที่ขับเคลื่อนด้วย AI โดยใช้ Codex เพื่อตัดต่อวิดีโอสำหรับโซเชียลมีเดียโดยอัตโนมัติ ผ่านการวิเคราะห์วิดีโอต้นแบบที่เป็นกระแสและจับคู่กับไฟล์งานในเครื่อง

ผมใช้เวิร์กโฟลว์ตัดต่อนี้มากว่าสองเดือนแล้ว และปรับปรุงมากว่า 10 เวอร์ชัน ในบทความนี้ ผมจะอธิบายขั้นตอนและรายละเอียดทั้งหมดให้ชัดเจนที่สุดเท่าที่จะทำได้ เพื่อนๆ สามารถอ่านตามตรรกะของบทความ หรือจะส่งบทความนี้ให้ Codex เพื่อให้ AI สร้าง Skill ให้คุณก็ได้ สวัสดีเพื่อนๆ มาแล้วครับกับต้นฉบับ!

สัปดาห์ที่แล้วผมเขียนบทความแนะนำ Codex ไป ขอบคุณมากสำหรับการสนับสนุน มียอดเข้าชมเกินล้านวิว

https://x.com/xilo2991/status/2070051136187621452

ตอนนั้นเพื่อนๆ หลายคนถามว่าผมจะแชร์ระบบตัดต่ออัตโนมัติที่พูดถึงในบทความได้ไหม

ได้เลยครับ วันนี้ผมจะมาคุยกับคุณเกี่ยวกับวิธีการใช้ Codex เพื่อตัดต่ออัตโนมัติ เพิ่มประสิทธิภาพการทำวิดีโอให้สูงสุด

ตรรกะเบื้องหลังของเวิร์กโฟลว์

ไม่ว่าคุณจะทำคอนเทนต์หรืออีคอมเมิร์ซ วิธีที่ง่ายที่สุดในการปั่น traffic ให้เร็วคือ ก็อปปี้ของที่ปัง

เพราะของที่ปังเป็นคอนเทนต์ที่ตลาดรับรองแล้ว ถ้าคุณตามทัน traffic มักจะไม่แย่ (แน่นอน ต้องระวังความแตกต่างระหว่างก็อปปี้กับลอกเลียน)

หัวใจของเวิร์กโฟลว์นี้คือการก็อปปี้ของที่ปัง

สมมติว่าคุณเห็นวิดีโอไวรัลแล้วอยากทำวิดีโอตามจังหวะและโครงสร้างนั้น วิธีเดิมคือต้องเข้า CapCut (Jianying) แล้วจับคู่เฟรมต่อเฟรมกับวิดีโออ้างอิง หาวัสดุ จับเวลา และจัดเรียงซับไตเติ้ล วิดีโอหนึ่งคลิปอาจใช้เวลาสองสามชั่วโมง

แต่ด้วยเวิร์กโฟลว์นี้ คุณแค่ต้องเตรียมวิดีโออ้างอิงและคลังวัสดุของคุณเอง Codex จะจัดการส่วนที่เหลือให้อัตโนมัติ

Codex จะตรวจจับการเปลี่ยนคัททุกครั้งในวิดีโออ้างอิง หาวัสดุที่ตรงกันที่สุดจากคลังของคุณ สร้างเสียงพากย์และซับไตเติ้ลอัตโนมัติ และสุดท้ายให้คุณได้ดราฟต์ CapCut ที่คุณสามารถเปิดและแก้ไขต่อได้

ทั้งกระบวนการอาจใช้เวลาแค่ไม่กี่นาที

ผมใช้เวิร์กโฟลว์นี้เป็นหลักตอนทำวิดีโอสินค้าสำหรับ Douyin

ก่อนมี Codex ผมตัดต่อได้มากสุดแค่วันละ 6 วิดีโอ แต่พอมี Codex ผมแค่ต้องหาวิดีโอไวรัลที่ใช่เป็นตัวอย่าง และเตรียมวัสดุสินค้า ที่เหลือก็เป็นการสร้าง ตรวจสอบ และปรับแต่งอัตโนมัติ

ผมสามารถทำวิดีโอได้วันละ 30 ชิ้นสบายๆ ประสิทธิภาพเพิ่มขึ้นอย่างน้อยห้าเท่า

xilo - inline image

แต่ต้องบอกให้ชัด: ตำแหน่งของเวิร์กโฟลว์นี้คือการผลิตอัตโนมัติ ไม่ใช่การสร้างผลงานพรีเมียม

มันเหมาะกับวิดีโอแบบ mashup ที่ต้องต่อหลายคลิป เช่น อีคอมเมิร์ซ การตลาด หรือ Vlog แบบ mashup

วิดีโออ้างอิงให้โครงสร้างและจังหวะ คลังวัสดุของคุณให้ภาพ เสียงพากย์และซับไตเติ้ลถูกสร้างอัตโนมัติ และได้วิดีโอสุดท้ายออกมาโดยอัตโนมัติ

ถ้าคุณต้องการสร้างคอนเทนต์ต้นฉบับคุณภาพสูงที่ต้องใช้ภาษา cinematic ที่แม่นยำมาก ทรานซิชันซับซ้อน และการสื่ออารมณ์อย่างละเอียด กระบวนการนี้อาจไม่เหมาะ

เพราะตรรกะการจับคู่อัตโนมัติในปัจจุบันยังไม่สามารถเข้าใจความหมายและควบคุมอารมณ์ได้ละเอียดขนาดนั้น

ผมกำลังศึกษาวิธีปรับกระบวนการนี้ให้เหมาะกับวิดีโอต้นฉบับ และจะมาแชร์กับเพื่อนๆ เมื่อมันเสถียร

การเตรียมพร้อมสำหรับเวิร์กโฟลว์

โอเค กลับมาที่เวิร์กโฟลว์ตัดต่ออัตโนมัติกัน ด้านล่างนี้ ผมจะอธิบายทีละขั้นตอนว่าเราจะสร้างเวิร์กโฟลว์นี้อย่างไร ก่อนเริ่ม คุณต้องเตรียมสองสิ่ง

1. ติดตั้งเครื่องมือที่เกี่ยวข้อง

เวิร์กโฟลว์นี้ใช้ Codex ดังนั้นคุณต้องมี Codex ก่อน ถ้ายังไม่เคยใช้ ลองดูบทความแนะนำของผมจากสัปดาห์ที่แล้ว

โดยเฉพาะ เวิร์กโฟลว์นี้ต้องใช้เครื่องมือหลักเหล่านี้:

  • FFmpeg: ใช้สำหรับการทำงานพื้นฐาน เช่น แยกวิดีโอ รวม และแปลงฟอร์แมต นี่คือรากฐาน ต้องติดตั้งให้ได้
  • Python Environment: เพราะทั้งกระบวนการเขียนด้วย Python คุณต้องมี Python 3.8 ขึ้นไป
  • Voiceover Tools: ถ้าต้องการเสียงพากย์อัตโนมัติ ที่เสถียรที่สุดคือโมเดลเสียง Doubao ของ ByteDance ถ้าต้องการ clone เสียง ใช้ VoxCPM ซึ่งเป็นเครื่องมือโอเพนซอร์สฟรี
  • CapCut (Jianying): ดราฟต์ที่สร้างออกมาจะเป็นฟอร์แมตของ CapCut ดังนั้นคุณต้องติดตั้งเวอร์ชันเดสก์ท็อป

ในนี้ FFmpeg และ Python เป็นตัวหลักที่ต้องมี

คุณสามารถคัดลอกข้อความต่อไปนี้ไปให้ Codex เพื่อช่วยตรวจสอบสภาพแวดล้อมและติดตั้งเครื่องมือที่ขาดหาย:

text
1ช่วยตรวจสอบสภาพแวดล้อมที่จำเป็นสำหรับการตัดต่อวิดีโออัตโนมัติ:
2
31. ตรวจสอบว่าติดตั้ง FFmpeg หรือไม่ ถ้าไม่ได้ติดตั้ง ช่วยติดตั้งให้ด้วย
42. ตรวจสอบว่า Python เวอร์ชัน >= 3.8 หรือไม่ ถ้าไม่ ช่วยติดตั้งหรืออัปเกรดให้
53. ตรวจสอบว่าติดตั้ง CapCut (Jianying) Professional หรือไม่ ถ้าไม่ บอกลิงก์ดาวน์โหลดให้หน่อย
64. ติดตั้ง dependencies ของ Python: opencv-python, numpy, pillow
7
8หลังจากตรวจสอบแล้ว บอกว่าอะไรพร้อมแล้ว และอะไรที่ฉันต้องจัดการเอง

สำหรับเสียงพากย์ ขึ้นอยู่กับความต้องการของคุณ ถ้าคุณทำวิดีโออีคอมเมิร์ซ โมเดลเสียง Doubao เสถียรที่สุด มันใช้เสียง AI เดียวกับ CapCut ราคาถูก การสร้างวิดีโอความยาว 1 นาที ค่าใช้จ่ายประมาณ 0.4-0.8 หยวน

ถ้าคุณอยากใช้เสียงตัวเองหรือ clone เสียงคนอื่น ให้ใช้ VoxCPM หาลิงก์บน GitHub แล้วส่งให้ Codex เพื่อติดตั้ง

2. สร้างโฟลเดอร์

หลังจากติดตั้ง这些东西 แล้ว คุณต้องสร้างโฟลเดอร์โปรเจกต์ ผมมักจะจัดแบบนี้:

text
1Project Folder/
2 assets/ # คลังวัสดุของคุณ
3 work/ # พื้นที่ทำงาน สร้างโฟลเดอร์วันที่สำหรับแต่ละการตัดต่อ
4 final/ # ผลงานสุดท้าย
5 AGENTS.md # ไฟล์คอนฟิกโปรเจกต์

โฟลเดอร์ assets คือคลังของคุณ ใส่วัสดุที่อาจมีประโยชน์ทั้งหมดไว้ที่นี่ อาจเป็น AI สร้างหรือคุณถ่ายเอง แต่ควรเตรียมไว้ล่วงหน้าเป็นทรัพย์สินที่ใช้ซ้ำได้

วัสดุสามารถจัดหมวดหมู่ตามรูปลักษณ์ ฟังก์ชัน หรือฉาก

โฟลเดอร์ work ใช้สำหรับโปรเจกต์ที่กำลังทำอยู่ ทุกครั้งที่ทำวิดีโอใหม่ ให้สร้างโฟลเดอร์วันที่ เช่น 2026-07-05 แล้วใส่วิดีโออ้างอิง ไฟล์กลาง และดราฟต์สุดท้ายไว้

AGENTS.md คือไฟล์คอนฟิกที่มีเป้าหมายโปรเจกต์ สเปกผลลัพธ์ และเกณฑ์การยอมรับ นี่สำคัญมากเพราะ Codex ใช้มันเพื่อเข้าใจความต้องการของคุณ

xilo - inline image

PS: ไฟล์ AGENTS ของผมเองค่อนข้างยาว เลยวางไว้ท้ายบทความให้ดูเป็นตัวอย่าง

การสร้างเวิร์กโฟลว์การตัดต่อ

1. ถอดโครงสร้างวิดีโออ้างอิง

เป้าหมายหลักคือ แยกวิดีโออ้างอิงออกเป็นช็อตอิสระ และดึงคีย์เฟรมของแต่ละช็อตมาใช้เป็นพื้นฐานในการจับคู่วัสดุ

หาวิดีโอที่คุณอยากใช้เป็นตัวอย่าง ดาวน์โหลด ใส่ในโฟลเดอร์ work และตั้งชื่อให้ชัดเจน

จากนั้นส่งข้อความนี้ไปยัง Codex:

text
1ฉันต้องการถอดโครงสร้างวิดีโออ้างอิง
2
3ตำแหน่งวิดีโออ้างอิง: @(ใส่ชื่อไฟล์ของคุณ)
4
5ช่วยฉัน:
61. ใช้ FFmpeg ระบุจุดเปลี่ยนช็อต (ผ่านการวิเคราะห์ความแตกต่างระหว่างเฟรม)
72. ดึงคีย์เฟรมของแต่ละช็อตและบันทึกเป็นภาพ
83. แยกแทร็กเสียงออกมาต่างหาก
94. สร้างไฟล์ recipe.json ที่บันทึกเวลาเริ่ม เวลาจบ ระยะเวลา และพาธของคีย์เฟรมสำหรับแต่ละช็อต
105. ถ้ามีข้อความ ให้สร้างสคริปต์เสียงพากย์ตามเสียง โดยแบ่งตามช็อต
11
12หลังจากเสร็จ ให้ทำตามข้อกำหนดใน AGENTS.md บันทึกลงในโฟลเดอร์ที่เกี่ยวข้อง และบอกฉันว่าตรวจพบกี่ช็อต

ไฟล์ recipe.json นี้คือหัวใจของทั้งกระบวนการ

xilo - inline image

หลังถอดโครงสร้าง คุณจะเห็นคลิปวิดีโอเล็กๆ และภาพหน้าจอจำนวนมาก ตรวจสอบว่าการแยกนั้นสมเหตุสมผลหรือไม่ ถ้าไม่ คุณสามารถขอให้ Codex ปรับได้

2. กรองและจับคู่วัสดุ

ขั้นตอนนี้สำคัญที่สุด และแสดงให้เห็นคุณค่าของระบบอัตโนมัติ

วิธีเดิม คุณต้องค้นหาคลังของคุณทีละช็อต แต่ด้วยเวิร์กโฟลว์นี้ คุณแค่บอก Codex ว่าคลังของคุณอยู่ที่ไหน มันก็จะทำการจับคู่ภาพ

พรอมต์สำหรับ Codex:

text
1ฉันต้องการจับคู่และแทนที่วัสดุจากคลัง
2
3ข้อมูลโปรเจกต์:
4- พาธของ recipe.json: (พาธจากขั้นตอนก่อนหน้า)
5- พาธคลังวัสดุ: assets/
6- พาธเอาต์พุต: work/(พาธของคุณ)
7
8ข้อกำหนดการจับคู่:
91. อ่านคีย์เฟรมจาก recipe.json
102. วนลูปในคลังและดึงคีย์เฟรมของแต่ละวัสดุ
113. แนะนำวัสดุที่ตรงกันที่สุดผ่านสี ความสว่าง และองค์ประกอบ (พร้อมให้คะแนนความเชื่อมั่น)
124. ใช้กฎ: หลีกเลี่ยงการใช้วัสดุเดียวกัน 3 ช็อตติดกัน หลีกเลี่ยงองค์ประกอบที่ซ้ำกันชัดเจน
135. สร้าง fragment_plan.json และ matches.json
146. คัดลอก (ไม่ใช่ย้าย) วัสดุที่เลือกไปยัง material/fragment01/ ฯลฯ
15
16หลักการ: ถ้าคะแนนความเชื่อมั่นต่ำกว่า 0.6 ให้ทำเครื่องหมายเป็น "missing material"

Codex จะคำนวณความคล้ายคลึงจากฟีเจอร์ที่มองเห็น วัสดุที่ได้คะแนนสูงจะถูกเลือกก่อน

xilo - inline image

matches.json บันทึกผลลัพธ์สุดท้าย หลักการสำคัญ: ปล่อยให้วัสดุว่างดีกว่าบังคับใช้วัสดุที่ไม่เกี่ยวข้อง

3. สร้างเสียงพากย์

หลังจากจับคู่แล้ว ให้สร้างเสียงพากย์ เนื่องจาก Codex ใช้ OCR/ASR ให้ตรวจสอบสคริปต์ว่ามีข้อผิดพลาดก่อน

พรอมต์:

text
1ฉันต้องการสร้างเสียงพากย์ สคริปต์อยู่ที่ @(script.txt ของคุณ)
2
3ข้อกำหนด:
41. เรียกใช้ Doubao TTS API เพื่อสร้างเสียงอิสระสำหรับแต่ละช็อต
52. อ่านระยะเวลาจริงของไฟล์เสียงแต่ละไฟล์
63. ถ้าระยะเวลาแตกต่างจากช็อตอ้างอิง ให้บันทึกความแตกต่าง
74. รวมเป็น final_voice.mp3
85. อัปเดต recipe.json ด้วยระยะเวลาจริง

Codex จะปรับจังหวะวิดีโอตามเสียง ถ้าเสียงพากย์ยาว 5 วินาทีสำหรับช็อตอ้างอิงที่ยาว 3 วินาที ช็อตในวิดีโอสุดท้ายจะถูกขยายเป็น 5 วินาที

xilo - inline image

4. สร้างดราฟต์และโปรเจกต์ CapCut

การสร้างดราฟต์ CapCut ซับซ้อนเพราะฟอร์แมตค่อนข้างเข้มงวดเรื่อง ID และพาธ ผมใส่กฎในพรอมต์เพื่อหลีกเลี่ยงข้อผิดพลาด

พรอมต์:

text
1ฉันต้องการสร้างวิดีโอสุดท้ายและดราฟต์ CapCut
2
3อินพุต:
4- recipe.json, matches.json, พาธวัสดุ, ไฟล์เสียงพากย์, สคริปต์
5
6เอาต์พุต:
71. เรนเดอร์วิดีโอตัวอย่าง: work/remix.mp4
82. ไฟล์ซับไตเติ้ล: work/captions.srt
93. ดราฟต์ CapCut: work/jianying_draft/
10
11ข้อกำหนด:
12- จับคู่วัสดุตาม recipe และ matches.json
13- ใช้ระยะเวลาเสียงพากย์เป็นหลัก
14- ตรวจสอบให้แน่ใจว่า Content ID, Metadata ID และ Root Index ID สอดคล้องกันและไม่ซ้ำ
15- ใช้พาธสัมบูรณ์สำหรับวัสดุ
xilo - inline image

ตรวจสอบว่าดราฟต์เปิดได้ถูกต้อง วัสดุแสดงผล และซับไตเติ้ล/เสียงตรงกัน

คำทิ้งท้าย

ทั้งกระบวนการจากวิดีโออ้างอิงถึงดราฟต์ใช้เวลาประมาณ 20-30 นาที ถ้ามีคลังพร้อม ใช้เวลาแค่ 5 นาทีต่อวิดีโอ

เมื่อเวิร์กโฟลว์ลื่นแล้ว ให้บอก Codex: ช่วยฉันแพ็กเวิร์กโฟลว์นี้เป็น Skill หน่อย ครั้งต่อไปก็แค่เรียกใช้ Skill

หวังว่าสิ่งนี้จะเป็นประโยชน์ ขอให้โชคดี! 🍀

(เทมเพลต AGENTS.md ละไว้ในที่นี้เพื่อความกระชับ แต่มีอยู่ในข้อความต้นฉบับ)

สร้างต่อใน YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
สำหรับครีเอเตอร์

เปลี่ยน Markdown ของคุณให้เป็นบทความ 𝕏 ที่สะอาดตา

เวลาคุณเผยแพร่งานเขียนยาวของตัวเอง การจัดรูปแบบรูปภาพ ตาราง และบล็อกโค้ดให้เข้ากับ 𝕏 นั้นน่าปวดหัว YouMind เปลี่ยนร่าง Markdown ทั้งฉบับให้เป็นบทความ 𝕏 ที่สะอาดตาและพร้อมโพสต์ทันที

ลอง Markdown เป็น 𝕏

แพตเทิร์นให้ถอดรหัสเพิ่มเติม

บทความไวรัลล่าสุด

สำรวจบทความไวรัลเพิ่มเติม