Ich habe diesen Bearbeitungs-Workflow seit über zwei Monaten im Einsatz und habe nicht weniger als 10 Versionen durchlaufen. In diesem Artikel werde ich den gesamten Prozess und die Details so klar wie möglich für meine Freunde erklären.
Du kannst der Logik des Artikels folgen oder diesen Artikel direkt an Codex senden, um die KI eine Skill für dich erstellen zu lassen.
Hallo Freunde, ich bin hier, um den Entwurf zu liefern!
Letzte Woche habe ich einen Einführungsartikel über Codex geschrieben, und ich bin sehr dankbar für die Unterstützung – er hat über eine Million Aufrufe erreicht.
https://x.com/xilo2991/status/2070051136187621452
Damals fragten viele Freunde, ob ich die automatisierte Bearbeitung teilen könnte, die im Artikel erwähnt wurde.
Aber natürlich. Heute bin ich hier, um mit dir darüber zu sprechen, wie man mit Codex automatisierte Bearbeitung erreicht, um die Videoproduktion maximal effizient zu gestalten.
Die zugrunde liegende Logik des Workflows
Ob du nun Content oder E-Commerce betreibst, der einfachste Weg, schnell Traffic zu bekommen, ist es, virale Hits zu kopieren.
Weil virale Hits bereits vom Markt verifizierte Inhalte sind. Solange du ihnen schnell genug folgst, ist der Traffic in der Regel nicht schlecht. (Natürlich, achte auf den Unterschied zwischen Kopieren und Plagiat.)
Der Kern dieses Workflows ist das Kopieren viraler Hits.
Angenommen, du siehst ein virales Video und möchtest ein eigenes Video mit diesem Rhythmus und dieser Struktur erstellen. Der traditionelle Weg ist, manuell in CapCut (Jianying) zu gehen und Bild für Bild das Referenzvideo zu analysieren, Materialien zu finden, sie zu timen und Untertitel auszurichten. Ein Video kann zwei oder drei Stunden dauern.
Aber mit diesem Workflow musst du nur das Referenzvideo und deine eigene Materialbibliothek vorbereiten; Codex erledigt den Rest automatisch.
Codex erkennt automatisch jeden Szenenwechsel im Referenzvideo, findet das am besten passende Material aus deiner Bibliothek, generiert automatisch Voiceovers und Untertitel und liefert dir schließlich einen CapCut-Entwurf, den du öffnen und bearbeiten kannst.
Der gesamte Vorgang dauert vielleicht nur ein paar Minuten.
Ich verwende diesen Workflow hauptsächlich bei der Erstellung von Douyin-Produktvideos.
Vor Codex konnte ich höchstens 6 Videos pro Tag bearbeiten. Aber mit Codex muss ich nur passende virale Videos als Referenz finden und das Produktmaterial vorbereiten. Der Rest ist automatische Generierung, Überprüfung und Feinabstimmung.
Ich kann locker 30 Videos am Tag fertigstellen, eine Effizienzsteigerung von mindestens dem Fünffachen.

Aber seien wir ehrlich: Die Positionierung dieses Workflows ist die automatische Produktion, nicht die hochwertige Kreation.
Er eignet sich für Mashup-Videos, die das Zusammenfügen mehrerer Segmente erfordern, wie z. B. E-Commerce, Marketing oder Mashup-Vlogs.
Das Referenzvideo liefert die Struktur und den Rhythmus, deine Materialbibliothek liefert die Bilder, Voiceovers und Untertitel werden automatisch generiert, und das endgültige Video wird automatisch produziert.
Wenn du qualitativ hochwertige Originalinhalte erstellen möchtest, die eine sehr präzise filmische Sprache, komplexe Übergänge und eine feine emotionale Ausdrucksweise erfordern, ist dieser Prozess möglicherweise nicht geeignet.
Weil die aktuelle automatische Matching-Logik noch keine so präzise semantische Verständnis und emotionale Kontrolle erreichen kann.
Ich forsche auch daran, wie man diesen Prozess für Originalvideos optimieren kann, und werde ihn mit Freunden teilen, sobald er stabil ist.
Workflow-Vorbereitung
OK, zurück zum automatisierten Bearbeitungs-Workflow. Im Folgenden erkläre ich Schritt für Schritt, wie man diesen Workflow aufbaut. Bevor du beginnst, musst du zwei Dinge vorbereiten.
1. Installiere die entsprechenden Tools
Dieser Workflow basiert auf Codex, also musst du zuerst Codex haben. Wenn du es noch nicht verwendet hast, lies meinen Einführungsartikel von letzter Woche.
Konkret benötigt dieser Workflow diese Kernwerkzeuge:
- FFmpeg: Wird für grundlegende Operationen wie Videosplitting, -zusammenführung und Formatkonvertierung verwendet. Dies ist die Grundlage und muss installiert sein.
- Python-Umgebung: Da der gesamte Prozess in Python geschrieben ist, benötigst du mindestens Python 3.8.
- Voiceover-Tools: Wenn du automatische Voiceovers möchtest, ist das stabilste ByteDances Doubao-Sprachmodell; wenn du Stimmen klonen möchtest, verwende VoxCPM, ein kostenloses Open-Source-Tool.
- CapCut (Jianying): Der endgültig generierte Entwurf ist im CapCut-Format, daher benötigst du die Desktop-Version installiert.
Von diesen sind FFmpeg und Python Kernabhängigkeiten.
Du kannst den folgenden Text in Codex kopieren, um die Umgebung zu überprüfen und fehlende Tools zu installieren:
1Bitte hilf mir, die für die automatisierte Videobearbeitung benötigte Umgebung zu überprüfen:231. Überprüfe, ob FFmpeg installiert ist; wenn nicht, hilf mir bei der Installation.42. Überprüfe, ob die Python-Version >= 3.8 ist; wenn nicht, hilf mir bei der Installation oder dem Upgrade.53. Überprüfe, ob CapCut (Jianying) Professional installiert ist; wenn nicht, gib mir den Download-Link.64. Installiere Python-Abhängigkeiten: opencv-python, numpy, pillow78Überprüfe nach Abschluss und teile mir mit, was bereit ist und was ich manuell erledigen muss.
Für Voiceovers hängt es von deinen Bedürfnissen ab. Wenn du E-Commerce-Videos erstellst, ist das Doubao-Sprachmodell das stabilste. Es verwendet die gleichen KI-Stimmen wie CapCut. Der Preis ist niedrig – die Generierung eines 1-minütigen Videos kostet etwa 0,4-0,8 RMB.
Wenn du deine eigene Stimme verwenden oder die eines anderen klonen möchtest, verwende VoxCPM. Finde den Link auf GitHub und sende ihn an Codex zur Installation.
2. Erstelle Ordner
Nachdem du diese installiert hast, musst du einen Projektordner erstellen. Ich organisiere es normalerweise so:
1Projektordner/2 assets/ # Deine Materialbibliothek3 work/ # Arbeitsbereich, erstelle für jede Bearbeitung einen Datumsordner4 final/ # Endprodukte5 AGENTS.md # Projektkonfigurationsdatei
Der assets-Ordner ist deine Bibliothek. Lege alle potenziell nützlichen Materialien dort ab. Diese können KI-generiert oder von dir gefilmt sein, aber sie sollten im Voraus als wiederverwendbare Ressourcen vorbereitet werden.
Materialien können nach Aussehen, Funktion oder Szene kategorisiert werden.
Der work-Ordner ist für aktive Projekte. Jedes Mal, wenn du ein neues Video erstellst, erstelle einen Datumsordner wie 2026-07-05 und lege das Referenzvideo, die Zwischendateien und den endgültigen Entwurf dort ab.
AGENTS.md ist die Konfigurationsdatei, die Projektziele, Ausgabespezifikationen und Akzeptanzkriterien enthält. Dies ist entscheidend, weil Codex sie verwendet, um deine Anforderungen zu verstehen.

PS: Meine eigene AGENTS-Datei ist etwas lang, daher habe ich sie am Ende zur Referenz eingefügt.
Aufbau des Bearbeitungs-Workflows
1. Zerlege das Referenzvideo
Das Kernziel hier ist es, das Referenzvideo in unabhängige Szenen aufzuteilen und für jede Szene Keyframes zu extrahieren, die als Grundlage für den Materialabgleich dienen.
Finde ein Video, das du als Referenz verwenden möchtest. Lade es herunter, lege es in den work-Ordner und gib ihm einen klaren Namen.
Sende dies dann an Codex:
1Ich muss ein Referenzvideo zerlegen.23Referenzvideo-Pfad: @(gib deinen Dateinamen ein)45Bitte hilf mir mit:61. Verwende FFmpeg, um Szenenwechsel zu identifizieren (über Inter-Frame-Differenzanalyse).72. Extrahiere Keyframes für jede Szene und speichere sie als Bilder.83. Extrahiere die Audiospur separat.94. Generiere eine recipe.json-Datei, die Startzeit, Endzeit, Dauer und Keyframe-Pfad für jede Szene aufzeichnet.105. Wenn es Text gibt, generiere basierend auf dem Audio ein Voiceover-Skript, segmentiert nach Szene.1112Nach Abschluss, befolge die Anforderungen in AGENTS.md, speichere im entsprechenden Ordner und teile mir mit, wie viele Szenen identifiziert wurden.
Diese recipe.json-Datei ist der Kern des gesamten Prozesses.

Nach der Zerlegung siehst du viele kleine Videoclips und Screenshots. Überprüfe, ob die Aufteilung sinnvoll ist. Wenn nicht, kannst du Codex bitten, Anpassungen vorzunehmen.
2. Filtere und gleiche Materialien ab
Dieser Schritt ist der kritischste und zeigt den Wert der Automatisierung.
Traditionell würdest du Szene für Szene in deiner Bibliothek suchen. Mit diesem Workflow sagst du Codex einfach, wo deine Bibliothek ist, und es führt einen visuellen Abgleich durch.
Prompt für Codex:
1Ich muss Materialien aus der Bibliothek abgleichen und ersetzen.23Projektinformationen:4- recipe.json-Pfad: (Pfad aus dem vorherigen Schritt)5- Materialbibliothek-Pfad: assets/6- Ausgabepfad: work/(dein Pfad)78Abgleichsanforderungen:91. Lese Keyframes aus recipe.json.102. Durchsuche die Bibliothek und extrahiere Keyframes für jedes Asset.113. Empfehle das am besten passende Material über Farbe, Helligkeit und Komposition (gebe Konfidenzwerte an).124. Wende Regeln an: Vermeide die Verwendung desselben Materials für 3 aufeinanderfolgende Szenen; vermeide offensichtlich repetitive Kompositionen.135. Generiere fragment_plan.json und matches.json.146. Kopiere (nicht verschiebe) ausgewählte Materialien in material/fragment01/ usw.1516Prinzip: Wenn die Konfidenz unter 0,6 liegt, markiere als "fehlendes Material".
Codex berechnet die Ähnlichkeit basierend auf visuellen Merkmalen. Materialien mit hohen Punktzahlen werden priorisiert.

matches.json zeichnet die endgültigen Ergebnisse auf. Ein wichtiges Prinzip: Es ist besser, ein Material leer zu lassen, als ein irrelevantes zu erzwingen.
3. Generiere das Voiceover
Nach dem Abgleich wird das Voiceover generiert. Da Codex OCR/ASR verwendet, überprüfe das Skript zunächst auf Fehler.
Prompt:
1Ich muss Voiceovers generieren. Das Skript ist @(dein script.txt)23Anforderungen:41. Rufe die Doubao-TTS-API auf, um für jede Szene ein unabhängiges Audio zu generieren.52. Lese die tatsächliche Dauer jeder Audiodatei.63. Wenn die Dauer von der Referenzszene abweicht, zeichne die Differenz auf.74. Führe zu final_voice.mp3 zusammen.85. Aktualisiere recipe.json mit den tatsächlichen Dauern.
Codex wird den Videorhythmus basierend auf dem Audio anpassen. Wenn ein Voiceover 5 Sekunden für eine 3-Sekunden-Referenzszene benötigt, wird die letztendliche Videoszene auf 5 Sekunden verlängert.

4. Generiere Entwurf und CapCut-Projekt
Das Generieren des CapCut-Entwurfs ist komplex, da das Format streng in Bezug auf IDs und Pfade ist. Ich habe Regeln in den Prompt aufgenommen, um Fehler zu vermeiden.
Prompt:
1Ich muss das endgültige Video und den CapCut-Entwurf generieren.23Eingabe:4- recipe.json, matches.json, Materialpfad, Voiceover-Datei, Skript.56Ausgabe:71. Rendere Vorschauvideo: work/remix.mp482. Untertiteldatei: work/captions.srt93. CapCut-Entwurf: work/jianying_draft/1011Anforderungen:12- Gleiche Materialien gemäß recipe und matches.json ab.13- Verwende die Voiceover-Dauer als Basis.14- Stelle sicher, dass Content ID, Metadata ID und Root Index ID konsistent und eindeutig sind.15- Verwende absolute Pfade für Materialien.

Überprüfe, ob der Entwurf korrekt geöffnet wird, ob Materialien angezeigt werden und ob Untertitel/Audio synchron sind.
Abschließende Worte
Der gesamte Prozess von der Referenz bis zum Entwurf dauert etwa 20-30 Minuten. Mit einer fertigen Bibliothek kann es nur 5 Minuten pro Video dauern.
Sobald der Workflow reibungslos läuft, sage Codex: Hilf mir, diesen Workflow in eine Skill zu kapseln. Beim nächsten Mal rufst du einfach die Skill auf.
Ich hoffe, das hilft. Viel Glück! 🍀
(AGENTS.md-Vorlage aus Gründen der Kürze in dieser Übersetzung weggelassen, aber im Originaltext enthalten.)





