J'utilise ce workflow de montage depuis plus de deux mois et j'en suis à ma dixième itération. Dans cet article, je vais vous expliquer le processus complet et les détails aussi clairement que possible pour mes amis.
Vous pouvez suivre la logique de l'article ou envoyer directement cet article à Codex pour laisser l'IA créer une Skill pour vous.
Salut les amis, je suis là pour livrer le brouillon !
La semaine dernière, j'ai écrit un article d'introduction sur Codex, et je suis très reconnaissant pour le soutien – il a dépassé le million de vues.
https://x.com/xilo2991/status/2070051136187621452
À ce moment-là, beaucoup d'amis m'ont demandé si je pouvais partager le montage automatisé mentionné dans l'article.
Bien sûr. Aujourd'hui, je suis là pour discuter avec vous de la façon de réaliser un montage automatisé avec Codex afin de maximiser l'efficacité de la création vidéo.
La logique sous-jacente du workflow
Que vous fassiez du contenu ou du e-commerce, le moyen le plus simple d'obtenir rapidement du trafic est de copier les hits viraux.
Parce que les hits viraux sont des contenus déjà validés par le marché, tant que vous les suivez assez vite, le trafic ne sera généralement pas mauvais. (Bien sûr, faites attention à la différence entre copier et plagier.)
Le cœur de ce workflow est de copier les hits viraux.
Supposons que vous voyez une vidéo virale et que vous voulez créer votre propre vidéo en suivant ce rythme et cette structure. La méthode traditionnelle consiste à aller manuellement dans CapCut (Jianying) et à faire correspondre image par image la vidéo de référence, trouver les素材, les chronométrer et aligner les sous-titres. Une vidéo peut prendre deux ou trois heures.
Mais avec ce workflow, vous avez seulement besoin de préparer la vidéo de référence et votre propre bibliothèque de素材 ; Codex peut automatiquement faire le reste.
Codex identifiera automatiquement chaque transition de plan dans la vidéo de référence, trouvera le meilleur素材 correspondant dans votre bibliothèque, générera automatiquement les voix off et les sous-titres, et enfin vous donnera un brouillon CapCut que vous pourrez ouvrir et éditer.
Tout le processus peut prendre juste quelques minutes.
J'utilise principalement ce workflow lorsque je crée des vidéos produits pour Douyin.
Avant Codex, je ne pouvais monter que 6 vidéos par jour au maximum. Mais avec Codex, j'ai juste besoin de trouver des vidéos virales appropriées comme références et de préparer les素材 produits. Le reste est génération automatique, révision et ajustement.
Je peux facilement finir 30 vidéos par jour, une augmentation d'efficacité d'au moins cinq fois.

Mais soyons clairs : le positionnement de ce workflow est la production automatique, pas la création de qualité.
Il est adapté aux vidéos de type mashup qui nécessitent l'assemblage de plusieurs segments, comme le e-commerce, le marketing ou les Vlogs mashup.
La vidéo de référence fournit la structure et le rythme, votre bibliothèque de素材 fournit les visuels, les voix off et les sous-titres sont générés automatiquement, et la vidéo finale est produite automatiquement.
Si vous voulez créer du contenu original de haute qualité qui nécessite un langage cinématographique très précis, des transitions complexes et une expression émotionnelle délicate, ce processus pourrait ne pas convenir.
Parce que la logique de correspondance automatique actuelle ne peut pas encore atteindre une compréhension sémantique et un contrôle émotionnel aussi précis.
Je recherche aussi comment optimiser ce processus pour les vidéos originales et je le partagerai avec les amis une fois que ce sera stable.
Préparation du workflow
OK, revenons au workflow de montage automatisé. Ci-dessous, je vais expliquer étape par étape comment construire ce workflow. Avant de commencer, vous devez préparer deux choses.
1. Installer les outils correspondants
Ce workflow est basé sur Codex, donc vous devez d'abord avoir Codex. Si vous ne l'avez pas utilisé, consultez mon article d'introduction de la semaine dernière.
Spécifiquement, ce workflow nécessite ces outils principaux :
- FFmpeg : Utilisé pour les opérations sous-jacentes comme le découpage, la fusion et la conversion de format vidéo. C'est la base, doit être installé.
- Environnement Python : Puisque tout le processus est écrit en Python, vous avez besoin d'au moins Python 3.8.
- Outils de voix off : Si vous voulez des voix off automatiques, le plus stable est le modèle vocal Doubao de ByteDance ; si vous voulez cloner des voix, utilisez VoxCPM, un outil open source gratuit.
- CapCut (Jianying) : Le brouillon final généré est au format CapCut, donc vous avez besoin de la version de bureau installée.
Parmi ceux-ci, FFmpeg et Python sont des dépendances principales.
Vous pouvez copier le texte suivant vers Codex pour vous aider à vérifier l'environnement et installer les outils manquants :
1Aidez-moi à vérifier l'environnement nécessaire pour le montage vidéo automatisé :231. Vérifiez si FFmpeg est installé ; sinon, aidez-moi à l'installer.42. Vérifiez si la version de Python est >= 3.8 ; sinon, aidez-moi à installer ou mettre à niveau.53. Vérifiez si CapCut (Jianying) Professionnel est installé ; sinon, donnez-moi le lien de téléchargement.64. Installez les dépendances Python : opencv-python, numpy, pillow78Après vérification, dites-moi ce qui est prêt et ce que je dois gérer manuellement.
Pour les voix off, cela dépend de vos besoins. Si vous faites des vidéos e-commerce, le modèle vocal Doubao est le plus stable. Il utilise les mêmes voix AI que CapCut. Le prix est bas – générer une vidéo d'une minute coûte environ 0,4 à 0,8 RMB.
Si vous voulez utiliser votre propre voix ou cloner celle de quelqu'un d'autre, utilisez VoxCPM. Trouvez le lien sur GitHub et envoyez-le à Codex pour l'installer.
2. Créer des dossiers
Après avoir installé tout cela, vous devez créer un dossier de projet. Je l'organise généralement comme ceci :
1Dossier Projet/2 assets/ # Votre bibliothèque de素材3 work/ # Zone de travail, créez un dossier de date pour chaque montage4 final/ # Produits finaux5 AGENTS.md # Fichier de configuration du projet
Le dossier assets est votre bibliothèque. Mettez-y tous les素材 potentiellement utiles. Ceux-ci peuvent être générés par IA ou filmés par vous, mais ils doivent être préparés à l'avance comme des actifs réutilisables.
Les素材 peuvent être catégorisés par apparence, fonction ou scène.
Le dossier work est pour les projets actifs. Chaque fois que vous faites une nouvelle vidéo, créez un dossier de date comme 2026-07-05 et mettez-y la vidéo de référence, les fichiers intermédiaires et le brouillon final.
AGENTS.md est le fichier de configuration contenant les objectifs du projet, les spécifications de sortie et les critères d'acceptation. C'est crucial car Codex l'utilise pour comprendre vos besoins.

PS : Mon propre fichier AGENTS est un peu long, donc je le mets à la fin pour référence.
Construire le workflow de montage
1. Déconstruire la vidéo de référence
L'objectif principal ici est de découper la vidéo de référence en plans indépendants et d'extraire des images clés pour chaque plan comme base pour la correspondance des素材.
Trouvez une vidéo que vous voulez utiliser comme référence. Téléchargez-la, mettez-la dans le dossier work et donnez-lui un nom clair.
Ensuite, envoyez ceci à Codex :
1J'ai besoin de déconstruire une vidéo de référence.23Emplacement de la vidéo de référence : @(saisissez votre nom de fichier)45Aidez-moi à :61. Utiliser FFmpeg pour identifier les transitions de plans (via l'analyse des différences inter-images).72. Extraire les images clés de chaque plan et les enregistrer sous forme d'images.83. Extraire la piste audio séparément.94. Générer un fichier recipe.json enregistrant l'heure de début, l'heure de fin, la durée et le chemin de l'image clé pour chaque plan.105. S'il y a du texte, générer un script de voix off basé sur l'audio, segmenté par plan.1112Après avoir terminé, suivez les exigences d'AGENTS.md, enregistrez dans le dossier correspondant et dites-moi combien de plans ont été identifiés.
Ce fichier recipe.json est le cœur de tout le processus.

Après la déconstruction, vous verrez beaucoup de petits clips vidéo et de captures d'écran. Vérifiez si le découpage est raisonnable. Sinon, vous pouvez demander à Codex de l'ajuster.
2. Filtrer et faire correspondre les素材
Cette étape est la plus critique et démontre la valeur de l'automatisation.
Traditionnellement, vous chercheriez dans votre bibliothèque plan par plan. Avec ce workflow, vous dites simplement à Codex où se trouve votre bibliothèque, et il effectue la correspondance visuelle.
Prompt pour Codex :
1J'ai besoin de faire correspondre et de remplacer les素材 de la bibliothèque.23Infos du projet :4- Chemin de recipe.json : (chemin de l'étape précédente)5- Chemin de la bibliothèque de素材 : assets/6- Chemin de sortie : work/(votre chemin)78Exigences de correspondance :91. Lire les images clés de recipe.json.102. Parcourir la bibliothèque et extraire les images clés pour chaque素材.113. Recommander le meilleur素材 correspondant via la couleur, la luminosité et la composition (fournir des scores de confiance).124. Appliquer des règles : éviter d'utiliser le même素材 pour 3 plans consécutifs ; éviter les compositions répétitives évidentes.135. Générer fragment_plan.json et matches.json.146. Copier (ne pas déplacer) les素材 sélectionnés vers material/fragment01/, etc.1516Principe : Si la confiance est inférieure à 0,6, marquer comme "素材 manquant".
Codex calcule la similarité en fonction des caractéristiques visuelles. Les素材 avec des scores élevés sont prioritaires.

matches.json enregistre les résultats finaux. Un principe clé : Mieux vaut laisser un素材 vide que d'en forcer un non pertinent.
3. Générer la voix off
Après la correspondance, générez la voix off. Puisque Codex utilise OCR/ASR, vérifiez d'abord les erreurs dans le script.
Prompt :
1J'ai besoin de générer des voix off. Le script est @(votre script.txt)23Exigences :41. Appeler l'API TTS de Doubao pour générer un audio indépendant pour chaque plan.52. Lire la durée réelle de chaque fichier audio.63. Si la durée diffère du plan de référence, enregistrer la différence.74. Fusionner en final_voice.mp3.85. Mettre à jour recipe.json avec les durées réelles.
Codex ajustera le rythme de la vidéo en fonction de l'audio. Si une voix off prend 5 secondes pour un plan de référence de 3 secondes, le plan de la vidéo finale sera étendu à 5 secondes.

4. Générer le brouillon et le projet CapCut
Générer le brouillon CapCut est complexe car le format est strict concernant les ID et les chemins. J'ai inclus des règles dans le prompt pour éviter les erreurs.
Prompt :
1J'ai besoin de générer la vidéo finale et le brouillon CapCut.23Entrée :4- recipe.json, matches.json, chemin des素材, fichier voix off, script.56Sortie :71. Vidéo de prévisualisation rendue : work/remix.mp482. Fichier de sous-titres : work/captions.srt93. Brouillon CapCut : work/jianying_draft/1011Exigences :12- Faire correspondre les素材 selon recipe et matches.json.13- Utiliser la durée de la voix off comme base de référence.14- S'assurer que Content ID, Metadata ID et Root Index ID sont cohérents et uniques.15- Utiliser des chemins absolus pour les素材.

Vérifiez si le brouillon s'ouvre correctement, si les素材 apparaissent, et si les sous-titres/l'audio sont synchronisés.
Derniers mots
Tout le processus, de la référence au brouillon, prend environ 20 à 30 minutes. Avec une bibliothèque prête, cela peut prendre aussi peu que 5 minutes par vidéo.
Une fois le workflow fluide, dites à Codex : Aidez-moi à encapsuler ce workflow dans une Skill. La prochaine fois, appelez simplement la Skill.
J'espère que cela vous aide. Bonne chance ! 🍀
(Le modèle AGENTS.md est omis par souci de concision dans cette traduction mais est inclus dans le texte original.)





