Anteriormente, tentei usar o Codex e o Hyperframes para desconstruir um vídeo viral de uma conta do Douyin sobre livros, e os efeitos sonoros receberam elogios consistentes de todos.
Hoje, estou escrevendo um artigo longo para ensinar você, passo a passo, como desconstruir vídeos virais do Douyin e configurar um workflow, para que você também possa ter a capacidade de criar vídeos usando IA.
https://x.com/369Serena/status/2073012234184282287
1. Preparação
Primeiro, todos precisam preparar suas ferramentas:
- Você precisa de um Agente como o Codex.
- Depois, vá até a loja de plugins e instale duas ferramentas:
(a) Hyperframes: Cria vídeos em formato HTML, muito adequado para apresentações corporativas, animações de dados ou vídeos de demonstração.
(b) Remotion: Escrito em React, ele transforma vídeo em código. Depois que você define um estilo de tema, é altamente adequado para replicação em grande volume por meio de codificação. Vejo muitos blogueiros usando o Remotion para criar animações no estilo "Xiao Lin Shuo", que funciona muito bem com vídeos de cabeça falante.
Além disso, você pode instalar algumas Skills para ajudar na desconstrução. Se quiser entender a estrutura de um vídeo viral — como os primeiros segundos prendem a atenção do público, quais são os efeitos sonoros e o ritmo entre a narração e os visuais — você pode desconstruí-los e replicá-los através das seguintes Skills:
- Claude Video: Usado para desconstruir o processo do vídeo, facilitando a replicação na próxima etapa.
- Video Use: Recomendo muito para iniciantes em edição. Funciona como um "diretor de edição de vídeo" que pode chamar as ferramentas apropriadas com base em suas necessidades. Para novatos que não sabem quando usar qual ferramenta, ele desempenha o papel de um diretor mestre.
Isso conclui o trabalho de preparação.
2. Fluxo de Trabalho de Produção de Vídeo
Criar vídeos com Codex + Hyperframes pode seguir esta sequência:
1️⃣ Defina primeiro as especificações do vídeo
Por exemplo: 30 segundos, 9:16, Chinês, baseado em conhecimento, introdução de livros, para X / TikTok / Xiaohongshu.
2️⃣ Escreva o roteiro da narração
Peça ao Codex para escrever primeiro uma narração de 30 segundos em Chinês; não se apresse em criar os visuais.
3️⃣ Confirme o estilo visual
Por exemplo: vídeo de conhecimento editorial escuro, estilo de conhecimento de alto nível, fundo escuro, capa do livro como visual principal, leve zoom da câmera.
4️⃣ Crie storyboards com carimbos de data/hora
Divida a narração em 4 a 6 segmentos visuais, cada um correspondendo a uma informação central.
5️⃣ Prepare os materiais
Capa do livro, título, palavras-chave, logotipo, música de fundo, texto da narração.
6️⃣ Gere a narração em áudio
Você pode usar Edge TTS, ElevenLabs ou workflows relacionados a mídia do Hyperframes.
7️⃣ Transcreva a narração em áudio
Use o áudio final para gerar uma transcrição; não adivinhe manualmente os tempos das legendas.
8️⃣ Crie a composição no Hyperframes
Escreva o index.html usando os dados corretos: data-start / data-duration / data-track-index.
9️⃣ Crie as legendas
Sincronize automaticamente as legendas com base na transcrição.
🔟 Visualize
Assista à prévia primeiro; não renderize o vídeo final diretamente.
1️⃣1️⃣ Valide / Inspecione
Verifique erros, fontes, estouros de layout e legendas obstruindo o conteúdo.
1️⃣2️⃣ Renderize o MP4
Renderize somente depois de confirmar que tudo está correto.
Estes são os passos gerais. Na verdade, muitas partes não exigem intervenção manual, então apenas entender esses passos gerais é suficiente; a parte manual é, na verdade, bem mínima.
3. Desconstrução Manual Inicial + Geração de Roteiro
Agora precisamos desconstruir o vídeo.
Primeiro, precisamos usar o Claude Video para desconstruir a estrutura do vídeo. O que desconstruí foi uma conta de livros, então sua estrutura é muito simples: os primeiros segundos precisam reter o público, seguidos por uma introdução ou resenha do livro.
Os próximos passos para a geração do roteiro de narração são os seguintes:
- Colete informações: (a) Use o Codex para coletar informações sobre o livro. (b) Acesse a conexão do WeChat Reading Skills para ver seções e comentários frequentemente destacados. (c) Peça ao Codex para pesquisar resenhas de livros famosas.
- Gere a introdução: Peça ao Codex para gerar uma introdução com base nos fatos do livro. Esta introdução deve "remover o sabor de IA" para plataformas de mídia própria. Você pode ajustá-la com base em suas necessidades estéticas, com requisitos específicos incluindo: (a) Evitar expressões típicas de IA como "Não é... mas sim...". (b) Evitar estruturas de frases com muito paralelismo. (c) A expressão deve ser suave e natural, contando a história do livro de forma simples, em vez de apresentá-la com um tom arrogante.
Esta parte requer que operemos com base em dois pontos:
- Com base na estrutura do vídeo previamente desconstruído.
- Precisamos atuar como um guardião para revisar se o texto é viável.
Uma vez gerado, você pode transformar o conteúdo coletado e organizado pelo Codex em uma Skill. Dessa forma, os roteiros de narração podem ser reutilizados no futuro.
Tudo deve ser escrito pelo Codex com base em fatos. Após esta operação, ele me dará um roteiro de narração, completando a primeira produção geral do roteiro.
4. Processamento do Arquivo de Áudio TTS: Alcançando uma Voz Natural e Magnética
Depois que a narração estiver pronta, outra grande parte do trabalho — que ainda não automatizei conectando uma API de geração de voz — é o ajuste de áudio.
No entanto, acredito que seja possível, então vou escrever como ajustar a voz para torná-la mais natural, magnética e voltada para a narração de histórias.
Compartilhei anteriormente em um tweet que usei o ElevenLabs, que o Codex recomendou. As vozes em inglês nele são realmente perfeitas, com vozes de vários países disponíveis.
Mas ao usar a geração de voz em Chinês, descobri que ele não reconhece bem o Chinês, resultando em muitos erros de digitação. Neste caso, não é apenas um problema de "sabor de IA"; é simplesmente inutilizável. A solução que o Codex me deu foi usar primeiro o Jianying ou a API do BytePlus (Volcengine).
Como ainda não tenho a API do BytePlus, usei o aplicativo Jianying no meu computador.
Meu método é muito simples:
- Crie um novo projeto e encontre a opção de texto.
- Use a função "Texto para Fala" e escolha uma voz que eu goste.
- Cole o texto da narração diretamente e clique em gerar.
- Finalmente, exporte a voz (o Jianying só consegue exportar arquivos MP4).
- Eu forneço este arquivo MP4 para o Codex.
Com base na análise anterior do Codex sobre a voz, peço que ele me ajude a processar o som para que seja tão natural, contador de histórias e magnético quanto o vídeo de referência.
O processo do Codex para lidar com o som é o seguinte:
- Análise automática: O Codex primeiro analisa os parâmetros de som do vídeo original e modifica meu arquivo MP4 de acordo.
- Configuração de parâmetros: Vou colocar uma captura de tela dos parâmetros relevantes aqui. Você pode enviar a captura de tela para o Codex, e ele processará aquele efeito para você.
- Método simples: Ou use um método ainda mais simples — dê diretamente a ele um segmento do vídeo de referência e diga: "Quero que o som seja processado assim", e o Codex cuidará disso para você.

O som processado desta forma fica perfeito. Depois de dominar essa capacidade de processamento de som, você pode reutilizá-la em outros tipos de produção de vídeo, como:
(a) Explicações de filmes ou narrações de histórias
(b) Vídeos de filosofia de vida ou inspiradores
(c) Contas de divulgação científica
Nesses cenários, este método de processamento de som é totalmente aplicável.
Como mencionei, esta parte idealmente deveria ser automatizada. Na criação de mídia própria, evite o trabalho manual sempre que possível; em um estado tão "sem dor", é muito mais fácil persistir. Então, mais tarde, tentarei usar a API do BytePlus para deixar o Codex gerar automaticamente a narração e os arquivos de áudio TTS.
5. Hyperframes para Visuais, Legendas e Alinhamento de Áudio
O próximo passo é criar os visuais e combinar a voz com as legendas. Nesta fase, não interferi em nada porque o Codex já tinha um plano geral. Já tinha fornecido a ele um vídeo de referência, e agora, com a narração e a narração em áudio, o Codex cria o vídeo por conta própria.
A versão gerada após a criação do vídeo não será perfeita na primeira vez; várias situações podem ocorrer:
- Voz e legendas não combinam Você precisa se comunicar com o Codex e deixá-lo alinhá-las. O Codex extrairá automaticamente quadros para verificar por que não combinam; isso pode exigir cerca de dois ajustes.
- Problemas visuais Incluindo conteúdo visual, posicionamento das legendas e as formas resultantes. Isso pode ser repetidamente comunicado com o Codex, lembrando-o constantemente de se aproximar do vídeo que queremos replicar.
Depois que todo o processo estiver alinhado, podemos gerar vídeos com um alto grau de replicação. Se conseguirmos automatizar todo o fluxo de trabalho, podemos gerenciar contas em lote. Seja uma conta de livros ou outros tipos, todas podem ser desconstruídas e replicadas seguindo este processo.
6. Resumo
Finalmente, espero que este artigo seja útil para todos.
Eu também estou em um estado de aprendizado enquanto faço, e espero que possamos nos comunicar e trocar ideias mais. Muitas vezes, não é que não possamos fazer, mas que ainda não agimos.
O mesmo vale para usar o Codex; desde que comecemos a agir e conversar com o Codex em linguagem natural, podemos encontrar essas soluções passo a passo. Acredito que, desde que todos comecem a fazer, todos podem usar IA para ganhar a vida na mídia própria.
Espero que todos possam usar esta era da IA — uma era em que pessoas comuns podem se aproximar infinitamente da alta produtividade — para fazer mídia própria, para criar, e para encontrar maneiras de replicar, para que possa gerar riqueza mesmo enquanto você dorme, aproximando-se infinitamente da liberdade.
Eu sou a Serena, explorando IA × Web3 × Mídia Própria, registrando como pessoas comuns retomam a iniciativa em suas vidas. Espero que este artigo ajude você!
👏





