Um prompt complexo para criar um filme de 20 segundos em proporção 4:3 com objetos em pixel art, silhuetas estilo câmera térmica e legendas sincronizadas usando Opus 5.5, incluindo direção detalhada e estrutura.
<inputs>
Peça-me: uma narração ou música com uma fala (o arquivo de áudio) e sua transcrição, 10-12 pequenos objetos que resumem minha vida, duas silhuetas iluminadas como por uma câmera térmica (um perfil da cabeça e uma mão levantada), e as 3 palavras que quero destacar mais. Se eu pular alguma, use os padrões: disco de vinil, livro, câmera, gato, moeda, controle de jogo, boné, coração, dinheiro, planta, claquete, skate; silhuetas CC0 gratuitas do Openverse; ação, intenção, curiosidade.
</inputs>
<direction>
Um filme de 20 segundos em proporção 4:3, 1440x1080 a 60fps, cortado conforme a voz. Papel branco-off-white, preto, um vermelho, um amarelo, Geist para cada palavra. Grão de filme em tudo, uma vinheta suave e uma câmera que nunca descansa: um flutuante lento à mão sob tudo, além de um push-in lento dentro de cada cena.
Sem cortes de cena para a próxima: cada transição começa no exato último frame da cena anterior. Os únicos cortes secos são as viradas de ritmo na última palavra.
Cada objeto é pixel art desenhada por você: uma grade de 16x16 por objeto, cada célula com cor colocada manualmente, renderizada como um bloco 3D (extrusão mais escura para baixo-direita, chanfro fino em cada célula) com sombra de contato suave.
As silhuetas são iluminadas como por uma câmera térmica: o calor vem da espessura do corpo em cada ponto, então nariz, cabelo e pontas dos dedos ficam mais frios, além de um hotspot e ruído movendo-se lentamente, mapeados através de uma rampa preto > vermelho > laranja > creme. A borda permanece afiada, com brilho suave fora dela.
Regras de movimento: nada aparece abruptamente (deslizamentos suavizados de cerca de 0,5s com início suave), movimentos rápidos têm motion blur real em vez de cópias fantasma, e legendas digitam com a voz atrás de um cursor em bloco.
Proibido: stock footage, vídeo gerado por IA, movimentos de câmera 3D, partículas, glitch.
</direction>
<structure>
Prenda cada cena aos tempos das palavras da transcrição (meça-os com timestamps de palavras do faster-whisper, um trecho curto por vez):
1. A primeira palavra preenche um cartão amarelo. O cartão limpa para a esquerda e a pergunta digita abaixo em duas linhas centralizadas que deslizam para permanecer centradas enquanto crescem, a palavra-chave sublinhada em vermelho ao ser falada.
2. Os objetos passam velozmente em faixas acima e abaixo das palavras, um flare ciano de quatro pontos entra, então a página queima: o preto fecha das bordas sobre a cabeça, atrás de uma borda vermelha quente.
3. A cabeça esquenta sobre fundo preto enquanto a resposta digita baixa à esquerda. Uma órbita branca fina se desenha ao redor da cabeça, sua metade distante passando atrás dela. Na última palavra, papel floresce de dentro da cabeça com os objetos nela, e a câmera atravessa: a cabeça passa rápido pela lente até que o papel seja tudo o que vemos.
4. Os objetos repousam num anel inclinado visto em perspectiva (os frontais maiores e mais baixos, desenhados por último), girando lentamente, cada um balançando; a moeda gira e cai com faíscas.
5. Em cada uma das 3 palavras, aquele objeto voa para fora do anel à esquerda e cresce, a página inunda de preto a partir dele, e a palavra digita ao lado (câmera: estrela de obturador vermelha; livro: varredura de fita vermelha; disco: duas órbitas brancas e notas vermelhas). Então a inundação drena de volta ao objeto enquanto ele voa para casa, e a câmera mergulha mais perto no anel. Coloque cada objeto herói no slot frontal-esquerdo quando sua palavra chegar.
6. O anel encolhe um pouco, explode para fora, todo objeto vira tinta, e manchas de tinta crescem e engolem a página.
7. A mão sobe no quadro, quente, com a frase dividida de ambos os lados. O coração cai na palma, então levanta ao centro no tamanho que a próxima cena mantém.
8. A última palavra, uma letra por batida, o fundo alternando papel / preto / vermelho, o coração mantendo seu lugar através do corte, o objeto central mudando pixel por pixel para o próximo.
9. Traços finos de pincel varrem, as letras se afastam e flutuam, então assentam de volta na palavra com o coração acima. A câmera continua fazendo push-in durante a pausa.
</structure>
<build>
1. Um canvas HTML. Cada frame é uma função pura do tempo dentro de seek(t).
2. Asse cada sprite de pixel uma vez num canvas offscreen (camadas de extrusão, depois a face), então desenhe-o escalado e rotacionado.
3. O calor: pré-calcule o calor base de cada silhueta uma vez (transformada de distância da máscara, mantida no valor da borda fora dela para que nada escuro vaze quando ampliada). Todo frame, adicione o hotspot e duas oitavas de value noise em resolução de quarto, mapeie através de lookup de 256 passos, amplifique, e corte com a máscara em resolução completa.
4. A travessia da cabeça: desenhe a cena do anel numa camada offscreen, máscar-e com a cabeça ampliada sobre um ponto dentro do crânio, e cresça essa escala numa curva cúbica até que a cabeça cubra o quadro. O anel dentro amplia menos que a cabeça, lendo como profundidade.
5. A morphing de pixels: pareie cada célula do objeto A com uma célula do objeto B e deslize posição e cor de cada uma, com pequeno atraso aleatório por célula.
6. Renderize com Playwright a 60fps com 8 subframes de motion blur, então coloque o áudio original de volta com ffmpeg.
</build>
<gotchas>
Uma máscara PNG sem canal alfa preenche toda a caixa com calor, então coloque a silhueta no alfa. Um membro cortado pela borda da foto mostra como borda reta, então estenda a máscara além do quadro. Uma transição só lê como suave quando o último frame de uma cena é o primeiro da próxima: desenhe a cena de saída sob a transição, e dê cenas que mostram o mesmo anel uma função de zoom compartilhada. Uma inundação ainda recuando quando a próxima cena começa lê como corte seco, então deixe-a terminar primeiro. Uma inundação ease-out rápida lê como salto; use início suave.
</gotchas>
<start>
Peça-me os inputs, meça os tempos das palavras, então mostre-me 8 stills antes de renderizar.
</start>