Come creare VFX che uniscono live-action e animazione disegnata a mano | ChatGPT x Seedance 2.0

@genel_ai
GIAPPONESE14 ore fa · 27 lug 2026
112K
118
10
1
230

TL;DR

Questo tutorial svela un workflow preciso per creare video ibridi che combinano live-action e animazione disegnata a mano, utilizzando ChatGPT per strutturare prompt con time-code per il generatore video Seedance 2.0.

Ciao! Sono GENEL.

Questa volta ho creato un video live-action x animazione in cui dei disegni animati a mano spuntano in una stanza reale e ci giocano!

https://x.com/genel_ai/status/2081307056838263052

In questo post vi spiegherò:

  • Come realizzare questo video
  • I prompt effettivi utilizzati

Scrivere Prompt a Caso Porta al Fallimento

Con questo tipo di video, se inizi a scrivere prompt a caso, quasi mai viene come vuoi.

Ecco cosa è stato generato con un prompt tipo "Animazione disegnata a mano che si fonde con un parco divertimenti notturno live-action e la telecamera la segue":

GENEL | AIを用いた動画制作 - inline image

Ha alcuni punti validi, ma alcune parti non sembrano animazione disegnata a mano, e sentivo che mancava qualcosa.

Quindi, questa volta ho pensato alla scenografia in dettaglio, secondo per secondo, e l'ho trasformata in un prompt.

Prima, Restringi la Struttura a 4 Punti

Prima di decidere i secondi esatti, ho stabilito approssimativamente cosa sarebbe successo nei 15 secondi. Se si diventa troppo avidi qui, sicuramente va tutto a rotoli, quindi ho ridotto il nucleo della storia a soli quattro punti.

  1. L'animazione nasce dalla mano
  2. Entra nello schermo del PC
  3. Salta fuori dal PC e si muove per la stanza
  4. Si trasforma in un mostro

È un unico flusso in cui "gli scarabocchi invadono una stanza reale".

GENEL | AIを用いた動画制作 - inline image

C'erano molte altre cose che volevo facesse, ma non ci stavano in 15 secondi. Qui bisogna avere pazienza.

Assegnazione ai Segmenti Temporali

Una volta decisa la struttura, distribuitela nel tempo.

0-3 secondi: Una linea bianca nasce dalla mano, diventa una stella gialla e vola verso il PC.

3-6 secondi: Dentro lo schermo del PC, passa da una linea rossa a un cuore a un vortice blu, poi salta fuori.

6-10 secondi: Si muove per la stanza trasformandosi: farfalla -> serpente rosa -> mostro polpo.

10-13 secondi: Aprendo il frigorifero appare un personaggio hamburger -> si trasforma in un mostro.

13-15 secondi: Un enorme occhio appare sulla parete, sbatte le palpebre e si trasforma in un sorriso.

Come ho scritto nel mio precedente articolo sugli effetti visivi, dividere per tempo e scrivere in ordine lo rende stabile.

[Clicca qui per l'articolo precedente]

https://note.com/genel/n/nb2c4b89fa1d8?sub_rt=share_sb

Sembra che le istruzioni passino più facilmente se divise in segmenti, invece di dare una descrizione lunga e confusa della situazione!

Strumenti Utilizzati: ChatGPT e Seedance 2.0

Una volta deciso questo, non resta che trasformarlo in un video. Ho usato solo questi due strumenti di IA.

1. ChatGPT | Converte il progetto in un prompt 2. Seedance 2.0 | Trasforma quel prompt in un video

Il punto chiave è non limitarsi a scaricare tutto su ChatGPT e chiedergli di "pensare a un video figo".

Se gli dai il progetto che hai creato tu stesso, prenderà forma quasi esattamente come previsto. Al contrario, se lasci tutto all'IA, otterrai qualcosa di generico come l'esempio del parco divertimenti.

Tuttavia, se butti semplicemente ciò che hai deciso a ChatGPT, ti restituirà un testo disarticolato e difficile da leggere. Se lo passi direttamente a Seedance, non sarà comunque stabile.

Quindi, ho anche specificato l'ordine dell'output.

1. La riga di apertura (durata, rapporto d'aspetto, cosa si fonde con cosa) 2. L'atmosfera dello spazio live-action e la texture di una registrazione con smartphone 3. Movimento al secondo (0-3s / 3-6s / 6-10s / 10-13s / 13-15s) 4. Un riassunto finale della texture del disegno a mano, del metodo di tracking della telecamera, dei prompt negativi e del suono ambientale

Ecco il testo delle istruzioni che ho effettivamente dato a ChatGPT:

text
1[Istruzioni per ChatGPT]
2Creerò un prompt per la generazione di un video di 15 secondi.
3Per favore, converti il seguente progetto in un prompt da passare a un'IA di generazione video.
4
5Progetto
6Ambientazione: Una stanza buia e vissuta, illuminata solo da una calda illuminazione indiretta e da piccole luci decorative.
7Tipo di video: Animazione glow disegnata a mano x live-action
8Eventi:
90-3s: Una linea bianca nasce da una mano, diventa una stella gialla e vola verso un PC.
103-6s: Dentro lo schermo del PC, linea rossa -> cuore -> vortice blu, poi salta fuori.
116-10s: Si trasforma in farfalla -> serpente rosa -> mostro polpo mentre si muove per la stanza.
1210-13s: Aprendo il frigo appare un personaggio hamburger -> si trasforma in un mostro.
1313-15s: Un enorme occhio appare sulla parete, sbatte le palpebre e si trasforma in un sorriso.
14
15Regole di scrittura:
16- Quando le forme cambiano, scrivi "si trasforma collassando nella forma successiva" invece di "scompare e appare la successiva".
17- Alla fine di ogni segmento, descrivi sempre il movimento della telecamera. L'animazione si muove per prima, e la telecamera la segue con un ritardo.
18- Mantieni la continuità del camminare e del seguire nello stesso spazio senza tagli.
19- Per il lato live-action, simula la ripresa con smartphone a una mano. Includi scossa della telecamera, leggera caccia al fuoco, rumore in condizioni di scarsa illuminazione e fluttuazioni dell'esposizione automatica.
20- Per l'animazione disegnata a mano, usa texture come pastello, gesso, matita colorata o pennelli ruvidi. Le linee dovrebbero tremare ad ogni fotogramma con colorazione irregolare e sfocatura.
21
22Ordine di output:
231. Una riga: "Video di 15 secondi, 16:9 orizzontale. Un video che fonde live-action [luogo] con animazione glow disegnata a mano."
242. Atmosfera dello spazio live-action e texture simile a smartphone.
253. Ogni segmento: 0-3s / 3-6s / 6-10s / 10-13s / 13-15s.
264. Riepilogo finale della texture dell'animazione disegnata a mano, tracking della telecamera, prompt negativi e suoni ambientali.
27
28Prompt negativi da includere:
293DCG troppo preciso, linee vettoriali troppo lisce, espressioni simili a tubi al neon, riprese con gimbal perfettamente stabili, illuminazione eccessivamente cinematografica, fotografia commerciale perfettamente composta, sottotitoli, loghi, BGM.
30
31Niente titoli o spiegazioni. Output solo il testo del prompt.
GENEL | AIを用いた動画制作 - inline image

Schermata della chat effettiva con ChatGPT

Ecco il prompt che è stato creato:

text
115 secondi, video orizzontale 16:9. Un video che fonde un interno live-action buio con animazione glow disegnata a mano.
2Una stanza leggermente disordinata e vissuta, illuminata solo da una calda illuminazione indiretta e da piccole luci decorative a stringa. Forte scossa della telecamera come se fosse filmata a una mano con uno smartphone, leggera caccia al fuoco, rumore in condizioni di scarsa illuminazione e fluttuazioni dell'esposizione automatica. Texture reale, non raffinata come una pubblicità commerciale, ma come se fosse stata catturata accidentalmente da un individuo nella sua stanza.
30-3s:
4Una mano live-action alzata a sinistra dello schermo. Una linea bianca disegnata a mano nasce dalla punta delle dita, si aggrappa alla mano live-action e diventa la forma di un'altra mano bianca. Le linee sono sfocate come se fossero disegnate con pastelli o gesso e tremano finemente ad ogni fotogramma. La mano bianca collassa trasformandosi in una piccola stella gialla, che vola verso un laptop in basso a destra con una scia. La telecamera segue la stella con un leggero ritardo, panoramica bruscamente verso il basso a destra.
53-6s:
6La stella gialla entra nello schermo del laptop. Linee rosse disegnate a mano scarabocchiano violentemente sullo schermo del PC, trasformandosi istantaneamente in un cuore rosso. Il cuore trema e si trasforma in un vortice blu, poi salta fuori vigorosamente dallo schermo del PC. La linea blu si allunga come qualcosa tra liquido e fiamma, e la telecamera si inclina rapidamente verso l'alto per seguirlo. Sfocatura da movimento naturale dovuta al movimento improvviso della telecamera.
76-10s:
8Il vortice blu si trasforma in una farfalla azzurra sul muro e vola verso il fondo della stanza. La telecamera segue la farfalla mentre si cammina. La farfalla si trasforma in una linea rosa simile a un serpente, strisciando lungo il muro, la porta e il pavimento. Al centro della porta, la linea rosa vorticosa e si trasforma in un piccolo mostro disegnato a mano simile a un polpo. Il mostro guarda la telecamera per un momento e poi fugge verso il frigorifero. La telecamera lo segue frettolosamente.
910-13s:
10Raggi di luce e frecce gialle disegnate a mano appaiono sulla porta del frigorifero, e la porta si spalanca. All'interno del frigorifero bluastro c'è un simpatico personaggio hamburger con occhi e arti sottili. Un attimo dopo, la bocca dell'hamburger si spalanca, trasformandosi in un mostro comico con un interno rosso e zanne triangolari. La telecamera trema violentemente come se il filmatore fosse spaventato, e la porta del frigorifero viene chiusa rapidamente.
1113-15s:
12La telecamera si muove all'indietro per mostrare l'intera stanza. Il contorno di un enorme occhio bianco è disegnato sulla parete superiore, e una vivida pupilla blu appare all'interno. Subito dopo che l'occhio sbatte lentamente le palpebre una volta, si trasforma in un enorme sorriso rosa e bianco con molti denti triangolari. La telecamera si inclina per la sorpresa e lo schermo si oscura per finire.
13L'animazione disegnata a mano è un'animazione frame-by-frame grezza, non una CG fluida. Lo spessore della linea, i contorni e la colorazione tremolano costantemente leggermente, mantenendo la texture di pastelli, gesso, matite colorate e pennelli ruvidi. Colori vividi e luminosi incentrati su bianco, giallo, azzurro, rosa e arancione. C'è un debole bagliore intorno all'animazione, ma non illumina troppo lo spazio live-action.
14La telecamera segue sempre leggermente indietro rispetto all'animazione. L'animazione esce prima dall'inquadratura, e la telecamera a mano libera esegue una panoramica, un' inclinazione o si muove in avanti in quella direzione con un ritardo. Sono vietate riprese con gimbal perfettamente stabili. Non usare 3DCG troppo precisi, linee vettoriali troppo lisce, illuminazione cinematografica, profondità di campo eccessiva, fotografia commerciale perfettamente composta, sottotitoli, loghi o BGM. Includi solo suoni interni, fruscii di vestiti, passi, piccoli suoni di operazione del PC, l'apertura e la chiusura del frigo, e leggeri suoni elettronici e versi comici delle creature disegnate a mano.
GENEL | AIを用いた動画制作 - inline image

Schermata della chat effettiva con ChatGPT

Ora, prendi questo prompt e usa la funzione "Testo in Video" nell'IA di generazione video "Seedance 2.0"!

Per maggiori informazioni su Seedance 2.0, consulta questo articolo su Note:

[Clicca qui per l'articolo su Seedance 2.0]

https://note.com/genel/n/n3aac3300f211?sub_rt=share_sb

Dopo aver copiato e incollato il prompt, impostato il tempo di generazione a 15 secondi e generato il video, il risultato è questo!

GENEL | AIを用いた動画制作 - inline image

È venuto benissimo! Ho aggiunto il BGM generato con SUNO successivamente.

Come Realizzare Versioni Diverse

Questa è la parte che voglio consigliare di più questa volta 💡

Potreste pensare:

"Ora so fare lo stesso identico video di GENEL, ma cosa devo fare se voglio fare un video diverso?"

📢 Quindi, ho preparato delle istruzioni che vi permettono di creare varianti e produrle in serie!!

Basta copiare e incollare queste istruzioni per generare video come questi uno dopo l'altro!

GENEL | AIを用いた動画制作 - inline image
GENEL | AIを用いた動画制作 - inline image

Li presento in questo articolo su Note, quindi date un'occhiata se siete interessati ✨

https://note.com/genel/n/nd1b5b0129ab5?sub_rt=share_sb

Rielabora in YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Per i creator

Trasforma il tuo Markdown in un articolo 𝕏 pulito

Quando pubblichi i tuoi testi lunghi, formattare immagini, tabelle e blocchi di codice per 𝕏 è una seccatura. YouMind trasforma un'intera bozza Markdown in un articolo 𝕏 pulito e pronto da pubblicare.

Prova Markdown verso 𝕏

Altri pattern da decodificare

Articoli virali recenti

Esplora altri articoli virali