Trước đây, tôi đã thử dùng Codex và Hyperframes để phân tích một video viral từ tài khoản Douyin về sách, và hiệu ứng âm thanh đã nhận được lời khen ngợi nhất quán từ mọi người.
Hôm nay, tôi viết một bài viết dài để hướng dẫn bạn từng bước cách phân tích video viral Douyin và cố định một quy trình làm việc, để bạn cũng có thể sở hữu khả năng tạo video bằng AI.
https://x.com/369Serena/status/2073012234184282287
1. Chuẩn bị
Đầu tiên, mọi người phải chuẩn bị công cụ:
- Bạn cần một Agent như Codex.
- Sau đó vào cửa hàng plugin để cài hai công cụ:
(a) Hyperframes: Công cụ này tạo video ở định dạng HTML, rất phù hợp cho bài thuyết trình doanh nghiệp, hoạt ảnh dữ liệu hoặc video giới thiệu.
(b) Remotion: Được viết bằng React, giúp biến video thành code. Khi bạn đã cố định một phong cách chủ đề, nó rất phù hợp để tái tạo số lượng lớn thông qua code. Tôi thấy nhiều blogger dùng Remotion để tạo hoạt ảnh theo phong cách "Xiao Lin Shuo", hoạt động rất tốt với video có người nói.
Ngoài ra, bạn có thể cài một số Skills để hỗ trợ phân tích. Nếu bạn muốn hiểu cấu trúc của một video viral—chẳng hạn như vài giây đầu thu hút khán giả thế nào, hiệu ứng âm thanh ra sao, và nhịp điệu giữa lời dẫn và hình ảnh—bạn có thể phân tích và tái tạo chúng thông qua các Skills sau:
- Claude Video: Dùng để phân tích quy trình video, giúp dễ dàng tái tạo ở bước tiếp theo.
- Video Use: Tôi rất khuyên dùng cho người mới chỉnh sửa. Nó hoạt động như một "đạo diễn chỉnh sửa video" có thể gọi các công cụ phù hợp dựa trên nhu cầu của bạn. Đối với người mới không biết khi nào nên dùng công cụ nào, nó đóng vai trò như một đạo diễn bậc thầy.
Đó là kết thúc phần chuẩn bị.
2. Quy trình sản xuất video
Tạo video với Codex + Hyperframes có thể theo trình tự sau:
1️⃣ Định nghĩa thông số video trước
Ví dụ: 30 giây, 9:16, tiếng Trung, kiến thức, giới thiệu sách, cho X / TikTok / Xiaohongshu.
2️⃣ Viết kịch bản dẫn chuyện
Để Codex viết dẫn chuyện tiếng Trung 30 giây trước; đừng vội vào hình ảnh.
3️⃣ Xác nhận phong cách hình ảnh
Ví dụ: video kiến thức biên tập tối, phong cách kiến thức cao cấp, nền tối, bìa sách là hình ảnh chính, zoom nhẹ camera.
4️⃣ Tạo storyboard với timestamp
Chia dẫn chuyện thành 4–6 đoạn hình ảnh, mỗi đoạn tương ứng với một thông tin cốt lõi.
5️⃣ Chuẩn bị tài liệu
Bìa sách, tiêu đề, từ khóa, logo, nhạc nền, văn bản thuyết minh.
6️⃣ Tạo giọng đọc
Bạn có thể dùng Edge TTS, ElevenLabs, hoặc các workflow liên quan đến media của Hyperframes.
7️⃣ Chép lại giọng đọc
Dùng âm thanh cuối cùng để tạo bản chép; đừng tự đoán thời gian phụ đề.
8️⃣ Tạo bố cục Hyperframes
Viết index.html với data-start / data-duration / data-track-index chính xác.
9️⃣ Tạo phụ đề
Tự động đồng bộ phụ đề dựa trên bản chép.
🔟 Xem trước
Xem trước trước; đừng render video cuối cùng trực tiếp.
1️⃣1️⃣ Xác thực / Kiểm tra
Kiểm tra lỗi, phông chữ, tràn bố cục và phụ đề che khuất.
1️⃣2️⃣ Render MP4
Chỉ render sau khi xác nhận mọi thứ đúng.
Đây là các bước tổng quát. Thực tế, nhiều phần không cần can thiệp thủ công, nên chỉ cần hiểu các bước tổng quát này là đủ; phần thủ công thực ra rất ít.
3. Phân tích thủ công ban đầu + Tạo kịch bản
Bây giờ chúng ta cần phân tích video.
Đầu tiên, chúng ta cần dùng Claude Video để phân tích cấu trúc video. Cái tôi phân tích là tài khoản sách, nên cấu trúc rất đơn giản: vài giây đầu cần giữ khán giả, sau đó là giới thiệu hoặc đánh giá sách.
Các bước tiếp theo cho việc tạo kịch bản dẫn chuyện như sau:
- Thu thập thông tin: (a) Dùng Codex để thu thập thông tin sách. (b) Gọi kết nối WeChat Reading Skills để xem các phần được đánh dấu và bình luận thường xuyên. (c) Yêu cầu Codex tìm kiếm các bài đánh giá sách nổi tiếng.
- Tạo phần giới thiệu: Để Codex tạo phần giới thiệu dựa trên sự thật về sách. Phần giới thiệu này phải "loại bỏ mùi AI" cho các nền tảng tự truyền thông. Bạn có thể điều chỉnh theo nhu cầu thẩm mỹ của mình, với các yêu cầu cụ thể bao gồm: (a) Tránh các biểu thức AI điển hình như "Nó không phải... mà là...". (b) Tránh cấu trúc câu quá nhiều song song. (c) Biểu đạt phải trôi chảy và tự nhiên, kể câu chuyện về cuốn sách một cách đơn giản thay vì giới thiệu với giọng điệu kiêu ngạo.
Phần này yêu cầu chúng ta vận hành dựa trên hai điểm:
- Dựa trên cấu trúc video đã phân tích trước đó.
- Chúng ta cần đóng vai trò người gác cổng để xem xét liệu nội dung có khả thi không.
Sau khi tạo, bạn có thể biến nội dung Codex thu thập và sắp xếp thành một Skill. Bằng cách này, các kịch bản dẫn chuyện có thể được tái sử dụng trong tương lai.
Mọi thứ nên được Codex viết dựa trên sự thật. Sau thao tác này, nó sẽ đưa cho tôi một kịch bản dẫn chuyện, hoàn thành việc sản xuất kịch bản tổng thể đầu tiên.
4. Xử lý file TTS âm thanh: Đạt được giọng nói tự nhiên, có sức hút
Sau khi dẫn chuyện sẵn sàng, một phần công việc lớn khác—mà tôi chưa tự động hóa bằng cách kết nối API tạo giọng nói—là điều chỉnh âm thanh.
Tuy nhiên, tôi tin rằng có thể làm được, vì vậy tôi sẽ viết cách điều chỉnh giọng nói để làm cho nó tự nhiên hơn, có sức hút và thiên về kể chuyện.
Tôi trước đây đã chia sẻ trong một tweet rằng tôi đã dùng ElevenLabs, mà Codex đề xuất. Các giọng tiếng Anh trong đó thực sự hoàn hảo, với giọng từ nhiều quốc gia khác nhau.
Nhưng khi sử dụng tạo giọng nói tiếng Trung, tôi thấy nó không nhận diện tiếng Trung tốt, dẫn đến nhiều lỗi chính tả. Trong trường hợp này, nó không chỉ là vấn đề "mùi AI"; nó đơn giản là không thể sử dụng được. Giải pháp Codex đưa cho tôi là sử dụng Jianying hoặc API BytePlus (Volcengine) trước.
Vì tôi chưa có API BytePlus, tôi đã dùng ứng dụng Jianying trên máy tính.
Phương pháp của tôi rất đơn giản:
- Tạo một dự án mới và tìm tùy chọn văn bản.
- Sử dụng chức năng "Text to Speech" và chọn giọng tôi thích.
- Dán trực tiếp nội dung dẫn chuyện và nhấn tạo.
- Cuối cùng, xuất giọng nói (Jianying chỉ có thể xuất file MP4).
- Tôi đưa file MP4 này cho Codex.
Dựa trên phân tích trước đây của Codex về giọng nói, tôi yêu cầu nó giúp tôi xử lý âm thanh để trở nên tự nhiên, có tính kể chuyện và có sức hút như video chuẩn.
Quy trình xử lý âm thanh của Codex như sau:
- Phân tích tự động: Codex trước tiên phân tích các tham số âm thanh của video gốc và sửa đổi file MP4 của tôi tương ứng.
- Cài đặt tham số: Tôi sẽ đặt ảnh chụp màn hình các tham số liên quan ở đây. Bạn có thể gửi ảnh chụp màn hình cho Codex, và nó sẽ xử lý hiệu ứng đó cho bạn.
- Phương pháp đơn giản: Hoặc sử dụng phương pháp thậm chí đơn giản hơn—trực tiếp đưa cho nó một đoạn video chuẩn và nói, "Tôi muốn âm thanh được xử lý như thế này," và Codex sẽ xử lý cho bạn.

Âm thanh được xử lý theo cách này là hoàn hảo. Một khi bạn thành thạo khả năng xử lý âm thanh này, bạn có thể tái sử dụng nó trong các loại sản xuất video khác, chẳng hạn như:
(a) Giải thích phim hoặc kể chuyện
(b) Video triết lý sống hoặc truyền cảm hứng
(c) Tài khoản phổ biến khoa học
Trong các kịch bản này, phương pháp xử lý âm thanh này hoàn toàn áp dụng được.
Như tôi đã đề cập, phần này lý tưởng nên được tự động hóa. Trong sáng tạo tự truyền thông, tránh công việc thủ công bất cứ khi nào có thể; trong trạng thái "không đau đớn" như vậy, việc kiên trì dễ dàng hơn nhiều. Vì vậy, sau này, tôi sẽ thử sử dụng API BytePlus để Codex tự động tạo dẫn chuyện và file TTS giọng nói.
5. Hyperframes cho hình ảnh, phụ đề và căn chỉnh âm thanh
Tiếp theo là tạo hình ảnh và khớp giọng nói với phụ đề. Ở giai đoạn này, tôi không can thiệp gì cả vì Codex đã có kế hoạch tổng quát. Tôi đã đưa cho nó một video chuẩn, và bây giờ với dẫn chuyện và giọng đọc, Codex tự tạo video.
Phiên bản được tạo sau khi tạo video sẽ không hoàn hảo ngay lần đầu; một số tình huống có thể xảy ra:
- Giọng nói và phụ đề không khớp: Bạn cần giao tiếp với Codex và để nó căn chỉnh chúng. Codex sẽ tự động trích xuất khung hình để kiểm tra tại sao chúng không khớp; điều này có thể cần khoảng hai lần điều chỉnh.
- Vấn đề hình ảnh: Bao gồm nội dung hình ảnh, vị trí phụ đề và các hình thức kết quả. Những điều này có thể được giao tiếp lặp đi lặp lại với Codex, liên tục nhắc nhở nó tiến gần hơn đến video chúng ta muốn tái tạo.
Một khi toàn bộ quy trình được làm mượt, chúng ta có thể tạo video với mức độ tái tạo cao. Nếu chúng ta có thể tự động hóa toàn bộ quy trình làm việc, chúng ta có thể chạy tài khoản theo lô. Dù là tài khoản sách hay các loại khác, tất cả đều có thể được phân tích và tái tạo theo quy trình này.
6. Tổng kết
Cuối cùng, tôi hy vọng bài viết này hữu ích cho mọi người.
Tôi cũng đang trong trạng thái vừa học vừa làm, và tôi hy vọng chúng ta có thể giao tiếp và trao đổi ý tưởng nhiều hơn. Thường thì, không phải chúng ta không thể làm được, mà là chúng ta chưa hành động.
Điều tương tự cũng áp dụng cho việc sử dụng Codex; miễn là chúng ta bắt đầu hành động và trò chuyện với Codex bằng ngôn ngữ tự nhiên, chúng ta có thể tìm ra các giải pháp này từng bước. Tôi tin rằng miễn là mọi người bắt đầu làm, mọi người đều có thể sử dụng AI để kiếm sống trong tự truyền thông.
Tôi hy vọng mọi người có thể sử dụng kỷ nguyên AI này—một kỷ nguyên mà người thường có thể tiếp cận vô hạn năng suất cao—để làm tự truyền thông, để sáng tạo, và tìm cách tái tạo để nó có thể tạo ra của cải ngay cả khi bạn ngủ, tiến gần vô hạn đến tự do.
Tôi là Serena, khám phá AI × Web3 × Tự truyền thông, ghi lại cách người thường giành lại quyền chủ động trong cuộc sống của họ. Hy vọng bài viết này giúp ích cho bạn!
👏





