Trong bài 3, bạn đã so sánh 5 công cụ tạo video bằng AI tốt nhất và biết được rằng Kling 3.0 là lựa chọn khởi đầu được khuyên dùng - nhờ chất lượng tốt nhất, có gói miễn phí và gói trả phí với mức giá hợp lý. Giờ là lúc bạn bắt đầu sử dụng nó!
Sau khi hoàn thành bài học này, bạn sẽ tạo được hai đoạn video bằng AI: Một đoạn từ văn bản và một đoạn từ hình ảnh. Tổng thời gian thực hiện khoảng 10 phút.
Trước khi bắt đầu: Quy tắc "Ưu tiên hình ảnh"
Dưới đây là bí quyết quan trọng nhất dành cho người mới bắt đầu - điều mà hầu hết mọi người thường bỏ qua:
Hãy thử nghiệm ý tưởng của bạn dưới dạng hình ảnh trước.
Việc tạo video bằng AI tiêu tốn nhiều credit và thời gian hơn so với tạo hình ảnh. Nếu câu lệnh (prompt) của bạn tạo ra một hình ảnh không đẹp, thì video tạo ra cũng sẽ không đạt yêu cầu. Vì vậy, trước khi sử dụng credit cho video:
Sử dụng một công cụ tạo ảnh AI miễn phí (như ChatGPT, Gemini hoặc tính năng tạo ảnh trong Kling)
Tạo một hình ảnh tĩnh từ câu lệnh của bạn
Kiểm tra: Hình ảnh trông có ổn không? Bố cục có đẹp không? Màu sắc có đúng ý bạn không?
Nếu có → hãy chuyển sang bước tạo video. Nếu không → hãy chỉnh sửa câu lệnh và thử tạo lại hình ảnh.
Thói quen này sẽ giúp bạn tiết kiệm hàng giờ đồng hồ bực bội và tránh lãng phí hàng chục credit.
Hướng dẫn từng bước tạo video đầu tiên từ văn bản
Bước 1: Mở Kling
Truy cập klingai.com và tạo tài khoản miễn phí. Bạn có thể đăng ký bằng Google, email hoặc số điện thoại. Quá trình này chỉ mất khoảng 30 giây.
Bước 2: Chọn "AI Video"
Trên bảng điều khiển, hãy nhấp vào mục "AI Video" (không phải "AI Image"). Bạn sẽ thấy một ô nhập văn bản để điền câu lệnh cùng các tùy chọn cài đặt ở phía bên phải.
Bước 3: Viết một câu lệnh đơn giản
Đối với video đầu tiên, hãy giữ mọi thứ thật đơn giản. Hãy sử dụng câu lệnh sau:
Một tách cà phê đang bốc khói đặt trên chiếc bàn gỗ mộc mạc. Ánh nắng ban mai chiếu qua khung cửa sổ gần đó, tạo nên luồng sáng vàng ấm áp. Camera từ từ zoom vào tách cà phê. Làn khói nhẹ bay lên từ tách cà phê.
Tại sao câu lệnh (prompt) này hiệu quả:
Một chủ thể duy nhất (cốc cà phê) - tránh các cảnh phức tạp với nhiều yếu tố
Bối cảnh rõ ràng (bàn gỗ, ánh sáng buổi sáng) - cung cấp ngữ cảnh cho AI
Chuyển động đơn giản (zoom chậm, hơi nước bốc lên) - các chuyển động nhẹ nhàng thường mang lại kết quả tốt nhất
Ánh sáng cụ thể (ánh nắng buổi sáng, tông màu vàng) - AI cần xác định hướng sáng
Bước 4: Thiết lập các tùy chọn
Thời lượng: Bắt đầu với 5 giây (thời lượng ngắn hơn = chất lượng tốt hơn cho lần thử đầu tiên)
Tỷ lệ khung hình: 16:9 cho khung hình ngang (landscape), 9:16 cho story/reels trên mạng xã hội
Chất lượng: Tiêu chuẩn (tiết kiệm credit, đủ tốt để đánh giá)
Bước 5: Tạo video và chờ đợi
Nhấn nút "Generate". Kling thường mất từ 1-3 phút để tạo một đoạn video dài 5 giây. Bạn sẽ thấy thanh hiển thị tiến trình.
Bước 6: Đánh giá kết quả
Xem video của bạn. Hãy tự hỏi:
Bối cảnh tổng thể có khớp với những gì bạn đã mô tả không?
Chuyển động mượt mà hay bị giật?
Có xuất hiện lỗi hình ảnh (artifact) kỳ lạ nào không?
Bạn có muốn chia sẻ video này lên mạng xã hội không?
Nếu kết quả tốt - xin chúc mừng, bạn vừa tạo ra một video bằng AI. Nếu kết quả chưa hoàn hảo, đó là chuyện bình thường. Bạn sẽ học cách cải thiện câu lệnh trong bài 5.
Kiểm tra nhanh: Tại sao chúng ta lại chọn hình ảnh cốc cà phê bốc hơi nước làm câu lệnh đầu tiên thay vì cảnh một người đang đi bộ trên phố?
Câu trả lời: Các cảnh đơn giản với một chủ thể và chuyển động nhẹ nhàng (hơi nước bốc lên, zoom chậm) giúp phát huy tối đa thế mạnh của AI. Cảnh người đi bộ đòi hỏi xử lý các chuyển động cơ thể phức tạp, chi tiết khuôn mặt và chuyển động chân thực - đây đều là những khía cạnh mà AI thường gặp khó khăn nhất.
Tạo video từ hình ảnh đầu tiên của bạn
Bây giờ, hãy thử loại thứ hai: Chuyển đổi một hình ảnh tĩnh thành video.
Bước 1: Tìm hoặc tạo hình ảnh
Bạn cần một hình ảnh nguồn. Các lựa chọn bao gồm:
Ảnh sản phẩm của doanh nghiệp bạn
Ảnh phong cảnh chụp bằng điện thoại
Ảnh do AI tạo ra (từ ChatGPT, Midjourney hoặc tính năng tạo ảnh của Kling).
Đối với bài tập này, hãy sử dụng bất kỳ bức ảnh nào bạn có. Ảnh chụp sản phẩm, ảnh thú cưng hay ảnh phong cảnh đều phù hợp.
Bước 2: Chuyển sang chế độ "Image-to-Video"
Trong Kling, hãy chuyển từ chế độ "Text to Video" sang "Image to Video". Sau đó, upload hình ảnh của bạn lên.
Bước 3: Thêm câu lệnh mô tả chuyển động (Motion Prompt)
Hãy cho AI biết bạn muốn thêm chuyển động nào. Ví dụ:
Với ảnh sản phẩm: "Xoay sản phẩm chậm rãi với hiệu ứng làm mờ hậu cảnh nhẹ nhàng"
Với ảnh phong cảnh: "Di chuyển máy quay nhẹ nhàng từ trái sang phải, mây trôi chậm"
Với ảnh thú cưng: "Con vật chớp mắt và quay đầu nhẹ"
Bước 4: Tạo và so sánh
Tạo video và so sánh nó với hình ảnh gốc của bạn. Hãy quan sát cách AI diễn giải "chuyển động" từ một bức ảnh tĩnh - một số chuyển động trông rất tự nhiên, trong khi số khác có thể trông gượng gạo hoặc thiếu tự nhiên.
Điều gì vừa diễn ra và bước tiếp theo là gì?
Bạn đã tạo được hai video bằng AI:
Text-to-video: Cảnh tách cà phê - được tạo hoàn toàn từ mô tả bằng văn bản của bạn
Image-to-video: Bức ảnh của bạn trở nên sống động nhờ chuyển động.
Nếu cả hai video đều tuyệt vời - bạn đang đi trước xu hướng đấy. Nếu chúng chưa hoàn hảo, điều đó hoàn toàn bình thường. Hai bài học tiếp theo sẽ giúp cải thiện đáng kể kết quả của bạn: Bài 5 hướng dẫn cách viết câu lệnh để tạo video chất lượng hơn và bài 6 hướng dẫn cách khắc phục các vấn đề thường gặp.
Kiểm tra nhanh: Điểm khác biệt chính giữa hai bài tập của bạn là gì? Trong "Text-to-video", AI tạo ra mọi thứ từ con số không. Còn trong "Image-to-video", AI đã sử dụng dữ liệu nào làm nền tảng?
Câu trả lời: Với tính năng chuyển đổi từ ảnh sang video, AI đã có sẵn bức ảnh của bạn làm cơ sở tham chiếu ban đầu - nó đã biết trước bối cảnh trông như thế nào và chỉ cần thêm chuyển động vào. Đó là lý do tại sao việc chuyển đổi từ ảnh sang video thường mang lại kết quả dễ dự đoán hơn so với chuyển đổi từ văn bản sang video.
Thử ngay: Công cụ tạo video AI đầu tiên (Văn bản + Hình ảnh)
Hãy đóng vai huấn luyện viên hướng dẫn tôi tạo video đầu tiên trên Kling 3.0. Hãy cung cấp các câu lệnh (prompt) theo cặp - chuyển văn bản thành video và hình ảnh thành video - được tinh chỉnh cho bối cảnh của tôi, để hai lần tạo video đầu tiên đều thành công mỹ mãn thay vì lãng phí credit.
Bối cảnh của tôi:
- Chủ thể (một đối tượng chính): [ví dụ: "cốc cà phê đang bốc khói" / "sản phẩm Etsy của tôi" / "chó Golden Retriever của tôi"]
- Bối cảnh: [ví dụ: "bàn gỗ mộc mạc cạnh cửa sổ" / "phông nền studio màu trắng" / "công viên mùa thu vào giờ vàng"]
- Hành động / chuyển động (nhẹ nhàng, tinh tế): [ví dụ: "làn khói nhẹ bốc lên" / "xoay chậm 180 độ" / "vểnh tai và nghiêng đầu"]
- Phong cách: [điện ảnh / quảng cáo / quay cầm tay / mơ màng / phim tài liệu]
- Cảm xúc (3 tính từ): [liệt kê]
- Thời lượng: [5 giây / 8 giây / 10 giây]
- Hình ảnh nguồn (cho tính năng image-to-video): [mô tả hình ảnh hoặc ghi "không có, chỉ dùng text-to-video"]
Kết quả đầu ra:
1. Câu lệnh TEXT-TO-VIDEO sẵn sàng để sao chép, sử dụng cấu trúc: "chủ thể + hành động + bối cảnh + phong cách + chuyển động máy quay + ánh sáng".
2. Câu lệnh chuyển động IMAGE-TO-VIDEO sẵn sàng để sao chép cho cùng bối cảnh đó (1-2 câu, chỉ mô tả chuyển động tinh tế).
3. Dự đoán "những lỗi có thể xảy ra": hai lỗi AI thường gặp với bối cảnh này (ví dụ: biến dạng tay/mặt, lỗi hiển thị văn bản, méo hình nền).
4. Một câu lệnh sửa lỗi tôi sẽ dùng nếu kết quả đầu tiên mắc phải lỗi đã dự đoán.
5. Ước tính số lượng credit cho 1 video text-to-video (5 giây) + 1 video image-to-video (5 giây) trên Kling 3.0 (gói miễn phí so với gói trả phí).
QUY TẮC BẮT BUỘC:
- Nếu chủ thể là người thật có thể nhận diện được (không phải hình bóng nhìn từ phía sau): từ chối thực hiện trừ khi tôi xác nhận đã có sự đồng ý bằng văn bản của người đó - video AI về người thật khi chưa có sự đồng ý có thể bị coi là deepfake (vi phạm các đạo luật như TAKE IT DOWN Act, ELVIS Act, NY 50-f, và luật NCII tại hơn 48 tiểu bang).
- Nếu chủ thể bao gồm trẻ em: từ chối thực hiện. Tuyệt đối không làm. Việc tạo hình ảnh trẻ vị thành niên bằng AI có nguy cơ vi phạm luật về tài liệu lạm dụng tình dục trẻ em (CSAM - theo điều luật 18 USC §2256), bất kể mục đích ban đầu là gì.
- Nếu hình ảnh nguồn chứa logo đã đăng ký nhãn hiệu, nhân vật có bản quyền hoặc tác phẩm nghệ thuật nổi tiếng: hãy loại bỏ các yếu tố này trước khi tải lên HOẶC từ chối tạo video. Việc tải lên hình ảnh nhân vật Disney, chẳng hạn, sẽ dẫn đến thông báo gỡ bỏ nội dung trên bất kỳ nền tảng nào.
- Nếu bối cảnh là địa điểm thực gắn liền với cá nhân cụ thể (nhà riêng, trường tư thục): có nguy cơ vi phạm quyền riêng tư hoặc quyền sử dụng hình ảnh cá nhân, hãy từ chối thực hiện.
- Thêm thông tin xác thực nội dung C2PA khi công cụ hỗ trợ tính năng này. Không được loại bỏ thông tin này - các nền tảng thường coi video AI không có nhãn xác thực là nội dung gây hiểu lầm hoặc lừa dối.
- Nếu video được dùng cho mục đích thương mại, hãy kiểm tra xem gói dịch vụ hiện tại có cho phép quyền thương mại hay không (ví dụ: gói miễn phí của Kling chỉ cho phép sử dụng thương mại hạn chế; gói trả phí thì được phép; điều khoản hiện tại của Luma và Runway cũng cho phép, với Runway là sử dụng dựa trên số lượng credit). Đừng tự ý mặc định.
- Không nhập câu lệnh (prompt) yêu cầu tạo hình ảnh máu me, vũ khí hoặc bạo lực thực tế trong các video dành cho mạng xã hội - chính sách của các nền tảng đều cấm những nội dung này, bất kể chúng được tạo ra bởi AI hay không.
- Nếu đang dùng gói miễn phí và định tiêu tốn credit để tạo đi tạo lại cùng một bối cảnh: hãy cân nhắc thử nghiệm ý tưởng dưới dạng hình ảnh tĩnh AI trước (bằng Midjourney, Ideogram hoặc ChatGPT) - quy trình thử nghiệm và chỉnh sửa này sẽ tiết kiệm chi phí hơn nhiều.
Cách điền thông tin: Thay thế các phần trong ngoặc vuông [] hoặc những nội dung giữ chỗ bằng thông tin cụ thể từ tình huống thực tế của bạn. Đầu vào mơ hồ sẽ dẫn đến kết quả mơ hồ - hãy đưa ra thông tin cụ thể.
Những gì bạn sẽ nhận được: Hai câu lệnh (prompt) sẵn sàng để sao chép (chuyển văn bản thành video + chuyển hình ảnh thành video), dự đoán về các vấn đề có thể phát sinh, một câu lệnh để khắc phục lỗi, cùng những thông tin về tiêu chuẩn C2PA, sự đồng ý và quyền thương mại cho lần tạo video đầu tiên của bạn.
Cách xử lý kết quả: Lưu lại phản hồi vào ứng dụng ghi chú. Chọn ra một gợi ý mang lại hiệu quả cao nhất và thực hiện ngay trong tuần này - đừng cố gắng làm tất cả mọi thứ cùng lúc.
Nếu kết quả chưa đạt yêu cầu: Nếu các gợi ý có vẻ quá chung chung, hãy dán câu lệnh bổ sung sau: "Hãy đưa ra gợi ý cụ thể hơn cho bối cảnh thực tế của tôi. Bỏ qua những lời khuyên chung chung". Nếu hệ thống bỏ sót các chi tiết quan trọng bạn đã cung cấp, hãy thêm nội dung: "Bạn đã bỏ sót [X] trong bối cảnh của tôi - hãy thực hiện lại với yếu tố đó là yêu cầu trọng tâm".
Những điểm chính cần lưu ý
Luôn thử nghiệm ý tưởng dưới dạng hình ảnh AI trước tiên - cách này tiết kiệm chi phí, nhanh chóng và giúp phát hiện vấn đề từ sớm
Các câu lệnh đơn giản với một chủ thể và chuyển động nhẹ nhàng thường mang lại kết quả ban đầu tốt nhất
Chuyển văn bản thành video giúp tạo ra nội dung hoàn toàn mới; chuyển hình ảnh thành video giúp thêm chuyển động vào các bức ảnh có sẵn
Video AI đầu tiên của bạn không cần phải hoàn hảo ngay lập tức - việc chỉnh sửa và hoàn thiện dần là một phần của quy trình
Các đoạn video dài 5 giây là điểm khởi đầu lý tưởng nhất (thời lượng ngắn hơn = chất lượng tốt hơn)
Câu 1:
Câu lệnh (prompt) đầu tiên nào phù hợp để thử nghiệm bất kỳ công cụ tạo video AI nào?
GIẢI THÍCH:
Các cảnh đơn giản với một chủ thể và chuyển động nhẹ nhàng giúp phát huy thế mạnh của AI. Đây là cách tốt nhất để thử nghiệm công cụ vì bạn sẽ nhận được kết quả tốt, giúp ích cho quá trình học hỏi. Ngược lại, các cảnh phức tạp, cận cảnh khuôn mặt hay video dài thường bộc lộ những điểm yếu của AI.
Câu 2:
Bạn đã tạo video AI đầu tiên; kết quả khá ổn nhưng chưa hoàn hảo. Bước tiếp theo hợp lý nhất là gì?
GIẢI THÍCH:
Quá trình thử nghiệm và cải tiến liên tục là yếu tố then chốt khi làm video AI. Những thay đổi nhỏ trong câu lệnh thường mang lại sự cải thiện lớn. Nếu video "khá ổn nhưng chưa hoàn hảo", việc tinh chỉnh các chi tiết cụ thể (như ánh sáng, góc máy, tốc độ chuyển động) sẽ hiệu quả hơn nhiều so với việc bắt đầu lại từ đầu.
Câu 3:
Trước khi tạo video AI, bạn nên làm gì đầu tiên để tiết kiệm credit và thời gian?
GIẢI THÍCH:
Thử nghiệm với ảnh AI trước là cách tiết kiệm thời gian hiệu quả nhất. Việc tạo ảnh tốn ít chi phí và thời gian hơn. Nếu hình ảnh chưa đạt yêu cầu, bạn có thể chỉnh sửa câu lệnh trước khi tốn credit cho việc tạo video vốn đắt đỏ hơn.
Theo Nghị định 147/2024/ND-CP, bạn cần xác thực tài khoản trước khi sử dụng tính năng này. Chúng tôi sẽ gửi mã xác thực qua SMS hoặc Zalo tới số điện thoại mà bạn nhập dưới đây: