Tôi làm 8 ảnh thumbnail YouTube bằng AI: kích thước, bố cục và bốn tấm bị loại

Tôi làm 8 ảnh thumbnail YouTube bằng AI: kích thước, bố cục và bốn tấm bị loại

Nghiên cứu điển hìnhXuất bản trên

Một video có được bấm vào hay không phụ thuộc vào ảnh thumbnail nhiều hơn phần lớn mọi người tưởng. Tôi dành trọn một buổi chiều để làm một bộ đủ 8 ảnh thumbnail YouTube bằng tạo ảnh AI. Bốn tấm bị loại dọc đường, một kết quả đi ngược lời khuyên tôi vẫn mặc định là đúng, và tôi còn phạm một sai lầm căn bản hơn, đáng có riêng một mục.

Đo kỹ thông số trước khi tạo bất cứ thứ gì

Kích thước khuyến nghị cho ảnh thumbnail YouTube là 1280×720, tức tỷ lệ 16:9. Con số này nhiều người biết. Hai điều khác mới quyết định tấm ảnh hoạt động ra sao.

Thứ nhất, góc dưới bên phải bị huy hiệu thời lượng video che mất. Quy về khung 1280×720 thì nó chiếm khoảng 132×36, và bất cứ thứ gì đặt ở đó đều mất đi một nửa.

Thứ hai, và điều này dễ quên hơn: thumbnail chưa bao giờ hiển thị đúng kích thước gốc trên bảng tin. Trang chủ trên máy tính hiển thị rộng khoảng 360px, còn bảng tin đề xuất trên điện thoại thường chỉ còn chừng 168px. Tôi thu cùng một ảnh thumbnail YouTube xuống cả ba cỡ rồi xếp cạnh nhau. Ở 360px vẫn đọc được đạo cụ và biểu cảm. Ở 168px chỉ còn lại một mảng màu và một bóng người.

Vùng an toàn của ảnh thumbnail YouTube và ba cỡ hiển thị thực tế

Vì vậy tôi đặt ra hai quy tắc trước khi tạo bất cứ thứ gì. Giữ nhân vật và mọi thứ quan trọng nằm trong vùng an toàn ở giữa, chừa lề 6% cả bốn phía, và để trống góc dưới bên phải. Rồi chừa trong khung một khoảng sạch để đặt tiêu đề vào sau.

Bắt đầu bằng một tấm ảnh casting — đó là nền móng của cả bộ

Phần khó nhất của toàn bộ công việc là người trong cả tám ảnh thumbnail phải là cùng một người.

Cách của tôi là dùng tạo ảnh AI làm trước một khung tham chiếu thật sạch: chính diện, ngang tầm mắt, không trang điểm, không biểu cảm, nền xám, ánh sáng phẳng và đều, giống một tấm ảnh casting. Tấm này chẳng đẹp chút nào và vốn không định đăng. Nhiệm vụ duy nhất của nó là làm tham chiếu cho mọi khung hình phía sau.

Khung tham chiếu khóa nhân vật: chính diện, mộc, ánh sáng đều

Và đây là chỗ tôi sai.

Ở lượt đầu tôi đóng đinh luôn cả bố cục. Nhân vật nằm ở một phần ba bên trái, viền trắng cắt rời quanh người, một chùm tia tỏa sau đầu, một mảng màu phẳng lấp đầy nửa phải. Thứ duy nhất được thay đổi là biểu cảm và màu nền. Tám tấm sau đó, gương mặt không hề lệch đi chút nào, nhưng cả bộ trông như một bảng tra cảm xúc chứ không phải tám tấm thumbnail. Đổi mặt, đổi màu, hết.

Lý do rất đơn giản. Một tấm thumbnail thật được thiết kế xoay quanh nội dung video, trong khi biến số duy nhất tôi đưa cho mô hình lại là một biểu cảm khuôn mặt. Không có gì để thiết kế, nên nó lặp lại khuôn mẫu của tôi tám lần.

Cách sửa là trả quyền thiết kế về cho mô hình. Khối cố định giờ chỉ khóa những gì buộc phải khóa: cùng một người, gương mặt đủ sáng và không bị che, nửa thân trên nằm trong khung. Bối cảnh, đạo cụ, yếu tố đồ họa, bảng màu, ánh sáng, chiều sâu và cách đóng khung đều do mô hình quyết. Khối biến số rút gọn thành một câu — video này nói về chuyện gì.

Tám biến số là: nghỉ việc văn phòng, chiếc micro giá ba trăm nghìn thắng chiếc ba triệu, mắc kẹt ở hai trăm lượt xem, dựng một trăm video trong một tuần, đăng bài lúc ba giờ sáng suốt một tháng, cả bộ đồ nghề quay rẻ hơn một chiếc điện thoại, năm preset màu nên bỏ, và viết xong kịch bản trong mười hai phút.

Thứ trả về không cùng đẳng cấp với lượt đầu. Một mũi tên vàng nằm giữa chiếc micro cầm tay màu đỏ và một micro condenser. Một đường đỏ lao dốc trên màn hình kèm dấu X đỏ bên cạnh. Một hàng ảnh xem trước của các preset bị gạch chéo từng cái một. Một chiếc đồng hồ treo tường trên nền đường chân trời thành phố lúc ba giờ sáng. Không một chi tiết nào trong ngôn ngữ đồ họa đó nằm trong câu lệnh của tôi — mô hình ảnh AI tự nghĩ ra tất cả.

Bộ 8 ảnh thumbnail YouTube đã hoàn thiện

Tôi tưởng nó không viết được chữ. Hóa ra viết được.

Có một lời khuyên được nhắc đi nhắc lại về tạo ảnh AI: mô hình không viết được chữ đọc ra, nên mọi dòng chữ trong kết quả đều sẽ méo mó. Tôi vẫn theo lời khuyên đó, và mọi câu lệnh đều kết thúc bằng yêu cầu không để chữ xuất hiện trong khung.

Đến cuối tôi thử và bảo mô hình viết thẳng tiêu đề vào khoảng trống.

Nó viết đúng. Không sai một chữ cái nào, hình chữ sạch, độ đậm hợp lý, ngắt dòng ba dòng cũng hợp lý. Quy tắc cũ đó không còn thật sự đứng vững với các mô hình ảnh AI hiện nay.

Dù vậy tôi không đổi ý, vì lần thử thứ hai mới phơi ra vấn đề thật. Tôi đổi số 200 trong tiêu đề thành 500, không động đến từ nào khác, rồi chạy lại. Chữ vẫn đúng, nhưng cả khung hình đã được dàn dựng lại: từ tư thế ngồi nghiêng, cô chuyển sang chính diện ở giữa khung, màn hình dịch từ mép trái ra hẳn phía sau lưng, cỡ chữ và vị trí chữ cũng đổi theo. Đặt cạnh nhau, hai tấm không thuộc cùng một bộ.

Chỉ đổi một chữ số trong câu lệnh và cả khung hình bị dàn dựng lại

Vậy kết luận vẫn đứng, nhưng lý do đã khác. Vấn đề không phải nó không viết được chữ, mà là bố cục không tái lập được. Nếu bạn làm cả một bộ ảnh thumbnail YouTube và dự tính sau này đổi tiêu đề hoặc chạy thử nghiệm A/B, hãy để chữ ra ngoài ảnh và chồng lên riêng. Với một tấm đơn lẻ không định sửa lại, để mô hình viết luôn sẽ tiết kiệm được một bước.

Bốn tấm bị loại

Giao quyền thiết kế cho mô hình ảnh AI cũng có cái giá: nó sẵn lòng nhét vào khung những thứ bạn chưa bao giờ yêu cầu. Bốn lần làm lại, ba kiểu lỗi.

Thương hiệu có thật. Ở tấm về chuyện nghỉ việc, nó đưa vào tay cô một chiếc micro có tên một hãng sản xuất có thật in ở hông. Ở tấm một trăm bản dựng, nó đặt lên bàn hai lon nước tăng lực nhận ra ngay lập tức. Cả hai đều không thể có mặt trong ảnh sắp đăng.

Nhân vật bị nhân đôi. Tôi bổ sung điều khoản cấm thương hiệu rồi chạy lại tấm nghỉ việc, và nhận về hai bản sao của cô: một người đang gõ máy ở bàn, một người đứng cạnh ôm thùng các-tông. Mô hình đã đọc "rời khỏi văn phòng" thành một cảnh cần hai diễn viên.

Chữ hiện lên trên đạo cụ. Ở tấm về bộ đồ nghề giá rẻ, nó viết ngay ngắn hai từ tiếng Anh lên thùng các-tông. Đây là lỗi nặng nhất trong bối cảnh này: các ảnh minh họa dùng chung cho 21 ngôn ngữ, nên chữ thuộc bất kỳ ngôn ngữ nào cũng trở thành nhiễu với độc giả của hai mươi ngôn ngữ còn lại.

Ba kiểu lỗi: thương hiệu có thật, nhân vật bị nhân đôi, chữ trên đạo cụ

Cả ba sau đó đều được đưa vào khối cố định, và phải viết thật cụ thể. "Không có chữ" là chưa đủ — phải nói rõ không có chữ trên màn hình, bao bì, nhãn, thiết bị hay biển hiệu. "Chỉ một người" cũng chưa đủ; còn phải loại trừ bản sao thứ hai của cô, hình phản chiếu, và chân dung cô treo ở hậu cảnh.

Một cấu trúc câu lệnh có thể chép lại

Khối cố định được dán nguyên vẹn vào mọi câu lệnh, đại ý như sau.

Dùng đúng người trong ảnh tham chiếu, cùng kiểu tóc. Cô phải được nhận ra ngay là cùng một người, gương mặt đủ sáng, không bị che và hướng đại thể về phía máy quay, nửa thân trên nằm trong khung. Bạn là giám đốc nghệ thuật, đang thiết kế một ảnh thumbnail YouTube phải giành được cú bấm ở bề rộng 168 pixel — mọi thứ ngoài diện mạo của cô đều do bạn quyết: bối cảnh, đạo cụ, yếu tố đồ họa, bảng màu, ánh sáng, chiều sâu và cách đóng khung. Hãy làm táo bạo, tương phản mạnh và bám sát chủ đề này, đừng làm một tấm chân dung trên nền màu trơn. Chừa trong khung một khoảng sạch cho tiêu đề sẽ thêm vào sau. Tuyệt đối không có chữ, chữ cái hay chữ số ở bất cứ đâu, kể cả trên màn hình, bao bì, nhãn, thiết bị và biển hiệu. Không có logo thương hiệu hay nhãn hiệu nhận ra được; mọi đạo cụ đều không mang nhãn. Đúng một người trong khung.

Khối biến số chỉ một câu — video này nói về chuyện gì.

Ba điều cấm cuối cùng đều được thêm vào sau một lần làm lại, mỗi lỗi một điều khoản. Cấu trúc này chuyển sang các mô hình ảnh AI khác vẫn dùng được nguyên vẹn; khác biệt chỉ là thói quen diễn đạt.

Một tấm thumbnail, dùng được hai lần

Khi tám tấm đã chốt, những ảnh AI ấy vẫn còn một việc nữa. Tôi lấy tấm ba giờ sáng làm khung đầu rồi dùng tạo video từ khung đầu và khung cuối để làm một đoạn intro dài năm giây.

Đoạn intro tạo ra từ một trong các ảnh thumbnail YouTube

Ở đây cũng có một cái bẫy có thật. Đoạn clip tạo ra đã đóng khung lại cảnh quay, và khoảng sạch tôi cẩn thận chừa cho tiêu đề gần như bị ăn hết. Với intro thì không sao. Với thẻ kết thúc thì phải dàn trang lại từ đầu.

Muốn chạy nguyên một loạt cùng lúc, trải tám tác vụ ảnh AI ra trên vải bố sáng tạo tiện hơn làm lần lượt từng tấm — nhìn một cái là biết giữ tấm nào, làm lại tấm nào. Nếu không muốn viết câu lệnh từ đầu, trong mẫu có sẵn các phong cách chân dung dùng được ngay.

Tám tấm hoàn thiện trong một buổi chiều

Cả bộ ảnh thumbnail YouTube mất một buổi chiều từ lần chạy đầu tiên đến tám khung hình chốt, với bốn tấm bị loại. Phần tốn thời gian không phải là tạo ảnh cũng không phải chỉnh sửa, mà là hiểu ra nên giao gì cho mô hình — ban đầu tôi giữ quá chặt, đóng đinh bố cục, và nhận về tám tấm giống hệt nhau.

Nếu muốn làm lại theo, thứ tự là: đo vùng an toàn và ba cỡ hiển thị thực tế, tạo một khung tham chiếu không đẹp nhưng sạch, rút khối cố định xuống chỉ còn nhân vật cộng vài điều cấm đó, và coi chủ đề của mỗi tấm là biến số duy nhất. Còn về chữ — làm cả bộ thì thêm vào sau, làm một tấm đơn lẻ thì để mô hình viết.

Cả bộ ảnh thumbnail YouTube chỉ dùng đúng hai công cụ ảnh AI, tạo ảnh AIchỉnh sửa ảnh AI.

Chia sẻ