Seedream 5.0 Pro ปะทะ Nano Banana Pro: สามการทดสอบที่ชี้ว่าต่างกันตรงไหน

Seedream 5.0 Pro ปะทะ Nano Banana Pro: สามการทดสอบที่ชี้ว่าต่างกันตรงไหน

ข้อมูลเชิงลึกตีพิมพ์บน

ตั้งแต่ Seedream 5.0 ออกมา คำถามที่ได้รับบ่อยที่สุดคือควรย้ายจาก Nano Banana Pro มาใช้ตัวนี้ไหม แกลเลอรีตัวอย่างของทางการตอบคำถามนี้ไม่ได้ เพราะภาพชุดนั้นถูกคัดมาแล้ว ผมจึงวางสองโมเดลไว้ข้างกันและทดสอบสามรอบ โดยใช้ข้อความพรอมป์เดิมทุกตัวอักษร เปลี่ยนแค่โมเดลอย่างเดียว

สรุปสั้น ๆ คำถามว่าตัวไหนเก่งกว่าใช้ไม่ค่อยได้ในกรณีนี้ สองโมเดล AI สร้างภาพนี้เชื่อฟังคำสั่งของคุณคนละส่วนกัน และทำอย่างสม่ำเสมอพอที่จะวางแผนงานตามนั้นได้

Seedream 5.0 Pro คืออะไร แล้ว Lite อยู่ตรงไหน

Seedream 5 คือโมเดล AI สร้างภาพรุ่นปัจจุบันของ ByteDance บน ZOOOP มีทั้งเวอร์ชัน Pro และ Lite เวอร์ชัน Pro เดินตามแนวคิด "นี่คือคำอธิบายที่ซับซ้อน ทำให้ได้มากที่สุดเท่าที่ทำได้" ส่วน Lite ถูกกว่าและเร็วกว่า เหมาะกับการปั่นองค์ประกอบภาพหยาบ ๆ สิบกว่าแบบก่อนจะตัดสินใจ ทั้งหมดด้านล่างนี้ใช้ Pro เพราะสิ่งที่ผมต้องการวัดคือความสามารถทำตามคำสั่งที่ซับซ้อนโดยตรง

มีความต่างหนึ่งที่มองข้ามได้ง่าย ตอนนี้ Seedream 5.0 Pro สูงสุดอยู่ที่ 2k ขณะที่ Nano Banana Pro ไปถึง 4k ถ้าภาพสุดท้ายของคุณต้องเข้าโรงพิมพ์หรือถูกครอปหนัก บรรทัดเดียวนี้อาจสำคัญกว่าการทดสอบทั้งสามรอบรวมกัน ต้นทุนต่อภาพของสองตัวใกล้กันมาก โดย Seedream 5.0 Pro ถูกกว่าเล็กน้อย ซึ่งไม่พอจะใช้ตัดสินอะไร

วิธีทดสอบ: พรอมป์เดิม เปลี่ยนแค่โมเดล

สามการทดสอบ แต่ละรอบใช้พรอมป์หนึ่งชุด แต่ละโมเดลรันหนึ่งครั้ง อัตราส่วนล็อกไว้ที่ 16:9 (รอบภาพบุคคลใช้ 3:2) ความละเอียดล็อกไว้ที่ 2k ไม่มีการรันซ้ำจนได้ภาพสวย เพราะภาพที่คัดมาด้วยมือไม่บอกอะไรเลยเกี่ยวกับนิสัยของโมเดล

การทดสอบทั้งสามเล็งไปที่จุดที่ การสร้างภาพด้วย AI พังบ่อยที่สุด คือหลายตัวละครในเฟรมเดียว ใบหน้าเดิมข้ามฉาก และตัวหนังสือที่อ่านออกภายในภาพ

รอบที่หนึ่ง: สี่ตัวละครในเฟรมเดียว

พรอมป์บรรยายร้านราเมนรถเข็นดึกในซอยเล็กขณะฝนตก โดยกำหนดตำแหน่งให้ทั้งสี่ตัวละคร คนทำอาหารอยู่หลังเคาน์เตอร์กำลังเช็ดชาม ผู้หญิงใส่เสื้อกันฝนสีเหลืองนั่งเก้าอี้ตัวซ้ายสุดมองโทรศัพท์ พนักงานส่งของยืนที่ช่องประตูด้านขวาโดยหนีบหมวกกันน็อกไว้ใต้แขน และแมวสีส้มนั่งบนกองลังไม้ริมขวาสุด แสงเป็นโคมไฟสีอบอุ่นกับถนนเปียกที่สะท้อนไฟนีออน

ฉากหลายตัวละครจากพรอมป์เดียว Seedream 5.0 Pro และ Nano Banana Pro

ทั้งสองโมเดลวาดครบทั้งสี่ตัวละคร และตำแหน่งก็ถูกคร่าว ๆ เมื่อปีก่อนการสร้างภาพด้วย AI ยังหลุดตัวใดตัวหนึ่งไปเฉย ๆ ส่วนที่น่าสนใจอยู่ที่อื่น

Seedream 5.0 Pro ทำท่าทางเล็ก ๆ ได้ถูก หมวกกันน็อกถูกหนีบไว้ใต้แขนจริง และสะกดคำ RAMEN บนป้ายได้ถูกต้อง เฟรมของมันอ่านเหมือนโปสเตอร์ที่จัดหน้ามาแล้ว ช่องว่างระหว่างตัวละครสะอาด แยกได้ทันทีว่าใครอยู่ตรงไหน ส่วน Nano Banana Pro ให้ภาพที่ใกล้กับภาพถ่ายแนวสตรีทมากกว่า ซอยจมลึกเข้าไปจริง มีคนเดินถือร่มอยู่ไกล ๆ และตัวอักษรญี่ปุ่นบนโคมไฟอ่านออก ราคาที่จ่ายคือพนักงานส่งของถือหมวกไว้หน้าอกแทนที่จะหนีบใต้แขน และตัวหนังสือเล็ก ๆ บนลังไม้อ่านไม่ออก

รอบที่สอง: ใบหน้าเดียว สองฉาก

ความคงที่ของตัวละครน่าจะเป็นบทเรียนที่แพงที่สุดในงาน AI สร้างภาพ ผมเริ่มจากภาพฐานที่สะอาดซึ่งสร้างด้วย GPT Image 2 หน้าตรง พื้นหลังเทา แสงสม่ำเสมอ ไม่แต่งหน้า พูดง่าย ๆ คือรูปแคสติ้ง แล้วส่งภาพนั้นเป็นภาพอ้างอิงให้ทั้งสองโมเดล โดยให้คนคนเดิมไปปรากฏบนดาดฟ้าช่วงพลบค่ำ และในห้องสมุดตอนกลางวัน

ภาพอ้างอิงพื้นฐาน

ความคงที่ของตัวละคร ภาพอ้างอิงเดียว สองฉาก สองโมเดล

ใบหน้าทั้งสองรักษาได้ ข้อนี้ผ่านทั้งคู่ แต่พอมองละเอียดจะเริ่มน่าสนใจ

Seedream 5.0 Pro ตามโครงกระดูกใบหน้าได้ใกล้ที่สุด สันคิ้ว ดั้งจมูก และรูปปากเกือบจะเป็นสำเนาของภาพฐาน แต่มันให้แสงหน้าตรงแบน ๆ ทั้งสองครั้ง ทั้งที่พรอมป์ขอมุมสามส่วนสี่และแสงข้างจากมุมต่ำด้านซ้ายไว้ชัดเจน ส่วนนั้นมันไม่สนใจ Nano Banana Pro ทำตรงข้าม ทั้งมุมกล้องและทิศทางแสงลงตัวทั้งคู่ และเฟรมห้องสมุดยังใส่คนอ่านหนังสืออีกคนกับหนังสือที่เปิดอยู่ในฉากหลังมาให้เอง โครงหน้าเคลื่อนไปเล็กน้อยแต่ยังอ่านว่าเป็นคนเดิม และมีกระขึ้นมาซึ่งไม่มีในภาพฐาน

มีเรื่องหนึ่งที่ทั้งสองโมเดลทำเหมือนกันและควรจดไว้ ทั้งคู่รับเสื้อกล้ามสีดำจากภาพอ้างอิงมาด้วย ภาพอ้างอิงพาไปมากกว่าใบหน้า มันพาเสื้อผ้า ความยาวผม ไปจนถึงท่าทางมาด้วย ถ้าคุณไม่ต้องการก็ต้องบอกในพรอมป์ ถ้าอยากแก้ภาพที่มีอยู่แบบเจาะจุด การแก้ไขภาพด้วย AI คุ้มกว่าการบรรยายใหม่ทั้งภาพ

รอบที่สาม: ให้มันเขียนตัวหนังสือในภาพ

รอบนี้เป็นรอบที่ผมอยากทดสอบมากที่สุด พรอมป์กำหนดกระดานชอล์กหน้าร้านเบเกอรีที่มีข้อความ "สามบรรทัดพอดี" และระบุเนื้อหาทีละคำ SOURDOUGH 4.50 / CROISSANT 3.20 / CLOSED MONDAYS

ตัวหนังสือในเฟรม สามบรรทัดที่กำหนด ทั้งสองโมเดล

ทั้งสองสะกดถูก ไม่ผิดแม้ตัวอักษรเดียว กฎเก่าที่ว่าโมเดล AI สร้างภาพเขียนตัวหนังสือที่อ่านออกไม่ได้ ใช้ไม่ได้อีกแล้ว อย่างน้อยกับข้อความอังกฤษสั้น ๆ

แต่การจัดหน้าเป็นอีกเรื่อง Seedream 5.0 Pro ให้สามบรรทัดเป็นสามบรรทัด ชื่อสินค้ากับราคาอยู่บรรทัดเดียวกัน ตรงตามที่สั่ง Nano Banana Pro ถูกทุกตัวอักษรแต่ตัดแต่ละรายการเป็นสองบรรทัด สามบรรทัดกลายเป็นห้า และเขียนจุดทศนิยมเป็นจุดกลาง ถ้าภาพนั้นจะเอาไปทำการ์ดหรือภาพปกโดยตรง จัดหน้าผิดก็คือต้องรันใหม่

งานแบบไหนใช้ตัวไหน

หลังสามรอบ เส้นแบ่งชัดพอที่จะใช้ตัดสินใจได้

ถ้าอยากได้ภาพที่ดู "ออกแบบมา" เช่นโปสเตอร์ ปกหนังสือ ภาพปกคลิป หรือหน้าเลย์เอาต์ที่มีตัวหนังสือ ให้ใช้ Seedream 5.0 Pro มันจริงจังกับคำสั่งเชิงโครงสร้าง ทั้งเนื้อหาข้อความ จำนวนบรรทัด และตำแหน่งของแต่ละตัวละคร ถ้าอยากได้ภาพที่ดู "ถ่ายมาจริง" ทั้งมุมกล้อง ทิศทางแสง มิติความลึกจริง และรายละเอียดยิบย่อยในฉากหลัง Nano Banana Pro ทำตัวเหมือนกล้องมากกว่าพู่กัน

เพิ่มอีกสองข้อที่ใช้ได้จริง งานตัวละครทำได้ทั้งสองตัว แต่ควรจ่ายค่าหนึ่งภาพไปกับภาพฐานหน้าตรงที่สะอาดก่อน แล้วส่งภาพนั้นเป็นภาพอ้างอิงทุกครั้งหลังจากนั้น วิธีนี้แน่นอนกว่าการบรรยายหน้าตาใหม่ในทุกพรอมป์ และถ้าต้องส่งงานที่ 4k ก็ไม่มีอะไรให้เลือก มีแต่ Nano Banana Pro ที่ไปถึง

วิธีที่ถูกที่สุดในการตัดสินเรื่องนี้กับงานของคุณเองคือรันพรอมป์เดียวผ่านสองโมเดลวางเทียบกันบน ผ้าใบสร้างสรรค์ แล้วดูสองผลลัพธ์พร้อมกัน บน ZOOOP ยังมี Nano Banana 2, Seedream 5.0 Lite, GPT Image 2, Flux 2… การเปลี่ยนโมเดลตามงานเป็นเรื่องปกติ ไม่ใช่สัญญาณว่าเลือกผิด

ส่วนที่ผมไม่ได้ทดสอบ

ควรพูดตรง ๆ เรื่องขอบเขต มุมนี้ของการสร้างภาพด้วย AI ขยับเร็วพอที่บทความนี้น่าจะมีอายุใช้งานแค่ไม่กี่เดือน แต่ละรอบรันครั้งเดียว ไม่ได้สุ่มซ้ำ ดังนั้น "ชนะรอบนี้" ไม่เท่ากับ "ชนะทุกรอบ" สิ่งที่ยังไม่ได้ทดสอบยังมี ความเสถียรเมื่อแก้ภาพเดิมต่อกันหลายรอบ ความคงที่ของวัตถุที่ไม่ใช่คน เช่นสินค้าและอาคาร ตัวหนังสือที่ไม่ใช่อักษรละตินในเฟรม (ผ่านภาษาอังกฤษไม่ได้พิสูจน์อะไรเรื่องภาษาจีน) และอัตราส่วนที่สุดขั้ว

Seedream 5.0 Pro กับ Nano Banana Pro ยังเดินหน้ากันทั้งคู่ ถ้ากรณีใดในนั้นคืองานจริงของคุณ อย่ารับข้อสรุปของผมไปทั้งดุ้น ให้เลือกสองโมเดลจาก ภาพรวมเครื่องมือ แล้วรันวัตถุดิบของตัวเองผ่านแต่ละตัวหนึ่งครั้ง ต้นทุนเท่าพรอมป์เดียวซื้อคำตอบที่คุณไม่ต้องเดา

แบ่งปัน