
GPT Image 2.5 vs GPT Image 2: Tôi chạy cùng một prompt trên cả hai. Đây là chỗ chúng thật sự khác nhau
OpenAI phát hành ChatGPT Images 2.5 vào ngày 8 tháng 9 và tóm gọn nó bằng câu "sharper details, more precise editing, and faster generation". Ở phía API, điều đó nghĩa là hai model mới: GPT-Image-2.5 Flare và GPT-Image-2.5 Sunburst. ZOOOP đưa cả hai lên ngay hôm sau, dưới dạng hai phiên bản của một model trong trình tạo hình ảnh AI.
Bài viết ra mắt lúc nào đọc cũng hay. Nếu bạn tạo ảnh mỗi ngày, chỉ có một câu hỏi đáng trả lời: tôi đang hài lòng với GPT Image 2 — chuyển sang 2.5 thì thực sự được thêm gì? Nên tôi chạy cùng một bộ prompt trên cả hai thế hệ và không đổi gì ngoài model. Đây là những gì bạn có thể thấy, và những gì không.
GPT Image 2.5 là gì, Flare và Sunburst là gì
Tên gọi trước, vì OpenAI tung ra ba cái tên cùng lúc.
ChatGPT Images 2.5 là tên sản phẩm bên trong ChatGPT. Không có model API nào tên "2.5" — có hai: Flare và Sunburst. Theo OpenAI, Flare là lựa chọn mặc định cho hầu hết ứng dụng, cho ảnh chất lượng cao hơn GPT-Image-2 với độ trễ chỉ bằng một nửa. Sunburst được xây cho các quy trình cao cấp muốn kiểm soát chặt hơn khi chỉnh sửa, và tạo lâu hơn. Cả hai dùng chung prompt, tham số và tỷ lệ khung hình.
Trên ZOOOP chúng tôi không tách thành hai model riêng — làm vậy sẽ như thể bạn phải chọn giữa hai thứ khác nhau. Chúng là hai phiên bản dưới GPT Image 2.5, cách nhau một công tắc. Đó cũng là lý do mọi so sánh trong bài này mặc định chạy trên Flare; Sunburst có phần riêng bên dưới.
So với GPT Image 2, ba thứ đổi ở cấp tham số: thang chất lượng từ Low / Medium / High lên năm bậc, với XHigh và Max ở trên cùng; có độ phân giải 4K mới; và một yêu cầu giờ nhận tối đa 16 ảnh tham chiếu thay vì 10. Còn lại y nguyên — mười một tỷ lệ khung hình, prompt viết như cũ.
Cách làm: cùng prompt, chỉ đổi model
Bốn prompt, phủ bốn thứ tôi quan tâm nhất. Chi tiết vải và kim loại: cận cảnh ve áo blazer xanh navy họa tiết xương cá với ghim cổ áo bằng đồng. Chữ nhỏ trong khung: bảng hiệu gỗ vẽ tay của một tiệm bánh. Phản chiếu và chất liệu: ấm trà đen mờ trên mặt bếp đá bóng. Typography: poster hòa nhạc cổ điển ghim trên tường gạch.
Mỗi prompt chạy một lần trên mỗi model — 16:9, cùng độ phân giải, chất lượng Low. Low là bậc tôi dùng nhiều nhất, và là bậc lộ ra đáy của một model; ở bậc cao nhất model nào cũng chất được chi tiết. Với prompt vải, tôi thêm một cặp High và một bản Max, thứ chỉ có ở 2.5, để xem cái thang thật sự đi xa đến đâu.
Không thử ở đây: chỉnh sửa và ghép nhiều ảnh tham chiếu. Đó là những mảng OpenAI nói nhiều nhất về 2.5, và xứng đáng có bài riêng.
Khác biệt một: chi tiết được tách bạch
Nói ngắn: cả hai bản Low đều dùng được; khoảng cách lộ ra khi phóng to. GPT Image 2 có họa tiết xương cá, nhưng mềm, như nhìn qua lớp gạc. GPT Image 2.5 dựng từng gân vải đứng lên, và đường may dọc mép ve áo chắc hơn. Khoảng cách khác không phải kết cấu mà là độ tuân thủ. Tôi yêu cầu ghim cổ áo bằng đồng; 2.0 vẽ một mặt dây hình đèn lồng, 2.5 vẽ một nút đồng tròn có huy hiệu. Không cái nào đúng sách, nhưng 2.5 gần prompt hơn.

Cặp ấm trà là minh họa rõ nhất cho "chi tiết được tách bạch". Cả hai đều đúng chất liệu ấm; khác biệt ở mặt bếp. Phản chiếu của 2.0 là một vệt tối mờ. 2.5 phản chiếu tay cầm, thân và nắp từng phần một trên mặt đá, với vân đá cẩm thạch hiện lên từ bên dưới. Đây là điểm yếu tôi gặp nhiều nhất ở bất kỳ trình tạo hình ảnh AI nào — chủ thể ổn, nhưng cái vòng nơi chủ thể chạm vào môi trường thì nhão. 2.5 rõ ràng dày dặn hơn ở cái vòng đó.

Về chữ trong khung: "MORNING LOAF · est. 1987" trên bảng tiệm bánh và ba dòng trên poster ra đúng từng chữ trên cả hai model. Typography đọc được luôn là dấu ấn của dòng GPT Image; 2.5 không lùi ở đây, và cũng không bứt xa. Khác biệt nằm quanh chữ. Bảng hiệu của 2.5 thật sự là gỗ phong hóa treo trên móc sắt, và poster có nếp gấp và đầu ghim. Bảng hiệu của 2.0 trông như mới sơn, và poster thêm một chiếc xe cổ mà prompt chưa từng yêu cầu.


Khác biệt hai: ba bậc chất lượng thành năm
Với ba bậc của GPT Image 2, quy tắc của tôi là: Low đủ, Medium cho bố cục dày, High hiếm khi. 2.5 thêm XHigh và Max trên High, và phản ứng đầu tiên là "vậy là High đắt hơn".
Điều tôi thấy lại khác: lên một bậc không làm sắc nét cùng một ảnh — nó tạo ra ảnh mới. Qua các bản Low, High và Max, cái ghim đổi từ huy hiệu tròn sang hình lá, và lớp áo bên dưới từ sơ mi trắng sang áo len kem rồi quay lại. Bố cục dịch chuyển; thứ duy nhất tăng đều là vải. Xương cá ở Max dày đến mức đếm được sợi, High theo sau, và Low gần như không phân biệt được với High ở kích cỡ web. Nên nếu kế hoạch là "khóa bố cục ở Low, rồi render lại đúng khung đó ở Max để in", lối đó không tồn tại. Hãy lên thang khi bạn còn chấp nhận được việc bố cục thay đổi.

Lời khuyên của tôi vẫn như với 2.0, chỉ là thang dài hơn: khám phá ở Low, khóa bố cục, chỉ nâng cấp khung bạn thật sự sẽ giao. Bậc nào tùy vào ảnh sẽ được xem lớn đến đâu. Poster in, hero trang landing, tấm 4K — đó là chỗ của XHigh và Max. Nâng cấp một bài đăng mạng xã hội chỉ tốn thêm tiền.
Khác biệt ba: 4K màn ảnh rộng và 16 ảnh tham chiếu
4K là bổ sung có thể sờ thấy. GPT Image 2.5 xuất thẳng 3840×2160 và 2160×3840, không phải 2K rồi phóng — và gốc so với phóng là hai chuyện khác nhau ở chi tiết tần số cao như lá cây và tóc.
Một điều cần biết trước: 4K chỉ có ở bốn tỷ lệ rộng và cao — 21:9, 16:9, 9:16 và 9:21. Bảy tỷ lệ khung hình còn lại dừng ở 3K. Đó là trần pixel của model, không phải giới hạn của ZOOOP; chúng tôi làm mờ những tổ hợp không chọn được để bạn không phải trả tiền, chờ nửa phút, rồi nhận lỗi.
Trần tham chiếu từ 10 lên 16 ảnh là tiện ích thực sự cho ghép ảnh thương mại điện tử và công việc dàn trang: ảnh sản phẩm, đạo cụ, một bảng màu và một bố cục thô, tất cả trong một yêu cầu, với prompt mô tả cách sắp xếp. Tôi không làm so sánh cho phần này, nhưng "giữ chủ thể trong ảnh tham chiếu tốt hơn" là một trong những luồng chính của thông báo OpenAI, và khớp với những gì chúng tôi thấy trong các thử nghiệm rải rác ở trình chỉnh sửa hình ảnh AI.
Khác biệt bốn: Flare và Sunburst có render khác nhau không?
Đây là điều tôi muốn làm rõ nhất, vì trên ZOOOP hai phiên bản cùng giá. Nếu Sunburst chậm hơn mà không tốt hơn, nó tồn tại để làm gì?
Tôi chạy prompt ve áo từ khác biệt một qua Sunburst với tham số y hệt. Đặt cạnh nhau, độ dày vải, kim loại của ghim và độ rơi của độ sâu trường ảnh ngang nhau; mọi khác biệt đều ngẫu nhiên — Flare cho nút đồng tròn, Sunburst cho ghim lá sồi và thêm một khăn túi áo. Nói cách khác, để tạo từ đầu, Sunburst không tốt hơn Flare.

Nó đúng là chậm hơn, nhưng một con số thì tôi không đưa ra được. Tôi đo cùng một bộ cặp so khớp hai lần: cả hai vòng đều cho trung vị của Sunburst nằm sau Flare, có điều khoảng cách giữa hai vòng chênh khá nhiều và vài ô còn đảo chiều. Cái đứng vững là hướng, không phải hệ số. Điều đó khớp với định vị của OpenAI: sức mạnh của Sunburst là chỉnh sửa — kiểu "đổi đúng một thứ này, giữ phần còn lại" — không phải text-to-image.
Vậy quy tắc rất đơn giản. Mặc định Flare. Chỉ chuyển sang Sunburst khi bạn chỉnh sửa chính xác một ảnh sẵn có và thay đổi phải rơi đúng chỗ bạn chỉ. Với text-to-image và bản nháp hàng loạt, Sunburst chỉ làm bạn chờ.
Chuyển gì sang 2.5, và để yên gì
Bốn khác biệt gom vào một danh sách.
Chuyển sang GPT Image 2.5: bất cứ thứ gì sẽ được xem lớn — key visual in, hero trang landing, phông nền màn hình lớn; bất cứ thứ gì có chữ nhỏ hoặc typography dày; bất cứ thứ gì cần 4K màn ảnh rộng gốc; bất cứ thứ gì ghép từ một tá ảnh tham chiếu trở lên. Ở những trường hợp này khoảng cách nhìn thấy được.
Không cần vội: ảnh mạng xã hội hằng ngày, ảnh chỉ xem trên điện thoại, bản nháp thuần khám phá phong cách. Ở Low, khác biệt giữa hai thế hệ không đủ để chạy lại một bộ đã có. Nếu bạn có một lô làm bằng GPT Image 2 và cần thêm vài ảnh đồng bộ, ở lại 2.0 an toàn hơn.
Việc mới thì bắt đầu ở 2.5. Trong trình tạo hình ảnh AI của ZOOOP, nó đứng trước GPT Image 2 trong danh sách, Flare là phiên bản mặc định, và năm bậc chất lượng cùng 4K nằm trong cùng một bảng điều khiển. Tín dụng dùng chung cho cả hai model, nên chuyển qua lại không cần ngân sách thứ hai.