Nano Banana Pro vs Nano Banana 2: mismo prompt, nueve imágenes, tres diferencias reales

Nano Banana Pro vs Nano Banana 2: mismo prompt, nueve imágenes, tres diferencias reales

PerspectivasPublicado el

Nano Banana Pro comparado con Nano Banana 2

No faltan comparativas entre estos dos modelos de imagen IA. El problema es que la mayoría solo publica imágenes sin decir en qué condiciones. Otro prompt, otra proporción, a veces incluso otra resolución, y luego un veredicto. Con una conclusión así no se puede hacer nada.

Así que bloqueé todas las variables: mismo prompt, misma proporción, misma resolución, solo cambia el modelo. Tres escenarios más un experimento adicional, nueve generaciones en total. Esto es lo que apareció, incluidos los sitios donde ambos modelos se cayeron.

Por qué se comparan justo estos dos

En la lista del generador de imágenes IA están uno al lado del otro y sus paneles de parámetros son casi idénticos: prompt, proporción, resolución, imágenes de referencia, 1k / 2k / 4k, diez proporciones cada uno. La primera suposición de mucha gente es que Pro es simplemente el más caro.

No son dos niveles del mismo modelo. Uno de los nombres lleva una gama y el otro un número de generación, y las diferencias que importan no están en cuál se ve más nítido. Ejecútalos en paralelo y verás que los dos modelos leen la misma frase de manera distinta.

Primero, las condiciones de la prueba

Los tres prompts se escribieron en inglés, de una sola vez, y no se retocaron después. Dos imágenes por ronda, parámetros idénticos salvo el modelo:

  • Rondas de escena cargada y de texto: 16:9, 2k
  • Ronda de personaje: 1:1, 2k, la misma imagen de referencia para los dos modelos
  • Nano Banana 2 con su nivel de razonamiento por defecto (excepto en el experimento adicional)

La imagen de referencia de la ronda de personaje es una foto de casting generada aparte: fondo gris, luz frontal uniforme, sin maquillaje, cámara a la altura de los ojos. Esa imagen base limpia es un requisito previo para probar la consistencia de un personaje: con un fondo cargado o una luz direccional ya no puedes saber si el modelo se desvió o si la referencia traía demasiado ruido.

Si prefieres no lanzarlas una a una, este tipo de comparación es más cómoda en el lienzo generativo: ramifica un prompt en dos nodos y deja las salidas una junto a otra.

Ronda 1: una escena cargada

El prompt describía un puesto de desayuno a primera hora de la mañana: seis platos, un vendedor con delantal blanco entregando una bolsa de papel, gente en la cola detrás, una torre de vaporeras de bambú a la izquierda, una bicicleta contra la pared a la derecha, bombillas colgando, la neblina de la mañana. A propósito, mucho que sostener.

Puesto de comida generado por Nano Banana Pro

Nano Banana Pro devolvió algo que se lee como fotografía. Gris frío homogéneo, profundidad limpia, la neblina y la luz concuerdan, y casi todos los elementos pedidos están. Pero su lectura de la escena es contenida: sobre el mostrador hay unos cuantos recipientes de acero y no sabrías decir si son seis platos o cuatro. No hay ningún cartel en ninguna parte.

Puesto de comida generado por Nano Banana 2

Nano Banana 2 hizo lo contrario y llenó el encuadre: churros de masa frita, bollos al vapor, empanadillas, tortitas, fideos, tofu; seis o más, contables de un vistazo. En la pared cuelga un cartel con el nombre del local, dos más se ven calle abajo, y alguien ha pegado un código QR de pago en el marco de la puerta. Nada de eso estaba en el prompt. Lo añadió el modelo.

En «seis platos distintos», la segunda imagen se ajusta mejor a lo que pedí. En atmósfera prefiero la primera. Aquí no declaro ganador, porque la respuesta depende de si buscas ambiente o densidad de información.

Las dos se rompieron en el mismo sitio: las manos. En la imagen de Nano Banana Pro, la mano izquierda del vendedor suspendida sobre la olla tiene los dedos fusionados. En la de Nano Banana 2, la zona donde las dos manos se pasan la bolsa se convierte en un borrón. La interacción física entre personas sigue siendo la parte más frágil del encuadre, y ninguno de los dos la ha resuelto.

Ronda 2: mantener la misma cara

Esta ronda cambia exactamente una cosa: poner a la persona de la foto de casting en una calle al atardecer, añadir una luz lateral cálida en contrapicado y desenfocar los carteles del fondo. El prompt pedía explícitamente la misma persona, el mismo ángulo y el mismo encuadre.

Consistencia del personaje: referencia, Nano Banana Pro, Nano Banana 2

Referencia a la izquierda, Nano Banana Pro en el centro, Nano Banana 2 a la derecha.

Nano Banana Pro la trasladó prácticamente intacta. Forma de las cejas, distancia entre los ojos, ancho del puente de la nariz, línea de los labios, nacimiento del pelo; sobrevivieron incluso los mechones sueltos y la camiseta negra de tirantes. Se lee como la misma persona fotografiada otro día.

La versión de Nano Banana 2 se reconoce como «alguien que se le parece», pero cambió: cara más ancha, mandíbula más cuadrada, piel más rugosa, varios años más, pelo más pegado a la cabeza. Por separado no chirría. Al lado de la referencia, claramente sí.

Si estás haciendo algo donde un personaje tiene que repetirse de imagen en imagen —un storyboard, un álbum ilustrado, una serie de carteles—, esa diferencia sola te elige el modelo.

Aun así, no le des el trofeo a Pro todavía. El prompt pedía el mismo encuadre y los dos modelos acercaron la cámara por su cuenta: la referencia es un plano de busto y las dos salidas volvieron como primeros planos. Ninguno hizo caso.

Ronda 3: texto dentro de la imagen

Esperaba que aquí se desmoronara todo. El prompt pedía una pizarra de cafetería escrita a mano que dijera exactamente OPEN TODAY 7AM - 4PM, con una línea más pequeña debajo que dijera FLAT WHITE 4.50.

Pizarra de cafetería generada por Nano Banana Pro

Nano Banana Pro acertó las tres líneas y el trazo de tiza resulta creíble. Escribió el precio como 4·50 con punto medio, que es una forma normal de poner un precio a mano en una pizarra, así que no lo cuento como error.

Pizarra de cafetería generada por Nano Banana 2

Nano Banana 2 también acertó todas las líneas pedidas, y luego añadió un icono de taza y una filigrana que nadie había pedido, y se rompió en el único sitio donde no se le pedía escribir nada. El nombre del local en el toldo debería ser THE DAILY GRIND; la primera palabra se derrumbó en algo ilegible.

El patrón se repitió en las tres rondas: el texto que pides explícitamente sale correcto hoy en los dos modelos; los errores están siempre en el texto que el modelo añadió por su cuenta. Lo mismo en la escena de calle: los carteles que inventó Nano Banana 2 son legibles, mientras que la pequeña lista de precios que también inventó es puro galimatías. Si necesitas letras fiables, escribe las palabras exactas en el prompt y deja al modelo el menor margen posible para improvisar.

Una nota al pie: de cinco salidas de Nano Banana 2, una volvió con un borde blanco en los cuatro lados que hubo que recortar. Pasó una vez, así que no lo llamaré defecto, pero merece un vistazo cuando generas en serie.

Qué hace en realidad el «nivel de razonamiento» de Nano Banana 2

Aquí está la diferencia real entre los paneles. Nano Banana 2 añade dos interruptores: búsqueda de imágenes y un nivel de razonamiento que puedes poner en mínimo, por defecto o alto. Nano Banana Pro solo ofrece búsqueda web.

Cogí el prompt del puesto de comida y lancé los tres niveles una vez cada uno.

Niveles de razonamiento de Nano Banana 2: mínimo, por defecto, alto

Mínimo, por defecto y alto, de izquierda a derecha. Los elementos centrales sobreviven en los tres: vendedor, bolsa de papel, cola, vaporeras, bicicleta; no falta nada. El cambio está en otra parte: cuanto más alto el nivel, menos texto inventa el modelo y más de ese texto es correcto. El mínimo es el más abigarrado, con varios carteles cuya letra pequeña es una mancha. El alto dejó solo un rótulo vertical y un par de listas de precios limpias y legibles, y la composición se calmó de forma visible.

Se comporta menos como un escalón de calidad y más como un dial de cuánto se esmera el modelo. El coste es tiempo: el alto tardó aquí unos cien segundos frente a algo más de sesenta del nivel por defecto, casi la mitad más. Observación única, con tiempo de cola incluido: no lo tomes como una medición de referencia, pero la dirección está clara.

Cuál elegir

Después de nueve imágenes, mis conclusiones son más concretas que al empezar:

Si un personaje tiene que repetirse, usa Nano Banana Pro. La diferencia de la ronda de consistencia no es una cuestión de gusto, sino de si el resultado sirve.

Si quieres una escena densa que genere sus propios detalles, usa Nano Banana 2. Su imaginación con los entornos es más viva, y carteles, pegatinas y utensilios que nunca mencionaste se rellenan solos: cómodo para fondos y planos de ambiente.

Si la imagen necesita letras exactas, cualquiera de los dos sirve, pero fija las palabras en el prompt. No cuentes con lo que el modelo escriba por iniciativa propia.

Si dudas, prototipa con Nano Banana 2. Cuesta algo menos por imagen y su nivel por defecto es más rápido, lo que va bien para buscar el prompt; cuando la dirección esté decidida y haya que sostener la cara, cambia a Nano Banana Pro para la versión final.

Si quieres cambiar una zona en vez de redibujar todo, ninguno es la primera opción. Usa mejor el editor de imágenes IA: pintas la zona, cambias solo eso y no vuelves a tirar los dados con toda la imagen.

Una última nota honesta: cada ronda se lanzó una sola vez, sin muestreo repetido, y otra semilla podría dar la vuelta a alguna conclusión concreta. Si vas a decidir para un proyecto real, coge tus propios prompts, bloquea las variables igual y lanza cada uno varias veces. Y si prefieres ahorrarte el montaje, las configuraciones ya ajustadas de la biblioteca de plantillas son un punto de partida razonable.

Comparte