Prompts para Gemini: cómo lograr resultados de estudio con Nano Banana Pro
Aprende a escribir prompts para Gemini que logren imágenes consistentes con Nano Banana Pro: estructura, cámara, luz, texto, referencias y exportación.

Nano Banana Pro puede llevar un prompt mal planteado directo al desastre. La diferencia entre las imágenes mediocres que inundan las redes y una composición limpia, con acabado de estudio, no está en una semilla secreta ni en una frase mágica. Está en la estructura, y Google publicó el marco exacto que muchos sitios de prompts para Gemini empaquetan y revenden sin decirlo.
La forma más rápida de obtener una imagen mejor con Nano Banana Pro es dejar de encadenar palabras clave y empezar a redactar un brief. El modelo es Gemini 3 Pro Image y se apoya en el mismo motor de razonamiento que Gemini 3 Pro. Por eso interpreta un prompt como un director de arte interpreta un brief creativo: necesita un sujeto, un encuadre, una iluminación y una función clara para cada referencia. Si recibe todo eso, produce resultados limpios, legibles y repetibles. Si solo recibe "logo, moderno, 8k, ultra HD", entrega un resultado mediocre.
Este método permite conseguir resultados profesionales. Parte del marco de siete consejos de Google y añade la capa práctica necesaria para convertirlo en piezas listas para usar.

Prompts para Gemini: la regla que corrige casi cualquier mal resultado
Ser específico importa más que escribir mucho. Casi todos los resultados deficientes nacen de un prompt impreciso, no de uno breve.
Nano Banana Pro razona sobre las palabras en lugar de limitarse a reconocer patrones. Por eso, rellenar un prompt con etiquetas de calidad ("obra maestra, 8k, ultradetallado, premiado") sirve de muy poco. El modelo ya busca fidelidad. Lo que no puede hacer es adivinar lo que quedó fuera: cómo debe encuadrarse la toma, de dónde llega la luz o qué atmósfera se busca. En esos vacíos improvisa, y ahí aparece el resultado mediocre.
Esta es la regla para todos los prompts que siguen: describir lo que de verdad importa y eliminar el adorno. "Una taza de café de cerámica" dice poco. "Una taza de cerámica negra mate, vista cenital, sobre una superficie de concreto sin pulir, con luz dura de media mañana entrando por la izquierda" es una indicación que el modelo puede ejecutar dos veces de la misma manera.
La fórmula de seis partes para describir una escena
Al construir el prompt con seis componentes, el modelo recibe lo necesario antes de verse obligado a adivinar. Es la lista de control de Google y funciona porque cada parte elimina uno de esos espacios abiertos a la improvisación.
- Sujeto: quién o qué aparece en el encuadre, descrito de forma concreta. No "un robot", sino "un robot barista de expresión estoica y ojos azules luminosos".
- Composición: cómo se encuadra la toma: primerísimo plano, plano general, ángulo bajo, retrato.
- Acción: qué está ocurriendo: preparar café, caminar a media zancada, lanzar un hechizo.
- Ubicación: dónde sucede: una cafetería futurista en Marte, una pradera bañada por el sol durante la hora dorada.
- Estilo: la estética general: fotorrealista, cine negro, fotografía de producto de la década de 1990, vector plano.
- Instrucciones de edición: al modificar una imagen existente, conviene ser directo: "cambia a verde la corbata del hombre", "elimina el automóvil del fondo".
Veamos un antes y un después real. La versión fácil sería: "una foto de producto de un zapato deportivo, limpia y profesional". El resultado será un zapato genérico sobre un fondo continuo igual de genérico: suficiente como marcador de posición, inútil para una marca. Ahora usemos las seis partes: "Un solo zapato deportivo blanco, de cuero y corte bajo (sujeto), fotografiado como imagen principal desde un ángulo de tres cuartos y ocupando el 60% del encuadre (composición), inmóvil sobre un pedestal de concreto cepillado (acción y ubicación), con la estética de una fotografía prémium de catálogo de la década de 1990 e iluminación de estudio suave y direccional (estilo)". Es el mismo modelo y los mismos cinco segundos, pero ahora la imagen puede incorporarse a una presentación.
La primera versión es una búsqueda. La segunda es un brief. El modelo siempre responde mejor al brief.
Dirige la imagen como un director de fotografía
Una vez definida la escena, los controles que separan un resultado amateur de uno de estudio son los mismos que utiliza un fotógrafo: encuadre, lente e iluminación. Nano Banana Pro entiende los tres en lenguaje natural.
Define primero el lienzo. Indica la relación de aspecto, es decir, la proporción entre el ancho y la altura del encuadre. Un formato cuadrado (1:1) funciona para un icono o una pieza para redes; 16:9, para una imagen principal panorámica o una diapositiva; 9:16, para un cartel vertical de teléfono o una historia; 21:9, para un encuadre cinematográfico, y 4:5, para el formato vertical que funciona bien en el feed. Especificarlo desde el principio evita que el modelo recorte el sujeto para ajustarlo a una forma no deseada.
Después, dirige la cámara. El modelo entiende el vocabulario de un director de fotografía:
- "Una toma desde un ángulo bajo con poca profundidad de campo (f/1.8)": la profundidad de campo determina qué parte de la escena aparece enfocada; cuando es poca, el sujeto queda nítido y el fondo se funde en un desenfoque suave que da una apariencia costosa.
- "Contraluz de hora dorada que proyecta sombras largas": define tanto la calidad de la luz como su dirección.
- "Tratamiento de color cinematográfico con tonos verde azulado apagados": es el ajuste cromático intencional aplicado a toda la imagen, lo que hace que el encuadre parezca un fotograma de película en lugar de una instantánea.
Fija el encuadre
Empieza por la relación de aspecto y el tipo de plano: "Un retrato 4:5, plano medio a la altura de los ojos".
Define la iluminación
Indica la fuente, la dirección y la calidad: "luz suave de ventana desde la izquierda de la cámara, con una caída gradual hacia la sombra".
Ajusta el color
Añade al final el tratamiento cromático: "color cálido y ligeramente desaturado, con contraste cinematográfico".
Esa secuencia de tres líneas —encuadre, luz y color— marca la diferencia entre una imagen que parece generada y otra que parece fotografiada. Solo requiere quince palabras adicionales.
Texto que sí sale legible
Cuando una imagen necesita palabras legibles, Nano Banana Pro es la mejor herramienta disponible ahora mismo, siempre que el texto se trate como un elemento dirigido y no como una ocurrencia de último momento.
Esta es la gran fortaleza del modelo. Puede generar texto correcto y legible directamente dentro de una imagen y en varios idiomas. Por eso se ha convertido en la opción habitual para carteles, mockups e infografías, mientras otros modelos de imagen todavía producen letras sin sentido. La clave está en especificar tres cosas: las palabras exactas, el estilo tipográfico y la ubicación.
"El titular 'EXPLORADOR URBANO' en una tipografía sans serif blanca y en negrita, situado en el tercio superior del encuadre".
Escribe el texto entre comillas para que el modelo sepa exactamente qué debe escribir. Define el estilo —negrita, condensada, manuscrita o propia de una época concreta— para que encaje con la marca. Indica la posición para evitar que invada al sujeto. En un mockup de producto o un cartel, ese control es la principal razón para elegir este modelo en lugar de Midjourney, que todavía no puede componer de forma fiable ni una sola línea de texto limpia.
Imágenes de referencia: el truco de asignarles una función
Al cargar imágenes de referencia en Nano Banana Pro, la mejora más importante consiste en explicar para qué sirve cada una. Admite hasta 14 imágenes de referencia en una composición —el límite exacto cambia según dónde se utilice— y puede mantener el parecido de hasta 5 personas en una escena. Eso permite usarlo en proyectos reales de marca y personajes, no solo en imágenes aisladas.
El error consiste en cargar tres imágenes y esperar que el modelo resuelva el resto. La solución es asignar una función a cada una dentro del prompt:
"Usa la Imagen A para la pose del personaje, la Imagen B para el estilo artístico y la Imagen C para el entorno del fondo".
Así, el modelo compone con intención en lugar de diluir todas las entradas en una mezcla confusa. Esta técnica permite que una marca conserve el mismo rostro de su fundador durante toda una campaña o que una agencia mantenga una mascota coherente en diez puntos de contacto. Sin funciones asignadas, una mezcla de cuatro imágenes tiende a producir un híbrido visual confuso; con ellas, cada referencia cumple una única tarea.
El prompt de consistencia de marca: crea un bloque reutilizable
En proyectos de marca, es mejor dejar de redactar un prompt nuevo para cada imagen y reutilizar una especificación estructurada. La forma reproducible de mantener una estética coherente es definir la marca una sola vez como un bloque etiquetado y pegarlo en cada generación.
La identidad visual debe expresarse como una especificación explícita que el modelo pueda interpretar igual en cada ejecución:
Especificación de marca: Color principal azul marino profundo (#10203A), acento coral cálido. Tipografía: sans serif geométrica y en negrita para los titulares, todo en mayúsculas. Atmósfera: segura, minimalista, con mucho espacio negativo. Logotipo: un círculo coral sencillo, arriba a la izquierda.
Esta pieza: Aplica la especificación de marca a una pieza 4:5 para redes sociales que anuncie el lanzamiento de un producto, con el titular "LÁNZALO" centrado.
Mantener la identidad dentro de un bloque fijo logra dos cosas: impide que el modelo se desvíe entre generaciones y permite cambiar solo la línea "esta pieza" para producir toda una campaña con una estética uniforme. El modelo también destaca al aplicar un diseño definido —un patrón, un logotipo o una obra— sobre objetos 3D y mockups sin perder una iluminación natural. Por eso, el mismo bloque funciona tanto para una pieza plana como para una fotografía de producto.
Aquí es donde un fundador independiente obtiene mayor ventaja: un bloque preciso de especificación de marca convierte al modelo en un diseñador junior que nunca olvida la guía de estilo. Un equipo interno puede versionar el bloque en un documento compartido para que todos generen contenido de marca de forma predeterminada.
En qué falla y cómo corregirlo
Todo método honesto reconoce sus puntos débiles. Google enumera los de Nano Banana Pro, y cada uno admite una corrección práctica dentro del flujo de trabajo.
- Titulares legibles directamente dentro de la imagen y en varios idiomas
- Consistencia de hasta 5 personas o de un producto dentro de una escena
- Infografías y diagramas basados en el mundo real mediante Search
- Control de estudio sobre luz, lente y color mediante lenguaje natural
- Salida nativa de hasta 4K
- El texto pequeño y los detalles finos pueden mezclarse o contener errores ortográficos
- Los datos de un diagrama pueden ser incorrectos y parecer convincentes
- El texto multilingüe puede contener errores gramaticales o culturales
- Las mezclas complejas y los cambios de iluminación pueden dejar artefactos
- Los rasgos de un personaje pueden variar entre ediciones sucesivas
Estas son las soluciones, punto por punto:
- El texto pequeño se distorsiona → genera solo el texto protagonista de gran tamaño; después, añade el cuerpo y el texto legal en la herramienta de diseño sobre la imagen.
- Los datos del diagrama son incorrectos → nunca confíes en las cifras de un gráfico generado; proporciona los datos reales en el prompt y revisa visualmente cada etiqueta antes de publicar. Basarse en Search ayuda, pero no sustituye la verificación.
- Hay errores en otros idiomas → pide a un hablante nativo que revise cualquier texto traducido antes de incorporarlo a una campaña pagada.
- Aparecen artefactos al mezclar → reduce el número de referencias, asigna funciones más claras o realiza manualmente la composición final en lugar de pedir una sola mezcla ambiciosa.
- Cambian los rasgos del personaje → fija las imágenes de referencia principales y vuelve a generar desde ellas, en vez de editar una edición ya editada.
Resolución y exportación: elige el nivel adecuado
Genera cada imagen a la resolución que exige el trabajo, no siempre al máximo. Nano Banana Pro ofrece tres niveles nativos: 1K (1024px) para borradores rápidos y contenido social, 2K (2048px) para la mayoría de las piezas finales destinadas a la web y a presentaciones, y 4K (hasta 4096px, alrededor de 16 megapíxeles) para impresión, gran formato o cualquier imagen que vaya a recortarse de forma agresiva.
Los niveles superiores requieren más tiempo y dinero por imagen. Por eso conviene preparar la composición en 1K, iterar el prompt hasta acertar con el encuadre y volver a ejecutar una sola vez el prompt ganador en 4K para obtener el resultado final. Cada imagen también incorpora una marca de agua invisible SynthID que la identifica como generada por IA, un dato relevante cuando la procedencia importa. Todo esto está disponible en la app de Gemini para uso informal, o en Google AI Studio y Vertex AI cuando se necesitan controles del modelo y acceso mediante API.

Para saber cuánto cuesta cada opción y qué nivel de acceso hace falta, consulta el desglose de precios de Nano Banana Pro. Si aún falta decidir si este es el modelo que conviene adoptar como estándar, revisa su posición frente a las demás alternativas en la comparativa de generadores de imágenes con IA de 2026. Para explorar estilos, Midjourney todavía lleva ventaja en ilustración y atmósfera.
¿Cuáles son los mejores prompts para Nano Banana Pro que se pueden copiar y pegar?
Los paquetes de copiar y pegar sirven para descubrir las posibilidades del modelo, pero son un punto de partida, no un método. El modelo responde mucho mejor a una descripción estructurada de la escena —sujeto, composición, acción, ubicación y estilo— que a una frase prestada. Un paquete ayuda a aprender la formulación; después, conviene redactar un brief para la escena que realmente se necesita. Un prompt creado para una escena concreta siempre supera a uno genérico.
¿Cómo se escriben prompts para mejorar la calidad de una imagen?
La calidad nace de la dirección, no de las etiquetas de calidad. Acumular "8k, ultra-HD, obra maestra" casi no cambia nada porque el modelo ya busca fidelidad. En su lugar, hay que indicar los elementos que sí determinan la calidad: el nivel de resolución —generar en 2K o 4K—, una indicación concreta de cámara y lente ("fotografiada con una lente de 50mm y poca profundidad de campo") y una iluminación explícita ("luz de ventana suave y direccional"). Estas indicaciones influyen mucho más que cualquier acumulación de adjetivos.
¿Puedo usar prompts de Nano Banana Pro para editar fotos?
Sí, y es uno de sus puntos fuertes. Basta con cargar la imagen y dar una instrucción de edición directa que se refiera a lo que ya aparece: "cambia la chaqueta a verde bosque", "elimina el letrero del fondo", "vuelve a iluminar la escena como si fuera la hora dorada". Hay que precisar el único cambio deseado; un prompt de edición ambiguo hace que el modelo altere elementos que debían mantenerse.
¿Por qué Nano Banana Pro genera texto mejor que otros modelos?
Puede producir texto correcto y legible directamente dentro de la imagen y en varios idiomas, mientras la mayoría de los modelos de imagen todavía crean caracteres ilegibles. Si se escriben las palabras exactas entre comillas, se define el estilo tipográfico y se indica la posición, el modelo puede componer un titular limpio. La limitación es el tamaño: el texto generado debe ser grande y corto, porque las letras pequeñas y los párrafos largos aún presentan errores ortográficos.
4 sept 2026







