Nano Banana IA: la estructura de prompts que sí funciona

Aprende a escribir prompts para Nano Banana IA que produzcan imágenes útiles: estructura, iluminación, texto, edición, JSON y límites reales.

Friday, September 4, 2026Omid Saffari
Nano Banana IA: la estructura de prompts que sí funciona

Nano Banana IA seguirá al pie de la letra un prompt descuidado y devolverá un resultado igual de descuidado. Quienes consiguen imágenes limpias y fieles al encargo no usan palabras mejores: usan una estructura. Empiezan con un verbo claro, describen la escena como en un briefing de dirección de arte y cambian un solo elemento cada vez.

La estructura que hay detrás de todo buen prompt para Nano Banana IA

Empieza el prompt con un verbo que defina la tarea. Después, describe la escena como si dieras indicaciones a un fotógrafo, no como si etiquetaras una foto de stock. Ese hábito separa un resultado aprovechable del acabado genérico que domina tantas recopilaciones de prompts.

Nano Banana es el modelo de imágenes de Google, basado en la familia Gemini 3, y razona sobre el prompt antes de generar. Por eso responde mejor a una instrucción que a una lista inconexa de palabras clave. La fórmula oficial para crear imágenes a partir de texto tiene cinco elementos:

[Sujeto] + [Acción] + [Lugar/contexto] + [Composición] + [Estilo]

La composición define el encuadre: cuánto se acerca y desde qué ángulo se toma. El estilo determina la estética o el medio, como fotografía editorial, ilustración plana o render 3D. Al completar los cinco elementos, el modelo recibe una escena, no un deseo impreciso.

Después, itera mediante la conversación. Define la escena de forma aproximada en una frase y modifica un elemento por turno. Intentar corregir iluminación, pose y fondo en una sola reformulación es la manera más rápida de perder lo que ya funcionaba.

Prompts para Nano Banana en fotografía de producto y marca

En trabajos de producto y envases, la fórmula anterior más tres controles explícitos —luz, lente y material— suele bastar para obtener una imagen principal utilizable.

Si empiezas con una descripción vaga, obtendrás el problema del que todo el mundo se queja. Escribe «una botella de agua sobre una mesa, buena iluminación» y Nano Banana devolverá un render de catálogo genérico: ángulo frontal y plano, reflejos con aspecto plástico y una superficie que no parece de ningún material concreto. Técnicamente no hay nada mal; comercialmente no sirve.

Ahora plantea la escena como una sesión fotográfica:

Fotografía una botella de agua de acero inoxidable negro mate sobre una mesa de roble claro. Luz suave de la mañana desde la izquierda, poca profundidad de campo y toma ligeramente cenital. Fotorrealista, cálida y minimalista.

Lo que corrige el resultado son los detalles concretos. La materialidad es la palanca principal: no pidas «una botella», sino «una botella de acero inoxidable negro mate». Nombra cada superficie como lo haría un escenógrafo —«tweed azul marino», «aluminio cepillado», «cerámica esmaltada»— y el render dejará de parecer sintético. La iluminación y la cámara hacen el resto: «luz suave de la mañana desde la izquierda» y «toma ligeramente cenital» sustituyen la vista frontal de estudio por defecto por una imagen que sí parece una fotografía real.

Puedes usar Nano Banana gratis en la aplicación de Gemini, pero Google AI Studio ofrece todos los controles que presuponen estas recetas. La cantidad que puedes generar depende del plan que pagues.

Interfaz de Google AI Studio para escribir prompts de Nano Banana
Google AI Studio, la plataforma que ofrece todos los controles de prompts de Nano Banana

Texto, logotipos y carteles: donde fallan casi todos los generadores de imágenes con IA

Nano Banana genera texto nítido y legible, justo la capacidad que históricamente ha fallado en todos los modelos de imágenes. Sigue tres reglas y podrás producir carteles y mockups utilizables, no caracteres sin sentido.

Primero, escribe entre comillas las palabras exactas: indica que genere "URBAN EXPLORER", no «las palabras urban explorer». Segundo, especifica la tipografía: «sans serif blanca y en negrita» o «Century Gothic fina y minimalista». Tercero, para textos largos aplica el método de empezar por el contenido: pide primero a Gemini que redacte el texto en la conversación y luego solicita una imagen que lo reproduzca exactamente. También admite tipografía multilingüe en más de diez idiomas, así que puedes escribir el prompt en inglés e indicar el idioma que debe aparecer en el cartel.

  1. Genera primero el texto en el chat

    Pide el titular y el subtítulo como texto. Cierra la redacción antes de generar un solo píxel.

  2. Genera la imagen con las palabras entre comillas

    «Un cartel tipográfico, fondo negro liso, la palabra 'GLOW' centrada en el encuadre con una tipografía manuscrita de pincel y trazos fluidos».

  3. Localiza el contenido si hace falta

    Añade «traduce el titular al coreano» y el modelo volverá a generar la tipografía, no solo el pie de imagen.

Aquí el estándar profesional es innegociable: Nano Banana genera imágenes rasterizadas, no vectoriales. Una imagen rasterizada es una cuadrícula de píxeles; un vector consiste en formas matemáticas editables que pueden escalarse a cualquier tamaño, justo lo que necesita un logotipo real. Nano Banana es excelente para explorar direcciones visuales de logotipos y composiciones de marca, y también para crear carteles terminados. Pero si necesitas una marca editable y escalable sin límite, tendrás que tomar esa propuesta y reconstruirla en una herramienta vectorial. Su resultado para logotipos es una referencia visual, no un archivo final.

Edición y consistencia: cambia una cosa y conserva el resto

Al editar hay que aplicar el instinto opuesto al de generar. Ya existe una imagen, así que el prompt debe indicar qué cambia y, con la misma claridad, qué debe permanecer idéntico.

Nano Banana edita mediante texto con lo que Google denomina enmascaramiento semántico: la región se «enmascara» con palabras en lugar de un pincel. Instrucciones como «elimina al hombre de la foto» o «sustituye únicamente el fondo por un ciclorama blanco de estudio y conserva el producto exactamente igual» funcionan porque especifican qué se debe proteger. Si omites esa parte, el modelo redibujará sin problema aquello que querías conservar.

Para mantener la consistencia en una serie importan dos recursos. Puedes incluir hasta 14 imágenes de referencia en un solo prompt y fijar la identidad de forma explícita. ¿Quieres repetir la misma mascota, producto o personaje en toda una campaña? Sube una referencia limpia e indica que conserve exactamente la identidad del sujeto mientras cambia la escena que lo rodea. El método que la comunidad emplea para trabajos de marca repetibles aplica la misma idea con rigor: una referencia clara más una instrucción explícita de «conservar exactamente la identidad».

Lo bueno
Lo que hace bien
5 points

  • Cambiar fondos sin alterar el producto
  • Transferir estilos (recrear esta foto como una ilustración plana)
  • Mantener un personaje o producto en varias escenas mediante referencias
  • Deriva: tras muchas ediciones conversacionales, los detalles pequeños empiezan a cambiar. Cuando ocurra, vuelve a empezar desde una base limpia.
  • Fidelidad exacta a los colores de marca. Contrasta los valores hexadecimales con la paleta real; no confíes en lo que muestra la pantalla.

Escribe prompts como un director creativo

La diferencia entre un resultado «bueno» y uno «espectacular» está en los controles que las listas de prompts no suelen mencionar. Dirige la escena como un director creativo dirigiría una sesión.

  • Iluminación: define el esquema. «Tres softboxes en una configuración de tres puntos» para una luz de producto limpia; «claroscuro, contraste alto y marcado» para añadir dramatismo; «contraluz de hora dorada con sombras largas» para aportar calidez.
  • Cámara y lente: el equipo transforma por completo el ADN visual. «Fotografiado con una Fujifilm» aporta una ciencia del color auténtica; «cámara desechable con flash» crea una nostalgia cruda; «ángulo bajo, poca profundidad de campo, f/1.8» fuerza un enfoque cinematográfico; «lente macro» sirve para el detalle y «gran angular», para transmitir escala.
  • Gradación de color y película: «como si se hubiera fotografiado con película en color de los años 1980, con un poco de grano» o «gradación cinematográfica, tonos verde azulado apagados» definen la temperatura emocional.

También conviene conocer el modo conectado a la web: los dos modelos actuales pueden obtener información en tiempo real mediante búsquedas. La fórmula es [Fuente/solicitud de búsqueda] + [Tarea analítica] + [Traducción visual]. Por ejemplo: «busca el clima actual de San Francisco y represéntalo como una ciudad diminuta dentro de una taza de café». Es una función especializada, pero ningún otro generador resuelve en un solo paso este tipo de visuales basados en datos o en la actualidad.

Cuándo conviene usar JSON estructurado y cuándo no

Usa un prompt JSON estructurado cuando necesites repetir el mismo estilo en una serie; para todo lo demás, quédate con el lenguaje natural. Esa es la recomendación más sensata.

En 2026 se ha extendido entre la comunidad de diseño la práctica de escribir prompts en JSON, con claves explícitas para subject, camera, style, photographic_quality y aspect_ratio. La ventaja es la repetibilidad: cuando un bloque produce el aspecto buscado, puedes cambiar un solo valor, volver a generar y conservar el resto. La desventaja es la fricción. Para una imagen principal aislada, resulta excesivo; el lenguaje natural es más rápido y, a menudo, más creativo. Para una serie de diez imágenes de producto que deben coincidir, la estructura sí compensa.

Estas son las especificaciones estrictas que delimitan cualquier prompt:

EspecificaciónQué obtienes
Resoluciones1K, 2K, 4K integradas (un nivel 0.5K/512px en el modelo Flash más pequeño)
Relaciones de aspecto1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9
Imágenes de referenciaHasta 14 por prompt
ProcedenciaCada imagen incluye una marca de agua SynthID y credenciales de contenido C2PA
Fecha de corte del conocimientoEnero de 2025 (más búsqueda web en vivo para datos actuales)

En qué sigue fallando Nano Banana y cómo resolverlo

Incluso con un prompt perfecto, tres límites determinan si el resultado está listo para entregar. Conviene conocerlos antes de prometer un archivo final a un cliente.

No genera vectores. Solo imágenes rasterizadas. Eso funciona para fotografías, carteles y exploración; antes de entregar un logotipo o icono, hay que reconstruirlo en una herramienta vectorial. Incluye una señal visible de procedencia. Cada imagen lleva una marca de agua SynthID invisible y credenciales C2PA por diseño. Es una práctica transparente, pero debes saber que están ahí si un cliente pregunta por la divulgación del uso de IA. Las ediciones acumulan deriva. Las cadenas largas de cambios conversacionales deterioran poco a poco los detalles; cuando la imagen empiece a mutar, vuelve a una generación limpia en lugar de seguir corrigiéndola. Ninguno de estos límites invalida la herramienta. Marcan la frontera entre «usarla en un trabajo real» y «usarla para explorar», y un diseñador debe saber en qué lado queda cada proyecto.

¿Cuál es la mejor estructura para un prompt de Nano Banana?

Empieza con un verbo claro y completa cinco elementos: sujeto, acción, lugar/contexto, composición —el encuadre— y estilo —la estética o el medio—. Descríbelo como un briefing de dirección de arte, no como una lista de palabras clave.

¿Por qué Nano Banana ignora «sin texto» o «sin personas» en un prompt?

El modelo responde a lo que nombras, no a lo que niegas. Formula la petición en positivo: describe la versión vacía y limpia que buscas —«un fondo de estudio despejado»— en vez de enumerar lo que debe eliminar.

¿Nano Banana puede escribir texto correcto dentro de una imagen?

Sí. Pon las palabras exactas entre comillas, especifica el estilo de la tipografía y, si el texto es largo, genéralo primero en el chat y después crea la imagen. Produce tipografía legible en más de diez idiomas.

¿Cuántas imágenes de referencia puedo usar a la vez?

Hasta 14 en un solo prompt, lo que permite mantener la consistencia de personajes y productos a lo largo de una serie.

¿Quieres recibir el próximo análisis con este nivel de detalle, además de los prompts y las herramientas que realmente valen la pena? Suscríbete al boletín.

Última actualización

4 sept 2026

CategoríaDesign

Prefiera este sitio en Google

Añadir omidsaffari.com como fuente preferida en la Búsqueda de Google

Marque omidsaffari.com como fuente preferida y Google lo destacará para usted en Top Stories, AI Overviews y AI Mode.

Newsletter

Una carta, cada domingo. Sistemas que funcionan, no opiniones calientes.

Build logs, sistemas en producción y notas de campo de un portafolio de ventures de IA.

Semanal. Sin spam. Cancele cuando quiera.