Cómo crear imágenes con Gemini — guía práctica para 2026

jun. 29, 2026

"¿Cómo creo una imagen con Gemini?" es una pregunta que recibo casi tan a menudo como la del video — y al igual que esa, la mayoría se la imagina ligeramente mal. Piensan en un solo modelo llamado "Gemini" que pinta cuadros. La realidad es una pequeña familia de modelos de imagen que operan detrás de Gemini, cada uno diseñado para un verbo diferente. Una vez que sabes cuál estás usando realmente, dejas de adivinar y empiezas a obtener imágenes utilizables al primer intento.

Aquí tienes la versión honesta y la versión práctica, ambas.

Primero: Gemini es el cerebro, el modelo de imagen es el pincel

Gemini es una familia de modelos multimodales. Razona, escribe, lee imágenes e interpreta tu prompt. Pero los píxeles reales de una imagen generada provienen de los modelos de imagen dedicados de Google:

  • Imagen 4 — El modelo insignia de Google para texto a imagen. Le das un prompt de texto y genera una imagen completamente nueva desde cero. Puramente generativo: sin modo de edición, sin subida, solo texto de entrada, foto de salida. Es genuinamente excelente en fotorrealismo y composición.
  • Nano Banana (Gemini Flash Image) — El modelo de edición. Subes una imagen, describes conversacionalmente lo que quieres cambiar, y preserva todo lo que no mencionaste. Este es al que se refiere la gente cuando dice "edita mi foto con IA".

La regla de una línea: Imagen 4 crea imágenes, Nano Banana las edita. Si tienes un lienzo en blanco, genera. Si ya tienes una imagen y quieres cambiar algo, edita. Elegir el verbo equivocado te cuesta tanto calidad como créditos.

Tres formas de acceder a los modelos de imagen

Misma disyuntiva que en todo el ecosistema Gemini — precio frente a complicación:

  1. App de Gemini / Google AI Studio. Hay un nivel gratuito, pero tiene límites de velocidad, a veces con marca de agua, y el acceso a modelos específicos va y viene según el plan y la región. Bien para un experimento puntual.
  2. Google Cloud Vertex AI. La API en bruto. Control total, sin marca de agua — pero necesitas una cuenta de GCP, facturación configurada y una clave de API, con facturación por imagen. Es excesivo a menos que estés construyendo infraestructura.
  3. Una herramienta alojada que envuelve los modelos del lado del servidor. Escribes un prompt, genera, pagas solo por lo que renderizas. Sin claves, sin GCP, sin factura sorpresa. Construí el generador de imágenes de GeminiOmni exactamente así porque las opciones 1 y 2 son o demasiado limitadas o demasiado engorrosas para alguien que solo quiere una imagen.

Elige según la frecuencia. ¿Una vez al mes? La app de Gemini está bien. ¿Más de una vez por semana? Un envoltorio alojado te ahorra dinero y la configuración de GCP.

Los pasos reales (texto a imagen)

Sea cual sea la ruta que tomes, la mecánica es la misma:

1. Escribe la escena como prompt. Sujeto, estilo, iluminación y encuadre en una o dos frases. El esqueleto está más abajo.

2. Elige primero tu relación de aspecto. 16:9 para banners y miniaturas, 1:1 para publicaciones en redes y avatares, 9:16 para historias. Decide antes de generar — recortar después desperdicia resolución.

3. Elige un modelo según la tarea. Rápido y barato para borradores e iteración (un modelo ligero como Z-Image Turbo cuesta una fracción de uno insignia); un modelo premium como Nano Banana Pro cuando necesitas salida 2K y texto legible dentro de la imagen.

4. Genera y revisa. Los modelos de imagen modernos devuelven en pocos segundos. Mira todo el encuadre, no solo el sujeto — las manos, el texto y los rostros son donde los modelos todavía fallan.

5. Itera una variable a la vez. Si está al 80%, no reescribas todo el prompt. Cambia una cosa — la iluminación, el lente, la hora del día — y regenera.

El esqueleto de prompt que realmente funciona

Después de varios cientos de generaciones, esta es la estructura a la que recurro cada vez:

[tipo de plano / medio] de [sujeto] [haciendo algo], [entorno], [iluminación / hora del día], [ambiente], [estilo o detalle de cámara].

Un ejemplo práctico:

Un plano general cinematográfico de un faro solitario en una costa rocosa durante la hora dorada, sombras largas, ambiente tranquilo y nostálgico, filmado en película de 35 mm con poca profundidad de campo.

Qué incluye:

  • Medio o tipo de plano ("plano general cinematográfico", "foto de producto de estudio", "ilustración vectorial plana") — esto define el aspecto completo. Los modelos de imagen respetan el vocabulario del medio.
  • Un sujeto específico haciendo algo — sustantivos y verbos concretos vencen a montones de adjetivos. "Un faro solitario en una costa rocosa" vence a "una hermosa vista escénica".
  • Iluminación y hora del día — "hora dorada", "noche de neón", "mañana nublada". Esta sola frase decide la mitad del ambiente.
  • Estilo o detalle de cámara — "película de 35 mm", "poca profundidad de campo", "4K, hiperdetallado" para fotorrealismo; "vector plano", "acuarela", "isométrico" para gráficos.

Lo que daña un prompt: apilar diez adjetivos, instrucciones contradictorias ("una escena minimalista pero muy detallada") y conceptos abstractos sin ancla visual ("una imagen sobre la libertad"). El modelo renderiza lo que puede ver — así que dale algo que ver.

Fallos comunes y cómo solucionarlos

"El texto en mi imagen está distorsionado." Los modelos de difusión han sido históricamente malos escribiendo palabras. Mantén el texto corto, ponlo entre comillas en el prompt y usa un modelo más potente — Nano Banana Pro renderiza texto legible mucho mejor que el nivel rápido.

"Las caras se ven raras." Las caras son lo más difícil para cualquier modelo de imagen de 2026. Aleja la cámara, evita los primeros planos extremos y añade "textura natural de la piel, iluminación suave de estudio" en lugar de esperar un retrato impecable en el nivel rápido.

"Ignoró la mitad de mi prompt." Probablemente describiste demasiado. Un sujeto, un momento, un ambiente. Corta la segunda mitad.

"No se ve real." Añade "filmado en película de 35 mm", "poca profundidad de campo", "iluminación natural" — y baja tus expectativas para manos y texto pequeño, que siguen siendo los puntos débiles en todas partes.

Editar en lugar de generar

Si ya tienes una imagen que te gusta — una foto de producto, una ilustración, un personaje — no la redescribas desde cero. Pasa la imagen al modelo de edición y escribe solo el cambio que deseas. De esto se trata realmente cuando la gente dice "edita mi foto con IA", y casi siempre es de mayor calidad que la generación pura de texto a imagen porque el modelo no está adivinando la composición — tú le diste el encuadre. La mayoría de las herramientas alojadas (la nuestra incluida) exponen esto como un modo de edición en contexto separado.

Entonces, ¿cuál es el camino gratuito más rápido para tu primera imagen?

Si solo quieres probarlo una vez y no te importa una marca de agua, genera en la app de Gemini. Si lo harás con regularidad — contenido, marketing, miniaturas — salta la configuración de GCP y usa una herramienta que envuelva los modelos del lado del servidor y facture por renderizado. Ese es el vacío que llena GeminiOmni: escribes un prompt y obtienes una imagen real en segundos. Las cuentas nuevas comienzan con créditos gratuitos — y como una imagen de nivel rápido cuesta solo un puñado de ellos, tus primeras imágenes son realmente gratis, sin necesidad de tarjeta para ver si vale la pena.

Los modelos ya son suficientemente buenos. Lo único que se interpone entre tú y una imagen de la que estés orgulloso no es Gemini ni Imagen — es el prompt. Empieza con el esqueleto de arriba y cambia una variable a la vez. Te volverás fluido sorprendentemente rápido.

Lena Hoffmann

Lena Hoffmann