"¿Cómo hago un video con Gemini?" es la pregunta que más recibo, y casi todos la formulan ligeramente mal. Se imaginan escribiendo una frase en el chat de Gemini y obteniendo una película. No es exactamente así como funciona el stack — y una vez que entiendes la tubería real, dejas de luchar contra ella y empiezas a obtener buenos clips al primer intento.
Así que déjame darte la versión honesta, y luego la práctica.
Primero: Gemini es el cerebro, Veo es la cámara
Gemini es la familia de modelos multimodales de Google — razona, escribe, ve imágenes y comprende prompts. Pero no pinta fotogramas de video por sí mismo. El modelo que convierte texto en imágenes en movimiento es Veo (actualmente Veo 3.1), el modelo de generación de video dedicado de Google. Cuando "haces un video con Gemini", lo que realmente sucede es: Gemini interpreta tu intención, y Veo renderiza el metraje real con audio sincronizado.
Esto importa porque te indica de dónde viene la calidad. Un gran clip es 70% prompt y 30% modelo. Veo 3.1 es genuinamente excelente — 1080p nativo, clips de 8 segundos, audio sincronizado real (no un bucle silenciado que editas después). Tu trabajo es alimentarlo con un prompt que pueda ejecutar.
Las tres formas de acceder a Veo
Hay exactamente tres caminos, y se equilibran entre precio y fricción:
- Aplicación Gemini / Google AI Studio. Existe un nivel gratuito, pero tiene límites de tasa y marcas de agua, y el acceso a Veo va y viene según tu plan y región. Adecuado para un experimento puntual.
- Google Cloud Vertex AI. La API pura. Control total, sin marca de agua — pero necesitas una cuenta de GCP, facturación configurada, claves API, y se te cobra por segundo con la típica ansiedad de la factura en la nube. Exagerado a menos que estés construyendo infraestructura.
- Una herramienta alojada que envuelve a Veo del lado del servidor. Escribes un prompt, genera, pagas solo por lo que renderizas. Sin claves, sin GCP, sin factura sorpresa. Este es el camino para el que construí la herramienta de texto a video de GeminiOmni, precisamente porque las opciones 1 y 2 son demasiado limitadas o requieren demasiado trámite para alguien que solo quiere un clip.
Elige según la frecuencia con la que harás esto. Una vez al mes → la aplicación Gemini está bien. Una vez por semana o más → un wrapper alojado te ahorra dinero y el dolor de cabeza de GCP.
Los pasos reales (texto a video)
Sea cual sea el camino que elijas, la mecánica es la misma:
1. Escribe tu escena como un prompt. Una o dos oraciones que describan sujeto, acción, entorno y estado de ánimo. Más abajo hablo de la estructura.
2. Elige tu relación de aspecto. 16:9 para YouTube y paisaje, 9:16 para Reels/TikTok/Shorts, 1:1 para publicaciones en feeds. Decide antes de generar — recortar un video generado pierde calidad.
3. Genera y espera. Veo tarda aproximadamente de 30 a 90 segundos para un clip de 8 segundos. Esto es renderizado, no una respuesta de chat; es normal que se sienta lento.
4. Revisa el audio. Veo 3.1 genera sonido con el video — pasos, ambiente de la habitación, el tipo de música adecuado. Si el audio está mal, generalmente es un problema del prompt, no un fallo del modelo (ver más abajo).
5. Descarga o itera. Si el 80% está bien, ajusta una variable y regenera en lugar de reescribir todo el prompt.
La estructura de prompt que realmente funciona
Después de varios cientos de generaciones, este es el esqueleto que uso cada vez:
[Tipo de plano] de [sujeto] [haciendo acción], [entorno], [momento del día / iluminación], [estado de ánimo], [indicación de audio].
Un ejemplo concreto:
Plano grúa cinematográfico de un S-Bahn de Berlín entrando a la estación Hackescher Markt, hora dorada, cálido y nostálgico, jazz ambiental y el zumbido del andén.
Observa lo que incluye:
- Una instrucción de cámara ("plano grúa cinematográfico") — Veo respeta el lenguaje de los planos. "Primer plano", "plano general de establecimiento", "plano de seguimiento", "plano de dron" cambian drásticamente el resultado.
- Un sujeto realizando una acción específica — los verbos importan más que los adjetivos. "Entrando a" es mejor que "un tren en".
- Iluminación y momento del día — "hora dorada", "noche iluminada con neón", "mañana nublada". Esta sola frase controla el 50% del ambiente.
- Una indicación de audio explícita — porque Veo genera sonido, decirle qué generar ("jazz ambiental", "lluvia en un tejado de zinc", "sin música, solo viento") es la diferencia entre un clip que se siente terminado y uno que tienes que volver a musicalizar.
Lo que perjudica tu prompt: apilar diez adjetivos, instrucciones contradictorias ("cámara lenta rápida") y conceptos abstractos sin ancla visual ("un video sobre la esperanza"). Veo renderiza lo que puede ver. Dale algo que pueda ver.
Errores comunes y sus soluciones
"Mi video ignoró la mitad de mi prompt." Probablemente describiste demasiado. Veo tiene un presupuesto de 8 segundos; no puede mostrar un arco argumental completo. Una acción, un momento. Corta la segunda mitad.
"El movimiento se ve falso / flotante." Añade un ancla física — contacto con el suelo, peso, una referencia del mundo real ("una pesada puerta de roble cerrándose"). Los sujetos abstractos que flotan son donde todos los modelos de video aún fallan.
"El audio está mal o ausente." No lo especificaste. Añade una cláusula de audio explícita. Si quieres silencio, di "sin música, solo ambiente".
"No es lo suficientemente fotorrealista." Añade "grabado en película de 35mm", "poca profundidad de campo" o "4K cinematográfico" — y reduce tus expectativas con los rostros en movimiento, que siguen siendo lo más difícil para cualquier modelo de video de 2026.
Imagen a video: el atajo infrautilizado
Si ya tienes una imagen que te encanta — una foto de producto, una obra de arte, un personaje — no la describas desde cero. Alimenta la imagen directamente y escribe el prompt solo para el movimiento. Esto es lo que la gente que busca "画像を動画に" o "hacer que mi foto se mueva" realmente quiere, y casi siempre es de mayor calidad que el texto a video puro porque el modelo no tiene que adivinar la composición. Le das el fotograma; solo tiene que animarlo. La mayoría de las herramientas alojadas, incluyendo la nuestra, exponen esto como un modo separado de imagen a video.
Entonces, ¿cuál es la ruta más rápida para tu primer clip?
Si quieres experimentar una vez y no te importa una marca de agua, abre la aplicación Gemini y prueba Veo allí. Si vas a hacer esto con regularidad — para contenido, marketing, trabajo con clientes — sáltate la configuración de GCP por completo y usa una herramienta que envuelva a Veo del lado del servidor para que pagues solo por renderizado. Eso es exactamente el vacío que GeminiOmni llena: escribe un prompt, obtén un clip en 1080p con audio real en aproximadamente un minuto, sin claves que gestionar ni una suscripción mensual que te queme la cartera la uses o no.
El modelo ya es lo suficientemente bueno. Lo que se interpone entre tú y un clip del que te sientas orgulloso no es Gemini ni Veo — es el prompt. Empieza con el esqueleto de arriba, cambia una variable a la vez, y te sorprenderá lo rápido que te vuelves fluido.
