Comment créer une vidéo avec Gemini — un guide pas à pas pour 2026

juin 11, 2026

« Comment créer une vidéo avec Gemini ? » est la question que l'on me pose le plus souvent, et presque tout le monde la formule de travers. Ils s'imaginent taper une phrase dans la boîte de chat de Gemini et obtenir un film en retour. Ce n'est pas exactement ainsi que la pile fonctionne — et une fois que vous comprenez les rouages réels, vous arrêtez de lutter et commencez à obtenir de bons clips dès la première tentative.

Laissez-moi donc vous donner la version honnête, puis la version pratique.

D'abord : Gemini est le cerveau, Veo est la caméra

Gemini est la famille de modèles multimodaux de Google — il raisonne, écrit, voit des images et comprend les prompts. Mais il ne peint pas lui-même les images vidéo. Le modèle qui transforme le texte en images animées est Veo (actuellement Veo 3.1), le modèle dédié à la génération vidéo de Google. Lorsque vous « créez une vidéo avec Gemini », ce qui se passe réellement est : Gemini interprète votre intention, et Veo rend les images réelles avec un son synchronisé.

C'est important car cela vous indique d'où vient la qualité. Un excellent clip est composé à 70 % du prompt et à 30 % du modèle. Veo 3.1 est véritablement excellent — 1080p natif, clips de 8 secondes, son synchronisé réel (pas une boucle muette que vous sonorisez après coup). Votre travail consiste à lui fournir un prompt qu'il peut exécuter.

Les trois façons d'accéder à Veo

Il existe exactement trois chemins, qui font un compromis entre prix et friction :

  1. Application Gemini / Google AI Studio. Un niveau gratuit existe mais est limité en débit et filigrané, et l'accès à Veo varie selon votre forfait et votre région. Correct pour une expérience unique.
  2. Google Cloud Vertex AI. L'API brute. Contrôle total, pas de filigrane — mais vous avez besoin d'un compte GCP, d'une facturation configurée, de clés API, et vous êtes facturé à la seconde avec l'angoisse habituelle de la facture cloud. Excessif sauf si vous construisez une infrastructure.
  3. Un outil hébergé qui encapsule Veo côté serveur. Vous tapez un prompt, il génère, vous ne payez que pour ce que vous rendez. Pas de clés, pas de GCP, pas de facture surprise. C'est le chemin autour duquel j'ai construit l'outil texte-vers-vidéo de GeminiOmni, précisément parce que les options 1 et 2 sont soit trop limitées, soit trop contraignantes pour quelqu'un qui veut juste un clip.

Choisissez en fonction de la fréquence à laquelle vous le ferez. Une fois par mois → l'application Gemini suffit. Une fois par semaine ou plus → un wrapper hébergé vous fait économiser à la fois de l'argent et les maux de tête liés à GCP.

Les étapes concrètes (texte-vers-vidéo)

Quel que soit le chemin choisi, la mécanique est la même :

1. Rédigez votre scène sous forme de prompt. Une ou deux phrases décrivant le sujet, l'action, le décor et l'ambiance. Plus de détails sur la structure ci-dessous.

2. Choisissez votre format d'image. 16:9 pour YouTube et le paysage, 9:16 pour Reels/TikTok/Shorts, 1:1 pour les publications de fil d'actualité. Décidez avant de générer — recadrer une vidéo générée fait perdre en qualité.

3. Générez et attendez. Veo prend environ 30 à 90 secondes pour un clip de 8 secondes. C'est du rendu, pas une réponse de chat ; il est normal que cela semble lent.

4. Vérifiez le son. Veo 3.1 génère du son avec la vidéo — pas de bruit de fond, l'ambiance de la pièce, le bon type de musique. Si le son est incorrect, c'est généralement un problème de prompt, pas une défaillance du modèle (voir ci-dessous).

5. Téléchargez ou itérez. Si 80 % est correct, ajustez une variable et régénérez plutôt que de réécrire tout le prompt.

La structure de prompt qui fonctionne vraiment

Après quelques centaines de générations, voici le squelette que j'utilise à chaque fois :

[Type de plan] de [sujet] [faisant action], [décor], [moment de la journée / éclairage], [ambiance], [indice sonore].

Un exemple concret :

Plan cinématographique en grue d'un S-Bahn berlinois entrant en gare de Hackescher Markt, heure dorée, chaleureux et nostalgique, jazz ambiant et ronronnement du quai.

Remarquez ce qui s'y trouve :

  • Une instruction de caméra (« plan cinématographique en grue ») — Veo respecte le langage des plans. « Gros plan », « plan d'ensemble large », « travelling », « plan de drone » changent tous le résultat de façon spectaculaire.
  • Un sujet effectuant une action spécifique — les verbes comptent plus que les adjectifs. « Entrant en gare » est meilleur qu'« un train à ».
  • L'éclairage et le moment de la journée — « heure dorée », « nuit éclairée au néon », « matin nuageux ». Cette seule phrase contrôle 50 % de l'ambiance.
  • Un indice sonore explicite — parce que Veo génère du son, lui dire quoi générer (« jazz ambiant », « pluie sur un toit en tôle », « pas de musique, juste du vent ») fait la différence entre un clip qui semble fini et un que vous devez re-sonoriser.

Ce qui nuit à votre prompt : empiler dix adjectifs, des instructions contradictoires (« ralenti rapide ») et des concepts abstraits sans ancrage visuel (« une vidéo sur l'espoir »). Veo rend ce qu'il peut voir. Donnez-lui quelque chose à voir.

Erreurs courantes et corrections

« Ma vidéo a ignoré la moitié de mon prompt. » Vous avez probablement trop décrit. Veo a un budget de 8 secondes ; il ne peut pas montrer un arc narratif complet. Une action, un moment. Supprimez la seconde moitié.

« Le mouvement semble irréaliste / flottant. » Ajoutez un ancrage physique — contact au sol, poids, une référence réelle (« une lourde porte en chêne se refermant »). Les sujets flottants abstraits sont là où tous les modèles vidéo peinent encore.

« Le son est incorrect ou absent. » Vous ne l'avez pas spécifié. Ajoutez une clause audio explicite. Si vous voulez le silence, dites « pas de musique, seulement l'ambiance ».

« Ce n'est pas assez photoréaliste. » Ajoutez « filmé sur pellicule 35 mm », « faible profondeur de champ » ou « cinématographique 4K » — et réduisez vos attentes concernant les visages en mouvement, qui restent la chose la plus difficile pour tout modèle vidéo de 2026.

Image-vers-vidéo : le raccourci sous-estimé

Si vous avez déjà une image que vous aimez — une photo de produit, une œuvre d'art, un personnage — ne la décrivez pas à partir de zéro. Fournissez directement l'image et invitez uniquement le mouvement. C'est ce que recherchent les personnes qui tapent « 画像を動画に » ou « faire bouger ma photo », et c'est presque toujours de meilleure qualité que le texte-vers-vidéo pur car le modèle ne devine pas la composition. Vous lui donnez le cadre ; il n'a qu'à l'animer. La plupart des outils hébergés, y compris le nôtre, exposent cela comme un mode image-vers-vidéo séparé.

Alors — quel est le chemin le plus rapide vers votre premier clip ?

Si vous voulez faire une expérience une fois et que le filigrane ne vous dérange pas, ouvrez l'application Gemini et essayez Veo à cet endroit. Si vous comptez le faire régulièrement — pour du contenu, du marketing, du travail client — sautez complètement la configuration GCP et utilisez un outil qui encapsule Veo côté serveur afin de ne payer que par rendu. C'est exactement l'écart que GeminiOmni comble : tapez un prompt, obtenez un clip 1080p avec un son réel en environ une minute, pas de clés à gérer et pas d'abonnement mensuel qui brûle de l'argent que vous l'utilisiez ou non.

Le modèle est déjà assez bon. Ce qui vous sépare d'un clip dont vous êtes fier n'est ni Gemini ni Veo — c'est le prompt. Commencez par le squelette ci-dessus, modifiez une variable à la fois, et vous serez surpris de la rapidité avec laquelle vous devenez à l'aise.

Lena Hoffmann

Lena Hoffmann