Générer une vidéo avec Grok : un guide pratique
Le modèle vidéo de Grok transforme une phrase — ou une photo — en un clip court, jusqu'à 15 secondes. Dans GO AI Chat, il se trouve dans l'onglet Lab, à côté de la génération d'images : vous ne payez donc pas une app séparée. Le motif de consigne qui marche est ennuyeux et fiable : un sujet, une action, un mouvement de caméra, un style. Tout le reste consiste à gérer la variation.
Ce qu'est réellement la vidéo Grok
C'est un modèle texte-vers-vidéo et image-vers-vidéo de xAI. Vous lui donnez une description ou une image fixe ; il renvoie un clip court au mouvement synthétisé. Ce n'est pas un éditeur, pas une banque d'images, et pas un outil pour fabriquer une scène de deux minutes. Le traiter comme un générateur de plans — un moment, quelques secondes — est le modèle mental qui produit un résultat exploitable.
La même capacité sous-jacente alimente la génération vidéo à plusieurs endroits, dont X. Ce qui diffère, c'est le contexte autour : dans GO AI Chat, le clip atterrit dans votre pellicule et non dans un flux, et vous êtes déjà dans l'app où vous écrivez, cherchez et générez des images.
Le motif de consigne
Toutes les consignes de mouvement qui ont marché chez nous comportent les mêmes quatre parties. S'il en manque une, le modèle l'invente, généralement mal.
- Sujet — qui ou quoi, précisément. « Une femme en imperméable jaune », pas « une personne ».
- Action — une chose qui se passe. « Marche vers la caméra. » Pas « marche, puis se retourne, puis fait signe ».
- Caméra — le modèle bougera la caméra que vous le demandiez ou non, alors demandez-le. « Lent travelling avant. » « Plan large fixe. » « Caméra à l'épaule qui suit. »
- Style — « tourné en 35 mm, faible profondeur de champ », « anime en cel shading », « documentaire granuleux ».
Assemblé : « Une femme en imperméable jaune marche vers la caméra sous une pluie éclairée au néon, lent travelling avant, tourné en 35 mm avec une faible profondeur de champ. » Cela se lit comme une liste de plans, parce que c'en est une.
Durée, format et qualité
Trois réglages comptent, et ils interagissent avec le coût : les clips plus longs et de meilleure qualité consomment davantage de votre solde de jetons, il vaut donc mieux choisir délibérément que pousser tout au maximum par défaut.
| Réglage | Que choisir | Pourquoi |
|---|---|---|
| Durée | 5-8 s pour l'essentiel ; 15 s seulement si le mouvement l'exige | Les clips longs dérivent davantage. Un plan serré de 6 secondes bat un plan flottant de 15. |
| Format | 9:16 pour Reels/TikTok/Shorts, 16:9 pour tout ce qui est horizontal | Générez dans le format où vous publierez — recadrer après jette de la résolution et recompose le plan à votre place, mal. |
| Qualité | Palier bas pendant que vous itérez sur la consigne ; montez pour la bonne prise | C'est l'exploration de la consigne qui consomme les tirages. Ne les consommez pas en pleine qualité. |
Image vers vidéo : la voie sous-estimée
Partir d'une photo retire la partie la plus difficile du travail : le modèle n'a plus à inventer l'apparence des choses, seulement leur mouvement. C'est pourquoi les résultats en image-vers-vidéo sont si souvent plus cohérents que le texte-vers-vidéo sur la même idée.
La règle qui décide du succès : l'image fixe doit suggérer un mouvement plausible. Un portrait aux cheveux détachés suggère du vent. Une tasse de café suggère de la vapeur. Une voiture garée ne suggère rien, et le modèle inventera quelque chose. Si vous ne pouvez pas dire en cinq mots ce qui devrait bouger, changez de photo.
Ce qu'il fait vraiment mal
Être précis sur les limites est plus utile qu'une liste de fonctions :
- Le texte dans le cadre. Panneaux, logos et incrustations reviennent en charabia d'apparence convaincante. Ajoutez le texte ensuite dans un éditeur.
- Les mains au travail fin. Taper au clavier, jouer d'un instrument, manipuler de petits objets — toujours l'échec classique.
- La constance d'un personnage entre clips. Deux générations de « la même » personne ne coïncideront pas. Prévoyez des plans qui n'exigent pas de continuité, ou partez d'une même photo en image-vers-vidéo pour les deux.
- Compter. « Trois chiens » donne souvent deux ou quatre. Dites « un chien » si le nombre compte moins que le plan.
Un flux qui gaspille moins de tirages
- Écrivez la consigne en quatre parties. Relisez-la et supprimez le deuxième verbe.
- Générez une fois en qualité basse et durée courte.
- Si c'est juste à 80 %, régénérez la même consigne — la seule variation suffit souvent.
- Si c'est faux d'une manière précise, changez exactement une partie de la consigne. En changer trois ne vous apprend rien.
- Une fois le plan bon, relancez à la qualité et à la durée que vous voulez vraiment.
La version pas à pas complète, avec l'emplacement des boutons, est dans notre parcours vidéo sur iPhone. Pour la comparaison entre Grok et GPT-5 sur tout ce qui n'est pas de la vidéo, voir Grok 4 face à GPT-5.
Questions fréquentes
Quelle durée maximale ?
Jusqu'à 15 secondes — c'est le plafond du sélecteur. La cohérence se dégrade sur les clips plus longs, d'où le plafonnement.
Peut-il animer une photo existante ?
Oui, avec l'image-vers-vidéo. Cela marche mieux quand l'image fixe suggère un mouvement plausible.
Pourquoi le rendu diffère-t-il de la consigne ?
Variation réelle d'un tirage à l'autre. À peu près juste ? Régénérez avant de réécrire. Complètement faux ? La consigne demande plusieurs choses à la fois.
Faut-il une app à part ?
Non. GO AI Chat fait tourner la vidéo via Grok dans la même app que le chat, les images et la voix ; le rendu part dans votre pellicule.