Grokで動画を生成する:実践ガイド

要点

Grokの動画モデルは、一文または写真から最長15秒の短い動画を作ります。GO AI Chatでは画像生成と同じLabタブにあり、別のアプリへ料金を払う必要はありません。効果的なプロンプトは単純です。被写体1つ、動作1つ、カメラの動き1つ、スタイル1つ。残る課題は、生成ごとのばらつきを管理することです。

Grok動画とは

xAIの文章・画像から動画を作るモデルです。説明または静止画を入力すると、合成された動きを持つ短いクリップを返します。動画編集アプリでも素材ライブラリでもなく、2分の場面を作る道具でもありません。数秒の一瞬を作るショット生成ツールとして考えると、使える結果を得やすくなります。

同じ基盤機能はXなど複数の場所で使われています。違いは周囲の使い方です。GO AI Chatでは動画がフィードではなく写真ライブラリへ保存され、文章作成、調査、画像生成を行うアプリ内でそのまま利用できます。

Image Creator、Image Transformer、Video Generatorを表示するiPhone版GO AI ChatのLabタブ。
動画生成は画像ツールと並んでLabにあります。

プロンプトの型

うまくいった動きのプロンプトには、常に次の4要素があります。どれかが欠けるとAIが補い、多くの場合は意図とずれます。

組み合わせると、「黄色いレインコートを着た女性がネオンに照らされた雨の中をカメラへ歩く、ゆっくり寄る、35mm撮影、浅い被写界深度」となります。ショットリストのように読めますが、実際に1ショットの指示です。

長さ、画面比率、品質

3つの設定が重要で、料金にも影響します。長く高品質な動画ほどトークンを多く消費するため、常に最大へ設定せず、意図して選びましょう。

設定おすすめ理由
長さ通常は5~8秒。動きに必要な場合だけ15秒長いほど一貫性を失いやすい。まとまった6秒は、散漫な15秒より良い
画面比率Reels、TikTok、Shortsは9:16、横長は16:9公開する形で生成する。後の切り抜きは解像度を失い、意図せず構図を変える
品質プロンプト調整中は低品質、完成版だけ高品質多くの試行はプロンプト探索で使う。最初から最高品質にしない

過小評価されている画像から動画への変換

写真から始めると、最も難しい処理がなくなります。AIは物の見た目を作る必要がなく、動きだけを決めます。そのため、同じ発想を文章だけから動画にするより、一貫した結果になりやすいのです。

成功を左右するルールは、静止画から自然な動きが1つ想像できることです。髪がほどけた人物なら風、コーヒーなら湯気を想像できます。停車中の車には明確な動きがなく、AIが何かを作り出します。何を動かすか5語程度で言えないなら、別の写真を選びましょう。

本当に苦手なこと

機能一覧より、制限を具体的に知るほうが役立ちます。

生成を無駄にしない流れ

  1. 4要素のプロンプトを書き、読み返して2つ目の動詞を削ります。
  2. 低い品質と短い長さで一度生成します。
  3. 8割ほど正しければ、同じプロンプトで再生成します。ばらつきだけで直ることがあります。
  4. 具体的な問題があれば、プロンプトの1か所だけを変更します。3か所変えると原因が分かりません。
  5. ショットが正しくなったら、必要な品質と長さで再生成します。

ボタンの場所を含む全手順は、iPhone動画生成ガイドをご覧ください。動画以外でGrokとGPT-5を比較するなら、Grok 4とGPT-5の比較で解説しています。

よくある質問

Grokで生成できる動画の長さは?

最長15秒です。長いほど一貫性が失われるため、現在の動画モデルでは上限を設けています。

手持ちの写真をGrokで動かせますか?

はい。画像から動画への変換です。写真から自然に想像できる動きを1つ指定すると効果的です。

生成動画がプロンプトと違うのはなぜですか?

実行ごとのばらつきがあります。ほぼ正しければ同じ内容で再生成し、完全に違う場合は複数の内容を1度に求めていないか確認します。

Grok動画に専用アプリが必要ですか?

いいえ。GO AI Chatではチャット、画像、音声と同じアプリ内でGrok動画を使い、写真ライブラリへ保存できます。