Grok 视频生成:如何把提示词变成短片

TL;DR

Grok 的视频模型能把一句话——或一张照片——变成最长 15 秒的短片。在 GO AI Chat 里它就在 Lab 标签页,和图像生成放在一起,所以你不用为另一个应用付钱。真正管用的提示词套路很朴素也很可靠:一个主体、一个动作、一个运镜、一种风格。其余的都是在管理随机性。

Grok 视频到底是什么

它是 xAI 的文生视频与图生视频模型。你给它一段描述或一张静态图,它返回一段带有合成运动的短片。它不是剪辑器,不是素材库,也不是用来做两分钟场景的工具。把它当成镜头生成器——一个瞬间,几秒钟长——才是能产出可用结果的心智模型。

同一套底层能力在好几个地方驱动着视频生成,包括 X。不同的是周边环境:在 GO AI Chat 里,片子落进你的相册而不是信息流,而且你本来就在这个写作、查资料、生成图像的应用里。

iPhone 上 GO AI Chat 的 Lab 标签页,包含 Image Creator、Image Transformer 和 Video Generator。
视频生成就在 Lab 里,紧挨着图像工具。

提示词套路

凡是对我们奏效过的运动提示词,都由同样的四部分组成。少一个,模型就会替你编,而且通常编得不好。

拼起来:"一个穿黄色雨衣的女人在霓虹灯下的雨中朝镜头走来,缓慢推近,35mm 拍摄,浅景深。"它读起来像一份分镜表,因为它就是。

时长、画幅和画质

三个设置很关键,而且和成本相互牵扯——更长、更高画质的片子会消耗更多代币余额,所以值得有意识地选,而不是一律拉满。

设置怎么选为什么
时长多数情况 5–8 秒;只有动作确实需要时才用 15 秒片子越长越容易漂移。一个紧凑的 6 秒镜头胜过一个游移的 15 秒。
画幅比例Reels/TikTok/Shorts 用 9:16,横屏内容用 16:9用你要发布的画幅去生成——事后裁剪既丢分辨率,又替你重新构图,而且构得很差。
画质打磨提示词时用较低档;定稿时再调高生成次数主要花在探索提示词上。别用满画质去花。

图生视频:被低估的那条路

从一张照片出发,等于把这活儿最难的部分拿掉了——模型不再需要凭空想象东西长什么样,只需要想象它们怎么动。这就是为什么同一个创意下,图生视频的结果往往比文生视频连贯得多。

决定成败的规则是:这张静态图必须暗示一个合理的运动。散着头发的肖像暗示风。一杯咖啡暗示热气。一辆停着的车什么也不暗示,模型就会自己编。如果你没法用五个字说清什么该动,就换一张照片。

它真正不擅长的事

把限制说具体,比列一堆功能有用得多:

一套少浪费生成次数的工作流

  1. 写出四段式提示词。回头读一遍,把第二个动词删掉。
  2. 用较低画质和较短时长生成一次。
  3. 如果已经对了八成,原样再生成一次——光靠随机差异往往就能修好。
  4. 如果是在某个具体的地方错了,就只改提示词的其中一部分。一次改三处,你什么也学不到。
  5. 镜头对了之后,再用你真正想要的画质和时长重跑一次。

包含按钮在哪的完整分步版本,见 我们的 iPhone 视频操作指南。想知道 Grok 在视频之外的事情上与 GPT-5 相比如何,见 Grok 4 对比 GPT-5

常见问题

Grok 生成的视频最长多久?

最长 15 秒——时长选择器的上限。片子越长连贯性越差,所以当前的视频模型宁可设上限。

能让我已有的照片动起来吗?

可以——这就是图生视频。静态图本身暗示了一个合理运动时效果最好。

为什么结果和提示词不一样?

每次运行之间确实有随机差异。大体对了就先原样重生成一次;完全跑偏多半是一次要了好几件事。

需要单独的应用吗?

不需要。GO AI Chat 在同一个应用里跑 Grok 视频,成品直接存进相册。