Grok 视频生成:如何把提示词变成短片
Grok 的视频模型能把一句话——或一张照片——变成最长 15 秒的短片。在 GO AI Chat 里它就在 Lab 标签页,和图像生成放在一起,所以你不用为另一个应用付钱。真正管用的提示词套路很朴素也很可靠:一个主体、一个动作、一个运镜、一种风格。其余的都是在管理随机性。
Grok 视频到底是什么
它是 xAI 的文生视频与图生视频模型。你给它一段描述或一张静态图,它返回一段带有合成运动的短片。它不是剪辑器,不是素材库,也不是用来做两分钟场景的工具。把它当成镜头生成器——一个瞬间,几秒钟长——才是能产出可用结果的心智模型。
同一套底层能力在好几个地方驱动着视频生成,包括 X。不同的是周边环境:在 GO AI Chat 里,片子落进你的相册而不是信息流,而且你本来就在这个写作、查资料、生成图像的应用里。
提示词套路
凡是对我们奏效过的运动提示词,都由同样的四部分组成。少一个,模型就会替你编,而且通常编得不好。
- 主体——具体是谁或什么。"一个穿黄色雨衣的女人",不是"一个人"。
- 动作——一件正在发生的事。"朝镜头走来。"不是"走过来,然后转身,然后挥手"。
- 镜头——你不说,模型也会动镜头,所以不如你来说。"缓慢推近。""固定广角。""手持跟拍。"
- 风格——"35mm 拍摄,浅景深"、"动画赛璐璐上色"、"颗粒感纪录片"。
拼起来:"一个穿黄色雨衣的女人在霓虹灯下的雨中朝镜头走来,缓慢推近,35mm 拍摄,浅景深。"它读起来像一份分镜表,因为它就是。
时长、画幅和画质
三个设置很关键,而且和成本相互牵扯——更长、更高画质的片子会消耗更多代币余额,所以值得有意识地选,而不是一律拉满。
| 设置 | 怎么选 | 为什么 |
|---|---|---|
| 时长 | 多数情况 5–8 秒;只有动作确实需要时才用 15 秒 | 片子越长越容易漂移。一个紧凑的 6 秒镜头胜过一个游移的 15 秒。 |
| 画幅比例 | Reels/TikTok/Shorts 用 9:16,横屏内容用 16:9 | 用你要发布的画幅去生成——事后裁剪既丢分辨率,又替你重新构图,而且构得很差。 |
| 画质 | 打磨提示词时用较低档;定稿时再调高 | 生成次数主要花在探索提示词上。别用满画质去花。 |
图生视频:被低估的那条路
从一张照片出发,等于把这活儿最难的部分拿掉了——模型不再需要凭空想象东西长什么样,只需要想象它们怎么动。这就是为什么同一个创意下,图生视频的结果往往比文生视频连贯得多。
决定成败的规则是:这张静态图必须暗示一个合理的运动。散着头发的肖像暗示风。一杯咖啡暗示热气。一辆停着的车什么也不暗示,模型就会自己编。如果你没法用五个字说清什么该动,就换一张照片。
它真正不擅长的事
把限制说具体,比列一堆功能有用得多:
- 画面里的文字。招牌、标志和字幕回来时都是看着挺像那么回事的乱码。文字请事后在剪辑器里加。
- 做精细动作的手。打字、演奏乐器、摆弄小物件——仍然是经典的翻车点。
- 跨片段的角色一致性。两次生成的"同一个"人不会长得一样。要么设计不需要连贯性的镜头,要么两段都用同一张静态图做图生视频。
- 数数。"三只狗"经常给你两只或四只。如果数量没有画面重要,就说"一只狗"。
一套少浪费生成次数的工作流
- 写出四段式提示词。回头读一遍,把第二个动词删掉。
- 用较低画质和较短时长生成一次。
- 如果已经对了八成,原样再生成一次——光靠随机差异往往就能修好。
- 如果是在某个具体的地方错了,就只改提示词的其中一部分。一次改三处,你什么也学不到。
- 镜头对了之后,再用你真正想要的画质和时长重跑一次。
包含按钮在哪的完整分步版本,见 我们的 iPhone 视频操作指南。想知道 Grok 在视频之外的事情上与 GPT-5 相比如何,见 Grok 4 对比 GPT-5。
常见问题
Grok 生成的视频最长多久?
最长 15 秒——时长选择器的上限。片子越长连贯性越差,所以当前的视频模型宁可设上限。
能让我已有的照片动起来吗?
可以——这就是图生视频。静态图本身暗示了一个合理运动时效果最好。
为什么结果和提示词不一样?
每次运行之间确实有随机差异。大体对了就先原样重生成一次;完全跑偏多半是一次要了好几件事。
需要单独的应用吗?
不需要。GO AI Chat 在同一个应用里跑 Grok 视频,成品直接存进相册。