第 2 部分 · 第 4 课,共 6 课

如何用首尾帧控制 AI 视频

给视频模型两张图片,一张首帧、一张尾帧,再加一段只描述两者之间动作的提示词。模型会从一张动画过渡到另一张,所以镜头从哪里开始、在哪里结束都由你决定。在 Sky Studio 里,先在图像标签页做好两帧,分别点击作为参考图,再到视频标签页用 MiniMax H3 或 Gemini Omni 1.1 Flash 生成。

控制 AI 视频的三种方式

  • 只用文字。只写提示词,其他什么都不加。场景什么样、怎么动、镜头往哪走,都由模型决定。最快,但可控性最低。
  • 首帧。加上开头的画面。视频会准确地从这张图开始,其余由模型自己发挥。
  • 首帧加尾帧。加上开头和结尾的画面。模型补出两者之间的动作,所以镜头在哪里结束也由你决定。
开始一段 AI 视频的三种方式:只用文字、首帧、首帧加尾帧
开始一段 AI 视频的三种方式。

第 1 步:生成首帧

在工作区的图像标签页选择一个图像模型(课程里用的是 Nano Banana 2),把宽高比设为 16:9,生成开场画面。然后把鼠标悬停在图片上,点击作为参考图,这样下一张图片就能保持同样的角色。

首帧提示词

A cinematic anime-style scene of two anthropomorphic animal friends standing at the entrance of a Japanese lantern festival at sunset. An orange tabby cat wearing a blue scarf stands beside a cream-colored dog wearing a red jacket. Warm golden light, colorful lanterns, gentle wind, detailed anime illustration, wide cinematic composition.

首帧:日落时分,一只戴蓝色围巾的橘色虎斑猫和一只穿红色夹克的奶油色狗站在灯笼节入口
首帧,用 Nano Banana 2 生成。

第 2 步:做一张相配的尾帧

把首帧作为参考图后,描述结尾的画面。告诉模型保持同样的角色和同样的风格,两张图片才会属于同一个镜头。

尾帧提示词

Use the attached image as the character and visual-style reference. Keep the same orange tabby cat wearing a blue scarf and the same cream-colored dog wearing a red jacket. Show them walking together across a traditional Japanese bridge at night, with glowing lanterns floating above the water and the festival lights in the background. Cinematic anime style, peaceful ending, wide composition.

AI 图片有时会搞错空间关系。这里提示词要求两个朋友走过桥,模型却把它们放到了桥下的水里。这很正常:重新生成,或者换一个模型试试。

生成的一张尾帧:猫和狗站在桥下的水里,而不是桥上
和提示词要求的不一样:猫和狗在水里,而不是在桥上。

为了节省时间,可以在 AI 模型里勾选两个模型,一次生成。下面两个结果都把角色放在了桥上,哪一张都可以当尾帧。

用 Nano Banana 2 生成的尾帧:夜晚,猫和狗在桥上
Nano Banana 2
用 GPT Image 2 生成的尾帧:猫和狗在一座木桥上,身后是一座宝塔
GPT Image 2

第 3 步:在视频标签页添加两帧

切换到视频标签页,模式保持为首尾帧。把鼠标悬停在每张图片上,点击作为参考图:先添加的图片是首帧,第二张是尾帧。

工作区里的一张图片,鼠标指针停在“作为参考图”按钮上
鼠标悬停在图片上,点击“作为参考图”
视频标签页,首帧和尾帧都在“参考图片”中
两帧都在视频标签页的参考图区域里

第 4 步:选择模型和设置

这两个模型都支持首帧和尾帧:

模型分辨率时长声音
MiniMax H3480p 或 768p5 到 15 秒没有声音开关
Gemini Omni 1.1 Flash360p、720p、1080p 或 4K(1080p 和 4K 由放大得到)3 到 10 秒始终开启

宽屏镜头用 16:9。先用低分辨率测试,确定要保留的版本后,再用更高的分辨率生成。

第 5 步:写视频提示词

描述动作,而不是画面:两帧已经展示了场景的样子。在结尾加上“No text, no subtitles, no watermark.”(不要文字、不要字幕、不要水印),这样模型就不会在视频里加上字幕或标志。

视频提示词

An orange tabby cat and a cream-colored dog walk from the lantern festival entrance toward the traditional bridge. The camera slowly tracks backward as they walk side by side. Lanterns sway gently, warm lights reflect on the water, and a light breeze moves their scarves and clothing. Smooth cinematic anime motion, consistent characters, and a natural transition from the First Frame to the Last Frame. No text, no subtitles, no watermark.

尾帧是可选的。只有首帧时,由模型决定镜头怎么结束。结尾很重要时,再加上尾帧。

调整对白和声音

  • 角色说错了语言?在视频提示词末尾加上这句:“They speak in English.”
  • 想让角色不说话?加上:“The characters keep their mouths closed and do not speak.”
  • 完全不要声音?MiniMax H3 和 Gemini Omni 1.1 Flash 都没有声音开关,请在剪辑软件里把视频静音。
提示词讲义(PDF)本课用到的提示词和设置。
下载

常见问题

一定要有尾帧吗?

不用。只有首帧就够了,镜头怎么结束由模型决定。想自己决定最后的画面时,再加上尾帧。

Sky Studio 里哪些模型支持首帧和尾帧?

MiniMax H3 和 Gemini Omni 1.1 Flash 都支持。视频中出现的 Seedance 1.5 Pro 已经下线。

为什么角色出现在了错误的位置?

图像模型有时会误解物体的位置,比如把角色放进水里,而不是桥上。可以重新生成、把场景写得简单一些,或者同时用两个模型对比。

怎样让两帧里的角色保持一致?

生成尾帧时把首帧作为参考图,并在提示词里写明保持同样的角色和风格。要在很多镜头里使用同一个角色,请看第 6 课。

文字稿

0:00 · 控制 AI 视频的三种方式

欢迎回来。这节课我们来看看控制 AI 生成视频的几种方法。第一种,只输入文字提示词。这会给 AI 更多创作自由,去想象场景、动作和镜头方向。第二种,上传首帧。它决定视频怎么开始,其余部分由 AI 生成。第三种,同时上传首帧和尾帧。这样你能更好地控制从开头到结尾的过渡。这个例子我们用一个动漫风格的场景,对比首帧和尾帧的工作流程。

0:39 · 生成首帧

先从首帧的流程开始。首先,我在“图像”工作区生成首帧图片。把这些文字粘贴到提示词框里。首帧提示词:电影感的动漫风格场景,两个拟人化的动物朋友在日落时分站在日本灯笼节的入口。一只戴着蓝色围巾的橘色虎斑猫,站在一只穿红色夹克的奶油色狗狗旁边。温暖的金色光线、五彩灯笼、微风、精细的动漫插画,电影感的宽幅构图。

1:13 · 做一张相配的尾帧

这张图就是视频的起点。接下来用它作为参考图,生成尾帧。点击“作为参考图”按钮,把首帧图片添加到左上角的参考图区域。然后把尾帧提示词粘贴到提示词框。尾帧提示词:用附带的图片作为角色和画风参考。保持同一只戴着蓝色围巾的橘色虎斑猫,和同一只穿红色夹克的奶油色狗。画面是它们在夜里一起走过一座传统的日式桥,水面上漂着发光的灯笼,背景是节日的灯光,电影感动漫风格,平静的结尾,宽幅构图。

1:57 · 当 AI 把角色放错位置时

按照提示词,猫和狗应该站在桥上。但在这张生成的图里,它们却站在桥下的水里。没关系。AI 生成图像有时会误解角色和环境之间的空间关系。这是正常现象,不用担心。可以重新生成图片再试一次。如果结果还是不满意,也可以考虑换一个模型。比如从 Nano Banana 2 换成 GPT Image 2,或其他可用的模型,看看效果会不会更好。

2:37 · 同时对比两个模型

这次我决定同时选两个模型一起生成图片,对比结果,看看哪个表现更好。在“AI 模型”区域,勾选两个模型就能同时运行。我点击左下角的“生成”按钮,再生成一次图片。两个模型的结果都出来了,效果都很好。这次两张尾帧图都把猫和狗正确地放在了桥上,完全符合预期。两张都可以,选喜欢的那张作为尾帧就行。

3:15 · 添加两帧并选择设置

现在把首帧和尾帧图片都放到参考区。方法是把鼠标移到每张图的左下角,点击“作为参考图”。第一张图会作为首帧,第二张会作为尾帧。“宽高比”保持 16:9,“分辨率”设为 480p。想要更高画质,可以选 1080p。视频“时长”设为 8 秒。

3:51 · 写视频提示词

现在把下面的提示词粘贴到提示词区域。视频提示词:一只橘色虎斑猫和一只奶油色的狗从灯笼节入口走向传统的桥。它们并肩前行时,镜头缓缓后移。灯笼轻轻摇曳,暖光倒映在水面上,微风吹动它们的围巾和衣服。流畅的电影感动漫动作,角色保持一致,从首帧自然过渡到尾帧。不要文字、不要字幕、不要水印。首帧决定开头,视频提示词描述动作。尾帧是可选的。你可以只用首帧,让 AI 自动生成结尾。想更好地控制最终构图和过渡时,再加上尾帧。

4:50 · 生成并观看结果

点击“生成”生成视频,看看效果。好了,我们来播放视频。看那边的灯好美啊。嗯,我们快过去看看吧。

5:09 · 调整对白语言

视频里的角色说的是中文,但我们既没有设置,也没有写任何中文提示词。因为 Seedance 是字节跳动开发的,有时会默认生成中文对白。想让角色说英语,只要在视频提示词末尾加上这句话:“They speak in English.”我们再生成一次视频,看看效果。看水面上,好多灯笼!是啊,真美。很好,这次角色说的是英语。

5:47 · 让角色不说话

如果不想让角色说话,就在提示词里加上这句话:“The characters keep their mouths closed and do not speak.”如果完全不要声音,生成视频前关掉“音频”就行。最后,我们也在准备加入更多视频模型,敬请期待后续更新。