セクション2 · レッスン4/全6回
最初と最後のフレームでAI動画をコントロールする方法
動画モデルに最初のフレームと最後のフレームの2枚の画像を渡し、その間の動きだけをプロンプトに書きます。モデルが一方からもう一方へアニメーションさせるので、カットの始まりと終わりを自分で決められます。Sky Studioでは、「画像生成」タブで2枚のフレームを作ってそれぞれ参照として追加をクリックし、「動画生成」タブでMiniMax H3またはGemini Omni 1.1 Flashを使って生成します。
AI動画をコントロールする3つの方法
- テキストだけ:プロンプトだけを書きます。シーンの見た目、動き方、カメラワークはモデルが決めます。いちばん手早い方法ですが、コントロールできる範囲はいちばん狭くなります。
- 最初のフレーム:最初の画像を追加します。動画はその画像からそのまま始まり、その先はモデルが考えます。
- 最初と最後のフレーム:最初と最後の画像を追加します。その間の動きをモデルが埋めるので、カットの終わりも自分で決められます。

ステップ1:最初のフレームを生成する
ワークスペースの画像生成タブで画像モデルを選び(レッスンではNano Banana 2)、アスペクト比を16:9にして、最初の画像を生成します。次に画像にカーソルを合わせて参照として追加をクリックすると、次の画像でも同じキャラクターが保たれます。
A cinematic anime-style scene of two anthropomorphic animal friends standing at the entrance of a Japanese lantern festival at sunset. An orange tabby cat wearing a blue scarf stands beside a cream-colored dog wearing a red jacket. Warm golden light, colorful lanterns, gentle wind, detailed anime illustration, wide cinematic composition.

ステップ2:それに合う最後のフレームを作る
最初のフレームを参照として追加した状態で、結末を書きます。同じキャラクターと同じ画風を保つようにモデルに伝えることで、2枚の画像が1つのカットとしてつながります。
Use the attached image as the character and visual-style reference. Keep the same orange tabby cat wearing a blue scarf and the same cream-colored dog wearing a red jacket. Show them walking together across a traditional Japanese bridge at night, with glowing lanterns floating above the water and the festival lights in the background. Cinematic anime style, peaceful ending, wide composition.
AI画像は、空間の位置関係を間違えることがあります。ここではプロンプトで橋を渡るよう指示したのに、モデルは2匹を橋の下の水の中に置きました。これはよくあることなので、もう一度生成するか、別のモデルを試しましょう。

時間を節約するなら、「AI モデル」欄で2つのモデルにチェックを入れて、一度に生成しましょう。下の2枚はどちらもキャラクターが橋の上にいるので、どちらを最後のフレームにしてもかまいません。


ステップ3:「動画生成」タブに2枚のフレームを追加する
動画生成タブに切り替え、モードはフレームのままにします。それぞれの画像にカーソルを合わせて参照として追加をクリックします。1枚目に追加した画像が最初のフレーム、2枚目が最後のフレームになります。


ステップ4:モデルと設定を選ぶ
どちらのモデルも、最初と最後のフレームに対応しています。
| モデル | 解像度 | 長さ | 音声 |
|---|---|---|---|
| MiniMax H3 | 480pまたは768p | 5〜15秒 | 音声のスイッチなし |
| Gemini Omni 1.1 Flash | 360p、720p、1080p、4K(1080pと4Kはアップスケール) | 3〜10秒 | 常にオン |
横長の映像には16:9を使います。まず低い解像度で試し、残したいものを高い解像度で作り直しましょう。
ステップ5:動画のプロンプトを書く
画像ではなく動きを書きます。シーンの見た目は2枚のフレームがすでに示しているからです。最後に「No text, no subtitles, no watermark.」と付けると、モデルが字幕やロゴを映像に入れなくなります。
An orange tabby cat and a cream-colored dog walk from the lantern festival entrance toward the traditional bridge. The camera slowly tracks backward as they walk side by side. Lanterns sway gently, warm lights reflect on the water, and a light breeze moves their scarves and clothing. Smooth cinematic anime motion, consistent characters, and a natural transition from the First Frame to the Last Frame. No text, no subtitles, no watermark.
最後のフレームは任意です。最初のフレームだけなら、カットの終わり方はモデルが決めます。結末が大事なときは最後のフレームを追加しましょう。
セリフと音を直す
- キャラクターが違う言語で話すときは、動画のプロンプトの最後に「They speak in English.」と加えます。
- 話させたくないときは、「The characters keep their mouths closed and do not speak.」と加えます。
- 音をまったく入れたくないときは、MiniMax H3にもGemini Omni 1.1 Flashにも音声のスイッチがないので、編集ソフトで音を消してください。
よくある質問
最後のフレームは必要ですか?
いいえ。最初のフレームだけでも十分で、カットの終わり方はモデルが決めます。最後の画像を自分で決めたいときに、最後のフレームを追加します。
Sky Studioで最初と最後のフレームを使えるモデルはどれですか?
MiniMax H3とGemini Omni 1.1 Flashの両方で使えます。動画に出てくるSeedance 1.5 Proは提供を終了しました。
キャラクターが違う場所にいるのはなぜですか?
画像モデルは、キャラクターを橋の上ではなく水の中に置くなど、位置関係を読み違えることがあります。もう一度生成する、シーンを簡単にする、2つのモデルを同時に比べる、のいずれかを試してください。
2枚のフレームで同じキャラクターを保つにはどうすればよいですか?
最初のフレームを参照として追加した状態で最後のフレームを作り、プロンプトで同じキャラクターと画風を保つよう伝えます。多くのカットで使うキャラクターはレッスン6を参考にしてください。
文字起こし
0:00 · AI動画をコントロールする3つの方法
おかえりなさい。このレッスンでは、AI で生成する動画をコントロールするさまざまな方法を紹介します。1つ目は、テキストのプロンプトだけを入力する方法です。AI に自由度が生まれ、シーンや動き、カメラワークを自由に想像できます。2つ目は、最初のフレームをアップロードする方法です。動画の始まりを決め、残りは AI が作ります。3つ目は、最初と最後のフレームを両方アップロードする方法です。始まりから終わりまでの流れを、よりコントロールできます。今回はアニメ風のシーンを使って、最初と最後のフレームを使う方法を比べます。
0:39 · 最初のフレームを生成する
まずは最初のフレームから始めましょう。まず「画像生成」で、最初のフレームの画像を作ります。このテキストをプロンプト欄に貼り付けます。最初のフレームのプロンプト:映画のようなアニメ風のシーン。擬人化された2匹の動物の友だちが夕暮れの日本の提灯祭りの入り口に立っています。青いマフラーを巻いた茶トラの猫が、赤いジャケットを着たクリーム色の犬の隣に立っています。暖かな金色の光、色とりどりの提灯、そよ風、細密なアニメイラスト、映画的なワイド構図。
1:13 · それに合う最後のフレームを作る
この画像が動画の始まりになります。次に、これを参照画像にして最後のフレームを作ります。「参照として追加」ボタンをクリックして、最初のフレームの画像を左上の参照画像エリアに追加します。次に、最後のフレームのプロンプトを貼り付けます。最後のフレームのプロンプト:添付画像をキャラクターと画風の参照にし、青いマフラーの同じ茶トラ猫と赤いジャケットの同じクリーム色の犬をそのまま使うこと。夜の伝統的な日本の橋を一緒に渡っていて、水面に灯籠が浮かび、背景には祭りの灯り。映画のようなアニメ風、穏やかな結末、ワイドな構図。
1:57 · AIがキャラクターの位置を間違えたとき
プロンプトでは、猫と犬は橋の上に立っているはずです。ところが生成された画像では、橋の下の水の中に立っています。大丈夫です。AI の画像生成では、キャラクターと環境の位置関係を誤解することがあります。これはよくあることなので、心配はいりません。画像を再生成して、もう一度試せます。それでも満足できない場合は、別のモデルに切り替えるのも手です。例えば Nano Banana 2 から GPT Image 2、あるいは別のモデルで、より良い結果が出るか試します。
2:37 · 2つのモデルを同時に比べる
今回は2つのモデルを同時に選んで画像を生成し、結果を比べて、どちらが良いか見てみます。「AI モデル」欄で2つのモデルにチェックを入れれば、同時に実行できます。左下の「魔法をかける」ボタンをクリックして、もう一度画像を生成します。両方のモデルの結果ができました。どちらも良い出来です。今回はどちらの最後のフレームも、猫と犬がちゃんと橋の上にいて、狙いどおりです。どちらも使えるので、好きな方を最後のフレームにします。
3:15 · 2枚のフレームを追加して設定を選ぶ
では、最初と最後のフレームの画像を両方、参照エリアに入れます。それぞれの画像の左下にカーソルを合わせて、「参照として追加」をクリックします。1枚目が最初のフレームに、2枚目が最後のフレームになります。「アスペクト比」は16:9のまま、「解像度」は480p にします。画質を上げたい場合は 1080p を選べます。動画の「長さ」も8秒に設定します。
3:51 · 動画のプロンプトを書く
次のプロンプトをプロンプト欄に貼り付けます。動画のプロンプト:茶トラの猫とクリーム色の犬が提灯祭りの入り口から伝統的な橋へ歩いていく。2匹が並んで歩くのに合わせ、カメラはゆっくり後退する。提灯がやさしく揺れ、温かな光が水面に映り、そよ風がマフラーや服を揺らす。なめらかで映画的なアニメの動き、一貫したキャラクター、最初から最後のフレームまで自然につながること。文字なし、字幕なし、透かしなし。最初のフレームが始まりを決め、動画のプロンプトが動きを表します。最後のフレームは任意です。最初のフレームだけにして、終わりは AI に任せることもできます。最後の構図やつながりをしっかり決めたいときは、最後のフレームを追加しましょう。
4:50 · 生成して結果を見る
「魔法をかける」をクリックして動画を生成し、結果を見てみましょう。できました。再生してみましょう。(中国語)見て、あそこの灯り、すごくきれい!(中国語)うん、早く見に行こう。
5:09 · セリフの言語を直す
動画のキャラクターが中国語を話しています。そう設定しておらず、中国語のプロンプトも入れていないのにです。Seedance は ByteDance が開発したモデルなので、セリフが中国語になることがあります。英語で話させたいときは、動画のプロンプトの最後に「They speak in English.」という一文を加えるだけです。もう一度動画を生成して、どうなるか見てみましょう。水面を見て、灯籠がたくさん!うん、きれいだね。いいですね。今回は英語で話しています。
5:47 · キャラクターを話させない
キャラクターに話させたくない場合は、プロンプトにこの一文を加えます。「The characters keep their mouths closed and do not speak.」音をまったく入れたくない場合は、生成前に「音声」をオフにします。最後に、今後さらに動画モデルを追加する予定なので、今後のアップデートをお楽しみに。
