AI動画 プロンプトの書き方:本当に効果があるフォーミュラ(実例付き)
AI動画プロンプトは、モデルに何を生成するかを伝える文章です。正しい構成なら、Veo 3.1 Fastのようなモデルは一文で使えるクリップを作ります。ここでは公式と語彙、そのまま使える4つの実例を紹介します。

執筆 Vincent Park
公開日

AI動画プロンプトとは、被写体・アクション・カメラ・ライト・尺(長さ)を書き表し、テキストto動画または画像to動画モデルに何を生成すべきか正確に伝える指示文です。正しい公式で書けば、Veo 3.1 FastやKling 3 Proのようなモデルは一文で一発から使えるクリップを生成します。曖昧に書けばモデルは推測するしかなく、誰も使えない結果に生成回数を浪費することになります。このガイドでは、うまくいくプロンプトの構成、ショットを実際に変えるカメラとライトの語彙、そしてVIBEの4つのモデル向けにそのまま使える実例を解説します。
一言で言うと
AI動画プロンプトとは、誰が(何が)画面に映るか、何をするか、カメラがどう動くか、シーンがどう照明されているかを書き表した構造化されたテキスト指示であり、動画生成モデルが一度の生成で一貫した使えるクリップを作れるように書かれたものです。
AI動画 プロンプトとは?
書かれたプロンプトは、テキストto動画・画像to動画モデルが与えてくれる唯一のハンドルです。画像プロンプトと違い、AI動画プロンプトは時間の経過に伴う変化——何が動くか、カメラがどう動くか、ショットの長さ——を描写しなければならず、単一フレームの見た目だけでは足りません。画像to動画プロンプトはさらに短く済みます。写真がすでに被写体と設定を固定しているため、プロンプトは追加したいアクションとカメラの動きを描写するだけで十分です。VIBEのプレミアムモデル(Veo 3.1 Fast、Kling 3 Pro、Sora 2 Pro)と無料モデル(Seedance Pro Fast、Wan 2.6、PixVerse)はすべて同じ基本構成を読み取りますが、重み付けは異なります——カメラの言葉づかいに強く依存するモデルもあれば、主にアクション動詞から動きを推測するモデルもあります。モデルの選び方はAI動画生成アプリの完全ガイドで解説しています。このガイドでは、モデルを選んだ後に何を入力すべきかを解説します。

優れたAI動画プロンプトの構成
動画モデルとの接触を生き延びるプロンプトはすべて、おおよそこの順番で同じ5つの要素に分解できます。1つでも省略すると、モデルはその隙間を自分で埋めます——たいていは無難で一般的な内容で。
- 被写体 — 画面に映る人物や物を、キャスティング担当者のように描写します:年齢、服装、表情、一つの際立った特徴。
- アクション — 1ショットにつき明確な動詞句を一つ。「カメラに向かって歩き、振り返って微笑む」は機能しますが、「いろいろかっこいいことをする」は機能しません。
- カメラ — ショットの種類とあらゆる動き:広いestablishing shot、ミディアムクローズアップ、ゆっくりしたドリーイン、ハンドヘルドのトラッキングショット。
- ライトと色 — 光の質(柔らかい窓明かり、厳しい真昼の日差し、ネオンサイン)に加え、2〜3色のパレットの基準(琥珀色、ティール、温かみのある茶色)。
- 尺とスタイル — クリップが何秒続くか、そして映像のトーン:シネマティック、ドキュメンタリー、アニメ、プロダクト撮影。
“広いestablishing shot、目線の高さ:黄色いレインコートを着た女性が夕暮れ時、雨に濡れた都会の横断歩道を足早に渡り、水たまりにネオンサインが反射している。彼女は顔を上げて微笑む。柔らかい青とアンバーの光、8秒、シネマティック。”
ショットを変えるカメラとライトの言葉
失敗するプロンプトのほとんどは、アイデアの問題ではなく語彙の問題です——コンセプト自体は良くても、それを描写する言葉が曖昧すぎて機能しなかったのです。以下は確実に効果を発揮する用語です:
- 広いestablishing shot — 寄る前にシーンを設定し、偶然ではなく意図的なフレーミングとして読み取られます。
- ミディアムクローズアップ、後方からのわずかな角度 — 正面からの視線を避けて人物を自然に紹介する方法です。
- ゆっくりしたドリーイン / プッシュイン — 被写体を全く動かさずに緊張感を高めます。
- ハンドヘルドのトラッキングショット — ドキュメンタリーやUGCスタイルに見える、人間らしい小さな揺れを加えます。
- ゴールデンアワーのリムライト — 被写体の周りに暖かい縁取り、背景は暗め。ほぼどのモデルでも高級感が出ます。
- 暖かいランプの補助光を伴う柔らかい窓明かり、廊下からの冷たいリムライト — 光源を1つではなく2つ重ねることが、平坦なクリップと照明の効いたクリップの違いを生みます。

“カウンターの奥でミルクをスチームするバリスタへのゆっくりしたドリーイン、暖かいランプの補助光、背後の通りに面した窓からの冷たい青い光、湯気が光を捉える。彼女は顔を上げ、カメラに向かって少し微笑む。12秒、ハンドヘルドの微細な揺れ。”
AI動画ツールはどのようにプロンプトをクリップに変えるのか?
2026年9月時点で、Veo 3.1 Fast、Kling 3 Pro、Sora 2 Pro、そしてオープンなWanやSeedanceファミリーを含む主要な一般消費者向け動画モデルはすべて、2022年のGoogle Researchの論文Video Diffusion Modelsで初めて説明された技術である、数百万の動画とキャプションのペアで学習された拡散モデルです。モデルはノイズから出発し、あなたのテキストが描写する内容に向かって1フレームずつノイズを除去していきます。プロンプトは、モデルにとって「正しい」がどのようなものかを知る唯一の手がかりです。だからこそ、「素晴らしい」「高品質」といった形容詞よりも、具体的な名詞と動詞の方が効果的なのです——そうした言葉では、モデルがノイズ除去の目標にできる視覚的な手がかりが何もありません。
- ショットに合わせてモデルを選びましょう:ネイティブ音声とカメラの動きにはVeo 3.1 FastとKling 3 Pro、より長いシネマティックなテイクにはSora 2 Pro、プレミアムクレジットを使う前にプロンプトを無料でテストするにはSeedance Pro FastまたはWan 2.6。
- 上記の被写体–アクション–カメラ–ライト–尺の公式に沿って、その順番でプロンプトを書きます。
- 生成したら、通常速度と1フレームずつの両方で結果を確認しましょう——連続性の問題の多くはスローモーションでしか見えません。
- 一度に1つの変数だけを変えましょう。動きが間違っていればアクションの句を、雰囲気が間違っていればライトを編集します。すべてを一度に変えると、何がショットを直したのか分からなくなります。
- 投稿する前に、プラットフォームが想定するアスペクト比で書き出しましょう——TikTokとReelsは9:16、YouTubeは16:9です。
Veo 3.1 Fast対Kling 3 Pro対Sora 2 Pro:それぞれ何を書くべきか
5つの要素からなる公式自体は変わりませんが、モデルごとにやや異なる重点が報われます。各モデルの強みに合わせて書いたとき、VIBEの動画モデルがどう比較されるかは次のとおりです:
| モデル | 最も向いている用途 | VIBEでの最大長 | ネイティブ音声 | 画像to動画 |
|---|---|---|---|---|
| Veo 3.1 Fast | 音声主導の短いシーン——会話や環境音 | 8秒 | あり | なし |
| Kling 3 Pro | 意図的なカメラの動きを伴う長めのテイク | 15秒 | あり | あり |
| Sora 2 Pro | より長いショットにわたるシネマティックな連続性 | 12秒 | なし | なし |
| Seedance Pro Fast | アップグレード前にプロンプトを素早く無料で反復 | 8秒 | なし | あり |
OpenAI自身のSora 2プロンプティングガイドは、シーンの描写・カメラの指示・アクションを1つの長い行ではなく別々の文に分けることを推奨しており、Google DeepMindのVeoモデルページも同じパターンを示しています——具体的で平易な描写は、どちらのモデルでも形容詞の羅列に勝ります。同じ構成は、VIBE内のKling 3 ProとSora 2 Proでも機能します。
“静止した広いショット、ゴールデンアワー:無人の都会の屋上に、風にそっと揺れるストリングライト、背景にはソフトフォーカスのスカイライン。最後の2秒で紙のランタンがフレームを横切っていく。セリフなし、風の環境音のみ。12秒、フィルムグレイン、暖かいアンバーのパレット。”
AI動画プロンプトのよくある間違い
無駄になる生成のほとんどは、同じ一握りの間違いが原因です:
- 具体性の代わりに形容詞を積み重ねる。「美しくて、すごくて、素晴らしい動画」は、モデルにノイズ除去の目標を何も与えません——形容詞はすべて目に見える具体的な詳細に置き換えましょう。
- 1つの節に2つのアクション。「走って、跳んで、それから手を振る」は1テイクに3つのショットを求めています。クリップが実際に時間を割ける1つのアクションを選びましょう。
- カメラの指示がない。カメラを指定しないと、多くのモデルは標準で静止したミディアムショットになります——それでよいこともありますが、コントロールを手放していることになります。
- 尺とアクションが矛盾している。8秒のショットに会話全体は収まりません。生成する秒数にアクションを合わせましょう。
- 結果がほぼ良いときに一度に5つも変えてしまう。そうするとどの変更がショットを改善したのか、あるいは壊したのか分からなくなり、反復ではなく当てずっぽうになってしまいます。

どのモデルから無料で始めるべきか?
この公式を学ぶのにプレミアムクレジットは必要ありません。Seedance Pro Fast、Wan 2.6、PixVerseはVIBEで無料、ログイン不要で使え、プレミアムモデルと同じ被写体–アクション–カメラ–ライトの構成を読み取ります——つまり、Veo 3.1 FastやKling 3 Proのクレジットを使う前に、素早く失敗して自分の言い回しが実際に何をもたらすかを学ぶのに、最もコストがかからない場所です。各モデルのクレジットコストとティアは、VIBEのモデル一覧に記載されています。無料と有料の違いをさらに詳しく知りたい場合はAI動画生成アプリの完全ガイドをご覧ください。次にスタイル特化の語彙——アニメの線画、セルシェーディング、シネマティックなカラーグレーディング——が知りたい場合は、AIアニメ動画ジェネレーターのガイドをご覧ください。
“ミディアムショット、目線の高さ:ゴールデンレトリバーの子犬が、日当たりの良い裏庭の芝生で転がるテニスボールを追いかけ、耳がなびいている。明るい真昼の太陽、浅い被写界深度、6秒。”

よくある質問
AI動画 プロンプトに最適な公式は何ですか?
被写体、アクション、カメラ、ライト、尺をこの順番で書きます:画面に映る人物や物、それが行う一つのこと、カメラのフレーミングや動き、シーンの照明、そしてクリップが何秒続くべきかを描写します。この構成はVIBEのプレミアムモデルにも無料モデルにも通用します。
AI動画プロンプトはどのくらいの長さにすべきですか?
通常は1〜3文で十分です。段落全体を使うようなプロンプトは、8〜15秒のクリップでモデルが実際に実行できる1つのアクションと1つのカメラの動きを埋もれさせてしまいがちです。各文を、シーン全体の描写ではなく、目に見える1つの指示にとどめましょう。
Veo 3.1 Fast、Kling 3 Pro、Sora 2 Proでは異なるプロンプトが必要ですか?
同じ被写体-アクション-カメラ-ライトの構成が3つとも通用しますが、それぞれのモデルの強みに合わせて重点を変えましょう。Veo 3.1 FastとKling 3 ProはVIBEでネイティブ音声を生成するので音の手がかりを、音声を生成しないSora 2 Proではカメラとライトの詳細を重視します。
AI動画プロンプトを無料で書くことはできますか?
はい。Seedance Pro Fast、Wan 2.6、PixVerseはVIBEでログイン不要かつ無料で使え、プレミアムモデルと同じ被写体-アクション-カメラ-ライトの公式を読み取ります。そのため、Veo 3.1 Fast、Kling 3 Pro、Sora 2 Proにプレミアムクレジットを使う前に、自分の言い回しが何をもたらすかを学べます。
なぜAI動画ジェネレーターはプロンプトの一部を無視するのですか?
多くの場合、プロンプトがクリップの尺で許容できる以上のことを求めているか、1つの文に2つのアクションを詰め込んでいるためです。生成する秒数に合わせて1つのアクションに絞り、ある詳細が何度も欠落する場合は、より重みを持たせるために文の前の方に移動させましょう。
AI動画プロンプトで実際に効果があるカメラの言葉は何ですか?
具体的なショットの種類と動きです:広いestablishing shot、ミディアムクローズアップ、ゆっくりしたドリーイン、ハンドヘルドのトラッキングショット。「シネマティックなカメラワーク」のような曖昧な指示は、モデルにレンダリングしてほしい実際のショットと動きを名指しするよりも、はるかに信頼性が低くなります。
今日から AI動画 を作り始めよう
iOSとAndroidでVIBEを無料ダウンロード。ログイン不要。10種類以上のAI動画モデルにアクセスし、テキストプロンプトや画像から動画を生成できます。

