テキストから動画 AI:文章から動画を作る仕組みとコピーして使える4つのプロンプト
シーンを書くだけで短い動画が完成。テキストから動画を作る仕組み、5要素のプロンプト公式、用途別のVIBEモデルの選び方を解説します。

執筆 Vincent Park
公開日

テキストから動画 AIは、書いた説明文を短い動画クリップに変えてくれます。シーンの内容を入力するとモデルがフレームを生成し、数分後にはダウンロードできます。このガイドでは、テキストから動画が作れる仕組み、安定した結果を出す5要素のプロンプト公式、そして目的別に選ぶべきVIBEのモデルを、無料・登録不要で始める方法とともに解説します。
ひとことで言うと
テキストから動画 AIとは、シーンの説明文を読み取り、それに合う映像フレームの連なりを予測して生成するアプリで、必要に応じて音も付けられます。カメラも素材も編集スキルも必要ありません。
テキストから動画 AIとは?
生成AI動画のうち、文章から映像を作る方式です。シーンを撮影したりクリップを編集したりする代わりに、普段の言葉でシーンを説明すると、学習済みのモデルがまったく新しいクリップを作ります。テキストから動画モデルの概要が示す基本の考え方は、モデルが大量の例から言葉と動く映像の関係を学び、見たことのないプロンプトにも合う新しい映像を生成する、というものです。
2026年10月時点で、素材がなくてもTikTok、リール、YouTubeショート向けの短いクリップを作る最速の方法がテキストから動画です。VIBEならiOS、Android、Webで使え、無料モデルはログイン不要です。このカテゴリが初めてなら、まずAI動画生成アプリの完全ガイドをご覧ください。
主な用途は、SNS向けクリップ、広告のコンセプト、商品ティザー、絵コンテ、音楽のビジュアル、物語のシーンなどです。撮影素材が要らないので、一人でも午後のうちに10個のアイデアを試し、いちばん良いものだけを残せます。

テキストから動画のAIは実際どう動くのか?
現在の動画モデルの多くは、映像のノイズから出発し、説明に合って滑らかにつながるフレームになるまで少しずつ整えていきます。数式まで理解する必要はありませんが、プロンプトを書くうえで大切な帰結があります。モデルはあなたが伝えたことしか知りません。省いた細部はモデルが勝手に補い、それも最も平均的な形になります。最新モデルの実力は、Google DeepMindのVeoのページで確認できます。プロンプトの一語一語が結果を引っ張り、モデルは次の5つを読み取ろうとします。
- 被写体: 誰または何が映るか。たとえばキツネ、バリスタ、赤いスポーツカー。
- 動作: 被写体が何をするか。歩く、注ぐ、振り向くのように動詞を一つに絞ります。
- 場所と時間: どこで、いつか。たとえば日の出の霧の港、夜のネオンの路地。
- カメラ: 構図と動き。たとえばクローズアップ、ゆっくり寄る、追従ショット。
- 光とスタイル: 雰囲気と質感。たとえばゴールデンアワー、柔らかいスタジオ光、35mmフィルム。
"a dog running" と "a golden retriever sprints through shallow surf at sunset, low tracking shot, spray catching the light" を比べてみてください。前者は被写体の細部、場所、カメラ、光を運任せにしています。後者は5つすべてを指定しているので、モデルが推測する部分が大きく減り、イメージに近いクリップになります。
テキストから動画の5要素プロンプト公式とは?
最も安定するプロンプトは、いつも同じ順番です。被写体、動作、場所、カメラ、光とスタイル。タグの羅列ではなく、1〜2文の自然な文章で書き、1クリップにつきアイデアは一つに絞ります。数秒のクリップに入る動作は1〜2個だけだからです。音声を生成するモデルなら、最後に音についての短い一文を足します。言葉選びの詳細はAI動画プロンプトの書き方で解説しています。この公式で作った2つのプロンプトを、そのままVIBEに貼り付けられます(プロンプトは、多くの動画モデルが最適化されている英語のままにしてください)。
“A street vendor flips noodles in a steaming wok at a night market, close-up, slow push-in, warm lantern light and neon reflections, sizzling sound and distant chatter.”
“A lone hiker walks along a ridge above a sea of clouds at sunrise, wide tracking shot from behind, golden light, wind in the jacket, cinematic and calm.”
プロンプトの長さはどのくらいが良いでしょうか。多くのモデルでは25〜60語が目安です。5要素を入れるのに十分で、内容が矛盾しない程度に短い長さです。プロンプトの一部が無視されるときは、語を足すより削るほうがたいてい効きます。

なぜテキストから動画のプロンプトでカメラ用語が重要なのか?
カメラの言葉は、クリップに意図を感じさせる最も手軽な方法です。指定がないと、モデルは標準の構図を選び、たいていは動きのない中景で平坦な印象になります。カメラの一言でクリップ全体の印象が変わり、同じ用語がどのモデルでも通用します。さらに多くの例は、シネマティックなAI動画プロンプトの記事をご覧ください。まずは次の6つから始めましょう。
| カメラ用語 | 効果 | 向いている場面 |
|---|---|---|
| クローズアップ(close-up) | 画面いっぱいに一つのディテールを映す | 顔、料理、商品 |
| ゆっくり寄る(slow push-in) | カメラが被写体に近づく | ドラマ、強調 |
| 追従ショット(tracking shot) | カメラが被写体を追う | 歩く、運転、スポーツ |
| 空撮(aerial shot) | 高い視点から風景の上を移動 | 場所、旅行 |
| ローアングル(low angle) | 被写体を下から見上げる | 力強さ、ヒーローの瞬間 |
| スローモーション(slow motion) | 速い動きを引き延ばす | 水しぶき、ジャンプ、髪 |
1クリップにつきカメラの動きは一つだけ選びましょう。数秒で寄り、パン、周回を組み合わせると動きがぎこちなくなります。二つ目の動きが欲しいときは、別のクリップを生成して後でつなぎます。単純な被写体に動きを一つだけ使ったプロンプトがこちらです。
“Close-up of a glass of iced coffee on a marble counter, ice cubes clink and condensation runs down the glass, slow push-in, soft window light, shallow depth of field.”
VIBEではどのテキストから動画モデルを選ぶべき?
VIBEは一つの入力欄の裏に複数のモデルを用意しているので、同じ文章を異なるエンジンで試せます。Seedance Pro FastやWan 2.6などの無料モデルはアイデア出しに最適で、Veo 3.1 FastやKling 3などのプレミアムモデルは1080p出力と音声に対応します。表は2026年10月時点でアプリに掲載されている仕様で、全ラインナップはモデルにあります。
| モデル | 開発元 | プラン | 解像度 | 最大の長さ | 音声 |
|---|---|---|---|---|---|
| Seedance Pro Fast | ByteDance | 無料 | 720p | 8 s | なし |
| Wan 2.6 | Alibaba / Qwen | 無料 | 720p | 8 s | なし |
| Veo 3.1 Fast | Google DeepMind | プレミアム | 1080p | 8 s | あり |
| Kling 3 Pro | Kuaishou | プレミアム | 1080p | 15 s | あり |
実践的な流れはこうです。まず無料モデルでアイデアを試し、動きが合うまで文章を調整し、最後に完成版として同じプロンプトをプレミアムモデルで実行します。1回の試行で変えるのを一要素にすると、どの言葉が何をしているかがはっきり分かります。

テキストから動画 AIは無料・ログイン不要で使える?
はい。VIBEの無料プランにはSeedance Pro Fast、LTX Video、Luma Dream Machine、Wan 2.6、PixVerseが含まれ、アカウントを作らずに生成を始められます。プレミアムモデルは、1080pや音声が必要なときに選びます。無料と有料の詳しい比較は無料AI動画生成ガイドをご覧ください。無料モデルは次のような用途に向いています。
- プレミアムで生成する前にプロンプトのアイデアを試す。
- TikTok、リール、YouTubeショート向けの短い縦型クリップを作る。
- カメラや動作の言葉で結果がどう変わるかを学ぶ。
- 一つのシーンで複数のバージョンを作り、ベストを選ぶ。
“A paper boat drifts down a rainy gutter past colourful autumn leaves, low angle close-up, tracking shot, soft overcast light, gentle ripples.”
おすすめの無料ワークフローは、5要素のプロンプトを書き、無料モデルでカメラ表現だけを変えた3パターンを生成し、最も良い動きを選んでから、初めてプレミアム生成を使う方法です。言葉ではなく写真から始めたい場合は、画像から動画のガイドをご覧ください。

テキストから動画で多い失敗は?
期待外れの結果の多くは、モデルではなくプロンプトが原因です。次の5つの習慣は避けましょう。
- 説明しすぎる。 1クリップに5つの動作を入れると混ざってしまうので、1〜2個にします。
- カメラを指定しない。 カメラの一言を足すと、構図に意図が生まれます。
- あいまいな形容詞を使う。 「きれい」ではモデルに伝わらず、「ゴールデンアワーの逆光」なら伝わります。
- 読める文字を求める。 動画モデルは画面内の文字が崩れることがあるので、字幕は編集アプリで足しましょう。
- 一度にすべて変える。 1回の試行で変えるのは一要素にして、何が効くかを学びます。
これらの習慣を直すほうが、モデルを乗り換えるより結果が良くなります。最初の生成は下書きと考え、出てきた映像を確認し、カメラマンに指示を出すように短く具体的にプロンプトを調整しましょう。
よくある質問
テキストから動画に最適なAI動画生成ツールは?
目的によります。下書きや学習には、Seedance Pro FastやWan 2.6などVIBEの無料モデルで十分です。1080pや音声が必要なら、Veo 3.1 FastとKling 3 Proがプレミアムの選択肢です。同じプロンプトを2つのモデルで試すのが、決めるいちばん早い方法です。
AIで文章から動画を作るにはどうすればいい?
VIBEを開いてテキストから動画を選び、モデルを選んで、被写体、動作、場所、カメラ、光を含む1〜2文の説明を入力し、生成をタップします。数分でクリップが完成します。
ログイン不要の無料テキストから動画 AIはある?
あります。Seedance Pro Fast、LTX Video、Luma Dream Machine、Wan 2.6、PixVerseを含むVIBEの無料モデルは、アカウントを作らずに使えます。
テキストから動画のクリップは何秒まで作れる?
2026年10月時点のVIBEでは、Seedance Pro Fast、Wan 2.6、Veo 3.1 Fastで最大8秒、Kling 3で最大15秒です。長い動画は複数のクリップをつないで作ります。
テキストから動画で音も作れる?
作れるモデルもあります。VIBEではVeo 3.1 FastとKling 3が映像と一緒に音声を生成するので、プロンプトに効果音や環境音についての一文を足せます。Seedance Pro FastとWan 2.6は無音のクリップになります。
AI動画が文章どおりにならないのはなぜ?
多くの場合、プロンプトがあいまい、詰め込みすぎ、またはカメラ指定がありません。アイデアを一つに絞り、被写体と動作を明確にし、カメラ表現を足して、一度に一要素ずつ変えてください。
- #aivideogeneratorfromtext
- #texttovideoai
- #freeaivideogeneratorfromtext
- #texttovideoprompts
- #aivideomaker
今日から AI動画 を作り始めよう
iOSとAndroidでVIBEを無料ダウンロード。ログイン不要。10種類以上のAI動画モデルにアクセスし、テキストプロンプトや画像から動画を生成できます。

