画像からAI動画を生成する方法:どんな写真も動画に変える手順
写真を1枚アップロードし、動きを一文で説明するだけで短い動画ができます。写真の選び方、プロンプトの書き方、モデルの選び方を解説します。

執筆 Vincent Park
公開日

画像からAI動画を生成するジェネレーターは、1枚の静止画と短い動きの説明から、多くの場合数分で動画クリップを作ります。このガイドでは、動かしやすい写真、うまくいく「写真+動詞」のプロンプト、そしてログイン不要・無料で始められるVIBEのモデルの選び方を紹介します。
ひとことで言うと
画像からAI動画を生成するジェネレーターとは、あなたの写真を最初のフレームまたは視覚的な参考として使い、動きを説明したテキストから後続のフレームを予測して動画にするアプリです。
画像からAI動画を生成するジェネレーターとは?
生成動画の「画像から動画」側にあたる仕組みです。シーン全体をゼロから説明する代わりに、被写体・光・構図がすでに決まった写真をモデルに渡し、動かしたい部分だけを説明します。そのため、テキストから動画へのモデルの概要でも一般論として説明されているとおり、モデルが最初に持つ視覚情報が多いほど作り出す部分が減り、純粋なテキスト動画より結果をコントロールしやすくなります。
2026年10月現在、バズっている「写真に命を吹き込む」クリップの多くは同じ発想です。まばたきして微笑む肖像写真、ゆっくり回る商品、しっぽを振るペットなど。VIBEならiOS、Android、Webで作成でき、無料モデルはログイン不要です。このカテゴリが初めてなら、まずAI動画ジェネレーターアプリの完全ガイドをご覧ください。

どんな写真が動かしやすい?
良い結果の最大の要因は、モデルよりも元の写真です。モデルは写真を「正解」として扱うため、写真の中で曖昧な部分は動画でも曖昧なままです。うまくいく写真には共通点があります。
- 被写体がはっきりしている。 背景から分けやすい、1人の人物・ペット・商品・物。
- ピントが合い、明るい。 ぼけた写真や暗すぎる写真は動きがにじみます。手元で最も解像度の高い元データを使いましょう。
- 動く余白がある。 カメラや体が動けるよう、被写体の周りに少し空間を残します。
- 自然なポーズ。 固まった姿勢より、動作の途中のリラックスしたポーズのほうが自然に動きます。
- 投稿先に合う比率。 TikTok・リール・ショートは縦9:16、YouTubeは横16:9。
苦手なのは、人が多い集合写真、強く加工した画像、カメラから遠い小さな顔、細かい文字が多いものです。情報が多い写真は、動かしたい部分だけに切り抜いてからアップロードしましょう。ペットの写真についてはペット写真をアニメーションにするガイドで詳しく解説しています。
VIBEで写真を動画にするには?
タイムラインやコマ単位の編集は不要で、数タップで完了します。アプリでもWebでも手順は同じです。
- VIBEを開き、テキストから動画ではなく「画像から動画」を選びます。
- 写真をアップロードします。できれば最も鮮明な元データを、投稿先の比率にトリミングして使います。
- モデルを選びます。まずはSeedance Pro FastやWan 2.6などの無料モデルで試し、仕上がりを求めるならKling 3 Proに切り替えます。
- 次のセクションの公式を使い、動きを1〜2文で説明します。
- 生成して確認し、動きが決まるまでプロンプトを一度に1か所だけ変えます。
“A woman in a yellow raincoat stands on a rainy city street at dusk. She slowly turns toward the camera and smiles as rain drips off her hood, gentle push-in, reflections shimmer on the wet pavement.”

「写真+動詞」のプロンプト公式とは?
写真がすでに場面の見た目を伝えているので、プロンプトで絵を説明し直す必要はありません。説明するのは変化だけです。誰(何)が、どう動くか、カメラは何をするか。これを「写真+動詞」の公式と呼び、一文に収まります。被写体、はっきりした動詞1つ、カメラの動き1つです。
良い動詞は小さく身体的なものです。まばたきする、微笑む、振り向く、歩く、湯気が立ち上る、髪がなびく、布が揺れる。短いクリップに入るアイデアは1〜2個なので、5つの動作を詰め込むのは避けましょう。書き方をさらに知りたい方はAI動画のプロンプトの書き方をご覧ください。公式に沿った2つのプロンプトを、そのまま貼れる形で紹介します。
“A ceramic coffee cup on a wooden table by a window, steam curls upward, soft morning light shifts slowly across the table, camera drifts gently to the right.”
“A golden retriever on a grassy hill, ears and fur ripple in the wind, tail wagging, camera holds steady at eye level.”
最初のフレームモードと参照モード、どちらを使う?
画像から動画のツールには主に2つの方式があります。最初のフレームモードでは写真が冒頭のフレームになり、モデルがそこから動きを続けるため、最初の1秒は写真そのままに見えます。参照モードでは写真がキャラクターや商品など被写体の見た目のガイドになり、その周りに新しいカットが作られます。OpenAIも自社の動画モデルについて、動画生成ガイドで最初のフレームの考え方を説明しています。
| モデル | VIBEでの料金 | 向いている用途 | 備考 |
|---|---|---|---|
| Seedance Pro Fast | 無料 | 手早いテスト、シンプルな動き | 約720p・約8秒、ネイティブ音声なし |
| Wan 2.6 | 無料 | 自然な動き、ポートレート | 約720p・約8秒、ネイティブ音声なし |
| Kling 3 Pro | プレミアム | 洗練された動き、一貫した被写体 | 最大15秒、reference-to-video、ネイティブ音声 |
ポートレート、風景、テーブルの上の商品のように、写真そのものがカットなら最初のフレームモードを使います。同じキャラクターや商品を複数のクリップで一貫させたいなら参照モードです。画像から動画に向いたVIBEのモデルを比べると次のとおりです。
プロンプトは、被写体を固定して変化を1つだけにするのがコツです。次の2つは、商品写真と懐かしい写真を使い、同じ公式がどこまで通用するかを示しています。「stays perfectly sharp and unchanged」という一文は、商品を描き直さないようモデルに伝えるものです。
“A pair of white sneakers on a concrete step, the camera orbits slowly around them, soft studio light, subtle dust floats in the air, shoes stay perfectly sharp and unchanged.”
“An old family photo of a grandmother in a garden, she blinks, smiles warmly and tilts her head slightly, flowers sway behind her in a light breeze, locked-off camera.”
写真の動画が歪むのはなぜ?直し方は?
失敗の多くは、1つのクリップに求めすぎることが原因です。モデルは写真を認識できる状態に保ちながら動きを加えるため、指示が増えるほどズレやすくなります。次の対処で大半の問題は解決します。
- 顔が歪む: 動きを短くし、カメラワークを外して、まばたきか微笑みだけを指示します。
- 被写体が溶ける・変わる: より鮮明な写真を使い、動かしたくない部分に「stays unchanged」を加えます。
- 動きが少なすぎる: 「動く」のような曖昧な動詞を「ゆっくり首を回す」のような具体的な動詞に置き換えます。
- 動きが多すぎる: カメラの指示を削り、動作を1つに絞ります。
- 冒頭の見た目が違う: 写真が単なる参考ではなく、最初のフレームとして使われているか確認します。

写真から無料でAI動画を作れる?
はい。2026年10月現在、VIBEはログイン不要・ウォーターマークなしの無料モデルを5つ提供しています。Seedance Pro Fast、LTX Video、Luma Dream Machine、Wan 2.6、PixVerseです。無料クリップは約720p、約8秒で、TikTokやリール、最初のテストには十分です。詳しくは無料AI動画ジェネレーターガイドをご覧ください。
長いカット、1080p、ネイティブ音声、一貫したキャラクターなど、具体的な制限に困ったらプレミアムモデルへ移りましょう。Wan 2.6はAlibabaのモデルで、開発元の説明はWan 2.6の発表で読めます。すべてのモデルはVIBEのモデル選択で並べて比較できます。

他人の写真を動かしてもいい?
動かすのは自分で撮った写真か、使用許可のある写真だけにし、実在の人物の動く写真を、その人が実際にしたことのように見せてはいけません。完成したクリップが本物の映像と見間違えるほどリアルな場合、TikTokとYouTubeはラベル表示を求めており、TikTokのAI生成コンテンツのルールに方法が説明されています。迷ったら、物、ペット、場所、自分の写真を動かしましょう。
よくある質問
画像からAI動画を生成する最良のジェネレーターは?
用途によります。Seedance Pro FastとWan 2.6はVIBEで無料で、手早いテストに向いています。Kling 3 Proは、より長く、洗練され、一貫したクリップ向けのプレミアムな選択肢です。
写真を無料で動画にできますか?
はい。VIBEにはSeedance Pro FastやWan 2.6を含む5つの無料モデルがあり、ログイン不要・ウォーターマークなしです。無料クリップは約720pで約8秒です。
写真動画のプロンプトはどう書けばいい?
絵ではなく動きだけを説明します。「写真+動詞」の公式を使い、被写体1つ、はっきりした動詞1つ、カメラの動きは最大1つにします。例:「she turns toward the camera and smiles, slow push-in」。
AI動画で顔が変わってしまうのはなぜ?
動きを求めすぎている可能性が高いです。動作を短くし、カメラワークを外し、より鮮明な元写真を使い、まばたきや微笑みのような小さな動きだけを指示してください。
写真動画は何秒まで作れますか?
VIBEの無料モデルは約8秒です。2026年10月時点で、Kling 3 Proは最大15秒、Wan 3.0は最大30秒まで対応します。
写真を動かすのに登録は必要ですか?
いいえ。VIBEの無料モデルなら、アカウントを作らずに最初のクリップを生成できます。iOS、Android、Webで利用できます。
他人の写真を動かすのは合法ですか?
自分のものか使用許可のある写真だけを使い、各プラットフォームのAI表示ルールに従ってください。これは一般的な情報であり、法的助言ではありません。
今日から AI動画 を作り始めよう
iOSとAndroidでVIBEを無料ダウンロード。ログイン不要。10種類以上のAI動画モデルにアクセスし、テキストプロンプトや画像から動画を生成できます。

