Zum Hauptinhalt springen
Trends & Tutorials9 Min. Lesezeit

KI Video Prompts schreiben: Die Formel, die wirklich funktioniert (mit Beispielen)

KI Video Prompts sind die schriftlichen Anweisungen, die einem Modell sagen, was es erzeugen soll — mit der richtigen Struktur macht Veo 3.1 Fast aus einem Satz einen brauchbaren Clip. Hier die Formel, das Vokabular und vier copy-fertige Beispiele.

Vincent Park

Geschrieben von Vincent Park

Veröffentlicht

Artikel teilen
Ein Creator tippt abends am Schreibtisch KI Video Prompts in sein Handy, der Bildschirm leuchtet auf seinem Gesicht

KI Video Prompts sind die schriftlichen Anweisungen — Subjekt, Aktion, Kamera, Licht und Dauer — die einem Text-zu-Video- oder Bild-zu-Video-Modell genau sagen, was es erzeugen soll. Mit der richtigen Formel macht ein Modell wie Veo 3.1 Fast oder Kling 3 Pro aus einem einzigen Satz beim ersten Versuch einen brauchbaren Clip; bleibt der Prompt vage, rät das Modell — und du verbrennst Generierungen an Ergebnissen, die niemand gebrauchen kann. Dieser Guide zeigt die Anatomie eines funktionierenden Prompts, das Kamera- und Licht-Vokabular, das die Einstellung wirklich verändert, und copy-fertige Beispiele für vier VIBE-Modelle.

In einem Satz

KI Video Prompts sind strukturierte Textanweisungen — wer oder was im Bild ist, was es tut, wie sich die Kamera bewegt und wie die Szene beleuchtet ist —, geschrieben so, dass ein Video-Generierungsmodell daraus in einem Durchgang einen konsistenten, brauchbaren Clip macht.

Was sind KI Video Prompts?

Ein geschriebener Prompt ist das einzige Lenkrad, das dir ein Text-zu-Video- oder Bild-zu-Video-Modell gibt. Anders als ein Bild-Prompt muss ein KI Video Prompt eine Veränderung über Zeit beschreiben — was sich bewegt, wie sich die Kamera bewegt und wie lange die Einstellung dauert — nicht nur, wie ein einzelnes Bild aussieht. Ein Bild-zu-Video-Prompt ist noch kürzer: Das Foto legt Motiv und Setting bereits fest, der Prompt muss nur noch die gewünschte Aktion und Kamerabewegung beschreiben. VIBEs Premium-Modelle (Veo 3.1 Fast, Kling 3 Pro, Sora 2 Pro) und die kostenlosen Modelle (Seedance Pro Fast, Wan 2.6, PixVerse) lesen alle dieselbe Grundstruktur, gewichten sie aber unterschiedlich — manche verlassen sich stärker auf deine Kamerasprache, andere leiten Bewegung vor allem aus dem Aktionsverb ab. Unser kompletter Guide zu KI Video Generator Apps zeigt, wie du ein Modell auswählst; dieser Guide zeigt, was du eintippst, sobald du dich entschieden hast.

Nahaufnahme von Händen, die einen KI Video Prompt auf einem Handy tippen, im Hintergrund warmes Schreibtischlampenlicht
Die Prompt-Box ist das einzige Lenkrad, das du hast — konkrete Wörter verändern die Einstellung stärker als lange.

Die Anatomie eines guten KI Video Prompts

Jeder Prompt, der den Kontakt mit einem Video-Modell übersteht, lässt sich in dieselben fünf Teile zerlegen, ungefähr in dieser Reihenfolge. Lässt du einen weg, füllt das Modell die Lücke selbst — meist mit etwas Generischem.

  • Subjekt — wer oder was im Bild ist, beschrieben wie von einer Casting-Regie: Alter, Kleidung, Ausdruck, ein unterscheidendes Detail.
  • Aktion — eine klare Verbphrase pro Einstellung. 'Geht auf die Kamera zu, dreht sich dann um und lächelt' funktioniert; 'macht eine Menge cooler Sachen' nicht.
  • Kamera — Einstellungsgröße und jede Bewegung: weite Establishing-Einstellung, mittlere Nahaufnahme, langsamer Dolly-in, Handheld-Tracking-Shot.
  • Licht und Farbe — die Lichtqualität (weiches Fensterlicht, harte Mittagssonne, Neonschilder) plus zwei bis drei Farbanker (Amber, Petrol, warmes Braun).
  • Dauer und Stil — wie viele Sekunden der Clip läuft und das visuelle Register: cinematisch, dokumentarisch, Anime, Produktfotografie.
In VIBE ausprobierenVeo 3.1 Fast

Weite Establishing-Einstellung, Augenhöhe: Eine Frau in gelbem Regenmantel geht zügig über einen regennassen Zebrastreifen in der Stadt bei Dämmerung, Neonschilder spiegeln sich in den Pfützen, dann blickt sie auf und lächelt. Weiches Blau-Amber-Licht, 8 Sekunden, cinematisch.

Kamera- und Licht-Begriffe, die die Einstellung verändern

Die meisten gescheiterten Prompts sind Vokabular-Probleme, keine Ideen-Probleme — das Konzept war gut, aber die Worte dafür waren zu vage, um darauf zu reagieren. Das sind die Begriffe, die zuverlässig etwas bewirken:

  • Weite Establishing-Einstellung — setzt die Szene, bevor du näher schneidest, und wirkt bewusst statt zufällig gerahmt.
  • Mittlere Nahaufnahme, leicht von hinten — eine natürliche Art, eine Person einzuführen, ohne einen direkten Blick in die Kamera.
  • Langsamer Dolly-in / Push-in — baut Spannung auf, ganz ohne Bewegung des Motivs.
  • Handheld-Tracking-Shot — fügt das kleine, menschliche Wackeln hinzu, das wie Dokumentarfilm oder UGC-Stil wirkt.
  • Golden-Hour-Rim-Light — ein warmer Rand um das Motiv vor dunklerem Hintergrund; wirkt bei fast jedem Modell teuer.
  • Weiches Fensterlicht mit warmer Lampenaufhellung, kühles Streiflicht aus dem Flur — zwei Lichtquellen statt einer zu schichten trennt einen flachen Clip von einem gut ausgeleuchteten.
Ein Creator filmt draußen zur goldenen Stunde und hält das Handy mit beiden Händen ruhig wie ein kleines Gimbal
Benenne die Einstellung und die Bewegung — 'langsamer Dolly-in' bewirkt mehr als 'cinematische Kameraführung'.
In VIBE ausprobierenKling 3 Pro

Langsamer Dolly-in auf eine Barista, die hinter der Theke Milch aufschäumt, warme Lampenaufhellung, kühles blaues Licht vom Straßenfenster hinter ihr, Dampf fängt das Licht ein. Sie blickt auf und lächelt halb in die Kamera. 12 Sekunden, Handheld-Mikrobewegung.

Wie verwandeln KI-Video-Tools einen Prompt in einen Clip?

Stand September 2026 ist jedes große Consumer-Video-Modell — Veo 3.1 Fast, Kling 3 Pro, Sora 2 Pro sowie die offenen Wan- und Seedance-Familien — ein Diffusionsmodell, trainiert auf Millionen von Video-Text-Paaren, die Technik, die erstmals in Video Diffusion Models beschrieben wurde, einem Google-Research-Paper von 2022. Das Modell startet bei Rauschen und entrauscht es, Bild für Bild, in Richtung dessen, was dein Text beschreibt; dein Prompt ist das einzige Signal dafür, wie 'richtig' aussieht. Deshalb schlagen konkrete Substantive und Verben Adjektive wie 'erstaunlich' oder 'hochwertig' — das Modell hat bei so einem Wort nichts Visuelles, worauf es hin entrauschen kann.

  1. Wähle ein Modell passend zur Einstellung: Veo 3.1 Fast und Kling 3 Pro für native Audiospur und Kamerabewegung, Sora 2 Pro für längere cinematische Takes, Seedance Pro Fast oder Wan 2.6, um einen Prompt kostenlos zu testen, bevor du ein Premium-Guthaben ausgibst.
  2. Schreibe den Prompt nach der Formel Subjekt–Aktion–Kamera–Licht–Dauer von oben, in dieser Reihenfolge.
  3. Generiere und sieh dir das Ergebnis in normaler Geschwindigkeit und Bild für Bild an — die meisten Kontinuitätsprobleme zeigen sich nur in Zeitlupe.
  4. Ändere jeweils nur eine Variable. Ist die Bewegung falsch, bearbeite die Aktionsphrase; stimmt die Stimmung nicht, bearbeite das Licht. Alles gleichzeitig zu ändern macht es unmöglich zu erkennen, was die Einstellung verbessert hat.
  5. Exportiere im Seitenverhältnis, das deine Plattform erwartet — 9:16 für TikTok und Reels, 16:9 für YouTube —, bevor du postest.

Veo 3.1 Fast vs. Kling 3 Pro vs. Sora 2 Pro: Was du für welches Modell schreibst

Die fünfteilige Formel bleibt gleich, aber jedes Modell belohnt eine etwas andere Gewichtung. So schneiden VIBEs Video-Modelle ab, wenn du auf ihre Stärken schreibst:

ModellAm besten geschrieben fürMax. Länge in VIBENative AudiospurBild-zu-Video
Veo 3.1 FastKurze, audiogetriebene Szenen — Dialog oder Ambiente8 SekundenJaNein
Kling 3 ProLängere Takes mit bewusster Kamerabewegung15 SekundenJaJa
Sora 2 ProCinematische Kontinuität über eine längere Einstellung12 SekundenNeinNein
Seedance Pro FastSchnelles, kostenloses Iterieren an einem Prompt vor dem Upgrade8 SekundenNeinJa

OpenAIs eigener Sora-2-Prompting-Guide empfiehlt, Szenenbeschreibung, Kameraführung und Aktion in getrennte Sätze statt in eine lange Zeile zu packen, und Google DeepMinds Veo-Modellseite zeigt dasselbe Muster — konkrete, klare Beschreibung schlägt gestapelte Adjektive bei beiden Modellen. Dieselbe Struktur funktioniert in VIBE auch für Kling 3 Pro und Sora 2 Pro.

In VIBE ausprobierenSora 2 Pro

Statische Weiteinstellung, goldene Stunde: eine leere Dachterrasse in der Stadt mit Lichterketten, die sanft im Wind schwingen, die Skyline weich unscharf im Hintergrund. Eine Papierlaterne treibt in den letzten zwei Sekunden durchs Bild. Kein Dialog, nur Windgeräusch. 12 Sekunden, Filmkorn, warme Amber-Palette.

Häufige Fehler bei KI Video Prompts

Dieselbe Handvoll Fehler ist für die meisten verschwendeten Generierungen verantwortlich:

  • Adjektive stapeln statt konkret zu werden. 'Schönes, erstaunliches, umwerfendes Video' gibt dem Modell nichts, worauf es hin entrauschen kann — ersetze jedes Adjektiv durch ein sichtbares Detail.
  • Zwei Aktionen in einem Satz. 'Sie rennt, springt dann, winkt dann' verlangt drei Einstellungen in einem Take. Wähle die eine Aktion, für die der Clip tatsächlich Zeit hat.
  • Keine Kameraanweisung. Lässt du die Kamera weg, greifen die meisten Modelle standardmäßig auf eine statische Halbtotale zurück — manchmal okay, aber du verschenkst Kontrolle.
  • Dauer und Aktion widersprechen sich. Eine 8-Sekunden-Einstellung passt kein ganzes Gespräch. Stimme die Aktion auf die Sekunden ab, die du generierst.
  • Fünf Dinge gleichzeitig ändern, wenn ein Ergebnis schon fast passt. So kannst du nicht erkennen, welche Änderung die Einstellung verbessert — oder ruiniert — hat, und rätst statt zu iterieren.
Zwei Freunde sitzen auf dem Sofa und schauen sich lachend gemeinsam ein Video auf dem Handy an, warmes Lampenlicht
Ein funktionierender Prompt liest sich wie eine Einstellungsliste, nicht wie ein Wunschzettel.

Mit welchem Modell startest du kostenlos?

Du brauchst kein Premium-Guthaben, um diese Formel zu lernen. Seedance Pro Fast, Wan 2.6 und PixVerse sind in VIBE kostenlos, keine Anmeldung nötig, und sie lesen dieselbe Subjekt–Aktion–Kamera–Licht-Struktur wie die Premium-Modelle — der günstigste Ort also, um schnell zu scheitern und zu lernen, was deine Formulierung tatsächlich bewirkt, bevor du ein Veo-3.1-Fast- oder Kling-3-Pro-Guthaben dafür ausgibst. Jedes Modell ist mit Guthabenkosten und Stufe in VIBEs Modell-Übersicht aufgeführt, und der komplette Guide zu KI Video Generator Apps geht ausführlicher auf kostenlos versus kostenpflichtig ein. Willst du als Nächstes stilspezifisches Vokabular — Anime-Linienführung, Cel-Shading, cinematisches Grading —, sieh dir unseren Guide zum KI Anime Video Generator an.

Kostenlos ausprobierenSeedance Pro Fast

Mittlere Einstellung, Augenhöhe: Ein Golden-Retriever-Welpe jagt einen rollenden Tennisball über einen sonnigen Hinterhofrasen, die Ohren flattern. Helle Mittagssonne, geringe Schärfentiefe, 6 Sekunden.

Der Schreibtisch eines Creators mit einem Handy auf einem kleinen Ständer, einem leeren Notizbuch, einem Stift und einer Tasse Kaffee im Morgenlicht
Notiere dir, welche Formulierungen bei welchem Modell funktioniert haben — die Formel bleibt gleich, aber deine eigene Kurzschrift macht dich schneller.

Häufig gestellte Fragen

Was ist die beste Formel für KI Video Prompts?

Subjekt, Aktion, Kamera, Licht und Dauer, in dieser Reihenfolge geschrieben: beschreibe, wer oder was im Bild ist, die eine Sache, die es tut, wie die Kamera gerahmt ist oder sich bewegt, wie die Szene beleuchtet ist, und wie viele Sekunden der Clip laufen soll. Diese Struktur funktioniert sowohl bei VIBEs Premium- als auch bei den kostenlosen Modellen.

Wie lang sollte ein KI Video Prompt sein?

Ein bis drei Sätze reichen meist. Ein Prompt, der einen ganzen Absatz füllt, verschüttet oft die eine Aktion und die eine Kamerabewegung, die ein Modell in einem 8- bis 15-sekündigen Clip tatsächlich umsetzen kann — halte jeden Satz auf eine einzige, sichtbare Anweisung beschränkt statt auf eine vollständige Szenenbeschreibung.

Brauche ich unterschiedliche Prompts für Veo 3.1 Fast, Kling 3 Pro und Sora 2 Pro?

Dieselbe Subjekt-Aktion-Kamera-Licht-Struktur funktioniert bei allen dreien, aber gewichte sie nach der Stärke des jeweiligen Modells: setze bei Veo 3.1 Fast und Kling 3 Pro auf Klanghinweise, da beide in VIBE native Audiospur erzeugen, und bei Sora 2 Pro, das keine Audiospur erzeugt, auf Kamera- und Lichtdetails.

Kann ich KI Video Prompts kostenlos schreiben?

Ja. Seedance Pro Fast, Wan 2.6 und PixVerse sind in VIBE kostenlos und ohne Anmeldung nutzbar, und sie lesen dieselbe Subjekt-Aktion-Kamera-Licht-Formel wie die Premium-Modelle — so lernst du, was deine Formulierung bewirkt, bevor du ein Premium-Guthaben für Veo 3.1 Fast, Kling 3 Pro oder Sora 2 Pro ausgibst.

Warum ignoriert mein KI-Video-Generator einen Teil meines Prompts?

Meist, weil der Prompt mehr verlangt, als die Länge des Clips zulässt, oder weil zwei Aktionen in einem Satz stecken. Stimme eine Aktion auf die Sekunden ab, die du generierst, und wenn ein Detail immer wieder wegfällt, setze es weiter vorne im Satz, damit es mehr Gewicht bekommt.

Welche Kamera-Begriffe funktionieren bei KI Video Prompts wirklich?

Konkrete Einstellungsgrößen und Bewegungen: weite Establishing-Einstellung, mittlere Nahaufnahme, langsamer Dolly-in, Handheld-Tracking-Shot. Vage Anweisungen wie 'cinematische Kameraarbeit' sind deutlich unzuverlässiger, als die tatsächliche Einstellung und Bewegung zu benennen, die das Modell rendern soll.

  • #aivideoprompts
  • #howtowriteaivideoprompts
  • #texttovideoprompts
  • #aivideopromptexamples
Artikel teilen
VIBE - KI-Video Generator

Erstelle KI-Videos noch heute

Lade VIBE kostenlos für iOS und Android herunter. Kein Login erforderlich. Greife auf 10+ KI-Video-Modelle zu und erstelle Videos aus Textprompts oder Bildern.