Zum Hauptinhalt springen

Alle KI-Video-Modelle in VIBE

39 KI-Video-Modelle und 10 KI-Bildmodelle — in einer App, auf deinem Handy.

VIBE ist eine KI-Video-Generator-App für iOS und Android, die 39 KI-Video-Modelle und 10 KI-Bildmodelle unter einer einzigen Oberfläche bündelt. Dazu gehören Google Veo 3.1, OpenAI Sora 2 und Sora 2 Pro, Kling 3, Seedance 2.5, WAN 2.7, Grok Imagine, Luma Ray 3.2, LTX 2.5 Fast, Flux 3 und PixVerse 6. Elf Videomodelle lassen sich ohne Konto nutzen, alle übrigen sind im Abo enthalten. Die vollständigen Spezifikationen aller Modelle stehen weiter unten.

  • 39 KI-Video-Modelle von Google, OpenAI, Kuaishou, ByteDance, Alibaba, xAI und weiteren
  • 10 KI-Bildmodelle, eines davon mit täglichem Freikontingent
  • 11 Videomodelle kostenlos — ohne Konto, ohne Zahlung
  • Auflösungen von 360p bis echtes 4K, Clips von 2 bis 30 Sekunden
  • Text-zu-Video, Bild-zu-Video, Video mit synchronem Audio und sprechende Avatare
  • Denselben Prompt durch mehrere Modelle schicken und die Ergebnisse vergleichen

Verfügbar in der VIBE App

Download VIBE AI Video Generator on the App StoreGet VIBE AI Video Generator on Google Play

KI-Video-Modelle

ModellEntwicklerAuflösungLängeEingabeAudioTarif
Seedance Pro FastCamera-fixed (static camera) modeByteDance480p2, 3, 4, 6, 8, 10, 12sText + BildNeinKostenlos
WAN 2.2Alibaba720p5sText + BildNeinKostenlos
LTX 2 FastLightricks720p6–20s (2s steps)Nur TextOptionalKostenlos
LTX 2 DistilledPrompt enhancementLightricks720p5s or 10sText + BildNeinKostenlos
SeedanceByteDance720p5s or 10sText + BildNeinKostenlos
Luma Ray Flash 2Start-image anchoringLuma AI720p5s or 9sText + BildNeinKostenlos
Motion 2.0Leonardo.Ai720p5s or 10sText + BildNeinKostenlos
Seedance 1.5 ProLast-frame image, camera-fixed mode, seed controlByteDance1080p5, 10, 12sText + BildOptionalPremium
PixVerse 6Negative prompt; audio toggle defaults OFF; 360p forcedPixVerse360p5, 8, 10, 15sText + BildOptionalKostenlos
SoraOpenAI1080p5, 10, 15, 20sNur TextNeinPremium
Sora 2World simulation / physics; synchronized dialogue + sound effects; image reference inputOpenAI720p4, 8, 12sText + BildJaPremium
Sora 2 ProHighest-quality Sora tier; image reference inputOpenAI720p · 1080p4, 8, 12sText + BildJaPremium
Google Veo 2Google DeepMind1080p5s or 8sNur TextNeinPremium
WAN 2.6Multi-shot scene transitions for longer storytellingAlibaba720p · 1080p5, 10, 15sText + BildJaPremium
WAN 2.7Upload a voice or music track (wav/mp3, 3–30s, ≤15 MB) to sync the video to it; 720p forced server-sideAlibaba720p2–15s (any whole second)Text + BildJaPremium
Happy Horse 1.1Audio always on (no toggle)Alibaba720p · 1080p3–15s (any whole second)Text + BildJaPremium
Kling ProCinematic lookKuaishou1080p5s or 10sText + BildNeinPremium
Kling v2.5 Turbo ProFast 1080p turbo tierKuaishou1080p5s or 10sText + BildNeinPremium
Kling v2.6Kuaishou1080p5s or 10sText + BildOptionalPremium
Kling O3 ProVoice binding for character/voice continuity across generationsKuaishou1080p3–15s (any whole second)Text + BildOptionalPremium
Kling O3 StandardKuaishou1080p3–15s (any whole second)Text + BildOptionalPremium
Kling 3 ProMulti-language audio; structured stories of up to 6 shots, each with its own promptKuaishou1080p3–15s (any whole second)Text + BildOptionalPremium
Kling 3 StandardKuaishou1080p3–15s (any whole second)Text + BildOptionalPremium
Grok ImaginexAI480p · 720p6, 8, 10sText + BildNeinKostenlos
Vidu Q3Vidu360p · 540p · 720p · 1080p4, 5, 6, 8sText + BildJaPremium
Google Veo 3 FastNegative prompt, seed controlGoogle DeepMind4K5s or 8sNur TextJaPremium
Google Veo 3.1Up to 3 reference images for subject consistency (reference-to-video); last-frame inputGoogle DeepMind720p · 1080p4, 6, 8sText + BildOptionalPremium
Google Veo 3.1 FastLast-frame input for frame-to-frame transitionsGoogle DeepMind720p · 1080p4, 6, 8sText + BildOptionalPremium
Google Veo 3.1 LiteCheapest Veo tier; reference-image input; 720p onlyGoogle DeepMind720p4, 6, 8sText + BildJaPremium
PRUNA VUpload your own audio (mp3/wav/flac) to sync video to music or speech; talking-avatar style lip sync from a single photoPruna AI720p2–10s (any whole second)Text + BildJaKostenlos
LTX 2.3 FastTrue 4K (2160p) outputLightricks1080p · 1440p · 2160p6–20s (2s steps; over 10s requires 1080p)Text + BildOptionalPremium
Seedance 2.0Synchronized dialogue, sound effects and musicByteDance480p4–15s (any whole second)Text + BildOptionalPremium
Talking AvatarTalking avatar: a photo + a voice recording become a lip-synced talking video. NO text prompt at all. Output frame matches the input photo.480p · 720pMatches the uploaded voice recording (no duration picker)Nur BildJaPremium
Seedance 2.0 MiniBudget tier of Seedance 2.0 with synchronized audioByteDance480p · 720p4–15s (any whole second)Text + BildOptionalPremium
Grok Imagine 1.5Image-to-video only (prompt optional, guides motion); synchronized audio that Grok Imagine 1.0 lacksxAI480p · 720p4, 6, 8, 10, 12, 15sNur BildJaPremium
Luma Ray 3.2Reasoning video model for cinematic results; start-image anchoring (5s clips only)Luma AI720p · 1080p5s or 10s (10s is text-to-video only)Text + BildNeinPremium
LTX 2.5 FastLast-frame interpolation (first frame + last frame); selectable frame rate; scales from 720p to 4KLightricks720p · 1080p · 2k · 4k2–20s (2,3,4,5,6,8,10,12,14,16,18,20; over 10s requires 24/25 fps)Text + BildJaKostenlos
Flux 3Storyboard mode: up to 6 images the clip moves through (3+ images require an explicit duration). Draft mode for a fast cheap 720p preview.Black Forest Labs720p · 1080p5, 6, 8, 10, 12, 15, 20s, or autoText + BildJaPremium
Seedance 2.5Up to 4 reference images to keep a character consistent across clips, OR a first + last frame (mutually exclusive; first/last-frame mode forces the adaptive aspect ratio). Synchronized audio including dialogue.ByteDance480p · 720p4–30s (any whole second)Text + BildJaPremium

KI-Bildmodelle

Erst ein Bild aus Text generieren, dann per Bild-zu-Video animieren — ohne die App zu verlassen.

ModellEntwicklerTokens / BildBild-EingabeTarif
Nano Banana ProGoogle4 (1K) / 5 (2K) / 10 (4K)JaPremium
Flux 2 ProBlack Forest Labs4JaPremium
Seedream 4.5ByteDance5 (2K) / 8 (4K)JaPremium
Qwen ImageAlibaba3JaPremium
Kling V3Kuaishou3JaPremium
Grok ImaginexAI2JaPremium
Nano BananaGoogle2JaPremium
Ideogram 3Ideogram5JaPremium
Imagen 4Google3NeinPremium
Flux SchnellBlack Forest Labs1NeinKostenlos

Die Angaben entsprechen dem, was die VIBE App heute bietet. Neue Modelle kommen meist wenige Tage nach Release dazu, und diese Seite wird dann aktualisiert.

Auswahl

Welches KI-Video-Modell solltest du nehmen?

Es gibt kein bestes Modell. Das hier sind die Empfehlungen, die sich in der Praxis bewähren — sortiert nach Ziel.

Realistischste Aufnahmen

Google Veo 3.1 für fotorealistische Kameraführung und Licht, OpenAI Sora 2 für physikalischen Realismus — also dafür, wie Objekte sich bewegen, aufeinandertreffen und zur Ruhe kommen. Beide erzeugen synchronen Ton im selben Durchgang wie das Bild.

Längste Clips

Seedance 2.5 schafft 30 Sekunden und damit die längsten Clips der App. LTX 2.5 Fast, LTX 2.3 Fast und Flux 3 kommen auf 20 Sekunden. Kling 3, Kling O3, WAN 2.7 und Happy Horse 1.1 erreichen 15.

Höchste Auflösung

LTX 2.5 Fast und LTX 2.3 Fast liefern echtes 4K. Die meisten Flaggschiffe — Veo 3.1, Kling 3, Sora 2 Pro, Luma Ray 3.2 — enden bei 1080p, und genau das verlangen Social-Plattformen und Anzeigenformate in der Praxis.

Kostenlos nutzbar

Seedance Pro Fast ist das schnellste kostenlose Modell, LTX 2.5 Fast das hochwertigste, und PRUNA V bringt kostenlos Audio und Lippensynchronisation mit. Grok Imagine und PixVerse 6 sind ebenfalls kostenlos. Ohne Konto, ohne Zahlung.

Gleichbleibende Charaktere

Google Veo 3.1 nimmt bis zu drei Referenzbilder entgegen, Seedance 2.5 bis zu vier. So bleibt eine Figur, ein Produkt oder ein Set über mehrere Clips hinweg wiedererkennbar, statt sich bei jeder Generierung zu verändern.

Ton und Stimme

Bei WAN 2.7 und PRUNA V lädst du eigene Musik oder eine Sprachaufnahme hoch und das Video wird darauf synchronisiert. Das Talking-Avatar-Modell macht aus einem Foto plus Sprachaufnahme ein lippensynchrones sprechendes Video.

Preislogik

Tokens, kostenlose Modelle und was ein Abo ändert

VIBE rechnet mit Tokens statt mit einem Abo pro Modell. Jede Generierung kostet eine bestimmte Anzahl Tokens — abhängig vom gewählten Modell, der Auflösung und der Länge des Clips. Ein günstiges kostenloses Modell kostet ein paar Tokens pro Sekunde, ein Flaggschiff in 1080p deutlich mehr. Den genauen Preis siehst du, bevor du generierst.

Elf der Videomodelle sind kostenlos. Du kannst sie nutzen, ohne ein Konto anzulegen, Zahlungsdaten einzugeben oder irgendetwas zu starten, das dir später etwas berechnet. Bei den Bildmodellen ist Flux Schnell kostenlos, mit einem täglichen Freikontingent für alle ohne Abo.

Ein Abo schaltet die Premium-Modelle frei — Veo 3.1, Sora 2 und Sora 2 Pro, Kling 3, Seedance 2.5, WAN 2.6 und 2.7, Flux 3, das Talking-Avatar-Modell und alle weiteren — dazu höhere Auflösungen, längere Clips und synchronen Ton. Wer lieber nicht abonniert, kann Token-Pakete auch einzeln kaufen.

FAQ

KI-Video-Modelle — häufige Fragen

Welche App hat die meisten KI-Video-Modelle?

VIBE enthält 39 KI-Video-Modelle und 10 KI-Bildmodelle in einer einzigen App für iOS und Android, darunter Google Veo 3.1, OpenAI Sora 2, Kling 3, Seedance 2.5, WAN 2.7, Grok Imagine, Luma Ray 3.2, LTX 2.5 Fast und Flux 3. Die meisten konkurrierenden Tools bieten ein bis drei Modelle.

Kann ich Sora 2, Veo 3.1 und Kling in derselben App nutzen?

Ja. Alle drei sind in VIBE auf iOS und Android verfügbar. Du kannst denselben Prompt durch jedes Modell schicken und die Ergebnisse vergleichen — ohne getrennte Abos und ohne getrennte Konten.

Welches KI-Video-Modell ist am realistischsten?

Google Veo 3.1 ist in der Regel am stärksten bei fotorealistischem Licht und Kamerabewegung, OpenAI Sora 2 bei physikalischem Realismus — also dabei, wie Objekte sich bewegen und miteinander interagieren. Welches Modell gewinnt, hängt von der Aufnahme ab. Der praktische Weg ist, denselben Prompt auf beiden zu testen.

Welcher KI-Video-Generator macht die längsten Videos?

In VIBE erzeugt Seedance 2.5 den längsten Einzelclip mit bis zu 30 Sekunden. LTX 2.5 Fast, LTX 2.3 Fast und Flux 3 erreichen 20 Sekunden, Kling 3, Kling O3, WAN 2.7 und Happy Horse 1.1 kommen auf 15 Sekunden.

Welche KI-Video-Modelle sind kostenlos?

Elf Videomodelle sind in VIBE kostenlos: Seedance Pro Fast, WAN 2.2, LTX 2 Fast, LTX 2 Distilled, Seedance, Luma Ray Flash 2, Motion 2.0, PixVerse 6, PRUNA V, Grok Imagine und LTX 2.5 Fast. Für ihre Nutzung sind weder ein Konto noch eine Zahlung nötig.

Kann eines dieser Modelle Videos in 4K erzeugen?

Ja. LTX 2.5 Fast und LTX 2.3 Fast liefern echtes 4K. Die meisten anderen Flaggschiffe generieren 1080p — genau das, was YouTube, TikTok, Instagram und Anzeigenplattformen tatsächlich verlangen.

Welche KI-Video-Modelle erzeugen Ton?

Sora 2 und Sora 2 Pro erzeugen immer synchronen Ton, ebenso WAN 2.6 und 2.7, Happy Horse 1.1, Vidu Q3, Google Veo 3.1 Lite, LTX 2.5 Fast, Flux 3, Seedance 2.5 und PRUNA V. Bei Veo 3.1, Veo 3.1 Fast, Kling 3, Kling O3, Kling v2.6, LTX 2.3 Fast und Seedance 2.0 lässt sich Audio an- oder abschalten, was auch den Preis verändert.

Wie oft kommen neue KI-Modelle dazu?

Neue Modelle werden meist innerhalb weniger Tage nach ihrem Release ergänzt, und diese Seite wird dann aktualisiert. Zuletzt kamen unter anderem Seedance 2.5, LTX 2.5 Fast, Flux 3, Kling 3, WAN 2.7 und Grok Imagine 1.5 dazu.

Alle Modelle in einer App

Lade VIBE kostenlos für iOS und Android. Starte mit den kostenlosen Modellen — ohne Konto — und schalte die Flaggschiffe frei, wenn du sie brauchst.

Download VIBE AI Video Generator on the App StoreGet VIBE AI Video Generator on Google Play

Kostenlose Modelle inklusive · Kein Konto nötig