Saltar al contenido principal
Tendencias y tutoriales9 min de lectura

Cómo escribir prompts para video IA que realmente funcionan (con ejemplos)

Los prompts para video IA son las instrucciones escritas que le dicen a un modelo qué generar — con la estructura correcta, un modelo como Veo 3.1 Fast convierte una frase en un clip usable. Aquí la fórmula, el vocabulario y cuatro ejemplos listos para copiar.

Vincent Park

Escrito por Vincent Park

Publicado el

Compartir este artículo
Un creador escribe prompts para video IA en su teléfono en un escritorio de noche, la pantalla ilumina su rostro

Los prompts para video IA son las instrucciones escritas — sujeto, acción, cámara, luz y duración — que le dicen exactamente a un modelo de texto a video o de imagen a video qué generar. Con la fórmula correcta, un modelo como Veo 3.1 Fast o Kling 3 Pro convierte una sola frase en un clip usable al primer intento; si es vago, el modelo adivina, y terminas gastando generaciones en resultados que nadie puede usar. Esta guía explica la anatomía de un prompt que funciona, el vocabulario de cámara y luz que realmente cambia la toma, y ejemplos listos para copiar para cuatro modelos de VIBE.

En una frase

Los prompts para video IA son instrucciones de texto estructuradas — quién o qué aparece en cuadro, qué hace, cómo se mueve la cámara y cómo está iluminada la escena — escritas para que un modelo de generación de video las convierta en un clip coherente y usable en una sola pasada.

¿Qué son los prompts para video IA?

Un prompt escrito es el único volante que te da un modelo de texto a video o de imagen a video. A diferencia de un prompt de imagen, un prompt para video IA debe describir un cambio en el tiempo — qué se mueve, cómo se mueve la cámara y cuánto dura la toma — no solo el aspecto de un único fotograma. Un prompt de imagen a video es aún más corto: la foto ya fija el sujeto y el escenario, así que el prompt solo necesita describir la acción y el movimiento de cámara que quieres añadir. Los modelos premium de VIBE (Veo 3.1 Fast, Kling 3 Pro, Sora 2 Pro) y los gratuitos (Seedance Pro Fast, Wan 2.6, PixVerse) leen todos la misma estructura básica, pero la ponderan de forma distinta — algunos se apoyan más en tu lenguaje de cámara, otros infieren el movimiento sobre todo del verbo de acción. Nuestra guía completa de apps generadoras de video IA explica cómo elegir un modelo; esta guía explica qué escribir una vez elegido.

Primer plano de manos escribiendo un prompt para video IA en un teléfono, luz cálida de una lámpara de escritorio de fondo
El cuadro de prompt es el único volante que tienes — las palabras precisas cambian la toma mucho más que las largas.

La anatomía de un gran prompt para video IA

Todo prompt que sobrevive al contacto con un modelo de video se descompone en las mismas cinco partes, más o menos en este orden. Si te saltas una, el modelo rellena el hueco por su cuenta — normalmente con algo genérico.

  • Sujeto — quién o qué aparece en cuadro, descrito como lo haría un director de casting: edad, ropa, expresión, un detalle distintivo.
  • Acción — una frase verbal clara por toma. 'Camina hacia la cámara, luego se gira y sonríe' funciona; 'hace un montón de cosas geniales' no.
  • Cámara — el tipo de plano y cualquier movimiento: plano general, primer plano medio, travelling lento de acercamiento, toma en mano con seguimiento.
  • Luz y color — la calidad de la luz (luz suave de ventana, sol duro de mediodía, letreros de neón) más dos o tres anclas de paleta (ámbar, verde azulado, marrón cálido).
  • Duración y estilo — cuántos segundos dura el clip y el registro visual: cinematográfico, documental, anime, fotografía de producto.
Pruébalo en VIBEVeo 3.1 Fast

Plano general amplio, a la altura de los ojos: una mujer con impermeable amarillo camina con paso rápido por un paso de peatones urbano mojado por la lluvia al atardecer, los letreros de neón se reflejan en los charcos, luego levanta la vista y sonríe. Luz suave azul y ámbar, 8 segundos, cinematográfico.

Palabras de cámara y luz que cambian la toma

La mayoría de los prompts fallidos son fallos de vocabulario, no de idea — el concepto estaba bien, pero las palabras para describirlo eran demasiado vagas para actuar. Estos son los términos que realmente marcan la diferencia:

  • Plano general amplio — establece la escena antes de cortar a un plano más cerrado, y se lee como un encuadre intencional, no accidental.
  • Primer plano medio, ligero ángulo desde atrás — una forma natural de presentar a una persona sin una mirada frontal directa.
  • Travelling lento de acercamiento / push-in lento — genera tensión sin ningún movimiento del sujeto.
  • Toma en mano con seguimiento — añade ese pequeño temblor humano que se lee como documental o estilo UGC.
  • Contraluz de hora dorada — un borde cálido alrededor del sujeto sobre un fondo más oscuro; se ve costoso en casi cualquier modelo.
  • Luz suave de ventana con relleno cálido de lámpara, borde frío desde el pasillo — superponer dos fuentes de luz en vez de una es lo que separa un clip plano de uno bien iluminado.
Un creador filma al aire libre en la hora dorada, sosteniendo el teléfono firme con ambas manos como un pequeño estabilizador
Nombra el plano y el movimiento — 'travelling lento de acercamiento' hace más que 'trabajo de cámara cinematográfico'.
Pruébalo en VIBEKling 3 Pro

Travelling lento de acercamiento hacia una barista que vaporiza leche detrás de un mostrador, relleno cálido de lámpara, luz azul fría desde el ventanal de la calle detrás de ella, el vapor captura la luz. Ella levanta la vista y esboza una media sonrisa hacia la cámara. 12 segundos, micro-movimiento en mano.

¿Cómo convierten las herramientas de video IA un prompt en un clip?

En septiembre de 2026, todo modelo de video de consumo importante — Veo 3.1 Fast, Kling 3 Pro, Sora 2 Pro y las familias abiertas Wan y Seedance — es un modelo de difusión entrenado con millones de pares de video y descripción, la técnica descrita por primera vez en Video Diffusion Models, un artículo de Google Research de 2022. El modelo parte de ruido y lo va eliminando, fotograma a fotograma, hacia lo que describe tu texto; tu prompt es la única señal que tiene de cómo se ve lo 'correcto'. Por eso los sustantivos y verbos concretos superan a adjetivos como 'increíble' o 'alta calidad' — el modelo no tiene nada visual hacia lo que orientarse con una palabra así.

  1. Elige un modelo según la toma: Veo 3.1 Fast y Kling 3 Pro para audio nativo y movimiento de cámara, Sora 2 Pro para tomas cinematográficas más largas, Seedance Pro Fast o Wan 2.6 para probar un prompt gratis antes de gastar un crédito premium.
  2. Escribe el prompt siguiendo la fórmula sujeto–acción–cámara–luz–duración de arriba, en ese orden.
  3. Genera y mira el resultado a velocidad normal y fotograma a fotograma — la mayoría de los problemas de continuidad solo se notan a cámara lenta.
  4. Cambia una sola variable a la vez. Si el movimiento está mal, edita la frase de acción; si el ambiente está mal, edita la luz. Cambiarlo todo a la vez hace imposible saber qué arregló la toma.
  5. Exporta con la relación de aspecto que espera tu plataforma — 9:16 para TikTok y Reels, 16:9 para YouTube — antes de publicar.

Veo 3.1 Fast vs Kling 3 Pro vs Sora 2 Pro: qué escribir para cada uno

La fórmula de cinco partes se mantiene igual, pero cada modelo premia un énfasis ligeramente distinto. Así se comparan los modelos de video de VIBE cuando escribes a favor de sus puntos fuertes:

ModeloIdeal para escribirDuración máx. en VIBEAudio nativoImagen a video
Veo 3.1 FastEscenas cortas guiadas por audio — diálogo o ambiente8 segundosNo
Kling 3 ProTomas más largas con movimiento de cámara deliberado15 segundos
Sora 2 ProContinuidad cinematográfica en una toma más larga12 segundosNoNo
Seedance Pro FastIteración rápida y gratuita de un prompt antes de subir de nivel8 segundosNo

La propia guía de prompts de Sora 2 de OpenAI recomienda separar la descripción de la escena, la dirección de cámara y la acción en frases distintas en lugar de una sola línea, y la página del modelo Veo de Google DeepMind muestra el mismo patrón — una descripción concreta y sencilla supera a los adjetivos apilados en ambos modelos. La misma estructura funciona en VIBE para Kling 3 Pro y Sora 2 Pro.

Pruébalo en VIBESora 2 Pro

Plano general estático, hora dorada: una azotea urbana vacía con luces de cadena que se balancean suavemente con el viento, el horizonte suavemente desenfocado detrás. Un farolillo de papel cruza el cuadro en los últimos dos segundos. Sin diálogo, solo sonido de viento ambiente. 12 segundos, grano de película, paleta ámbar cálida.

Errores comunes en los prompts para video IA

El mismo puñado de errores explica la mayoría de las generaciones desperdiciadas:

  • Apilar adjetivos en vez de ser específico. 'Video hermoso, increíble, espectacular' no le da al modelo nada hacia lo que orientarse — sustituye cada adjetivo por un detalle visible.
  • Dos acciones en una sola cláusula. 'Corre, luego salta, luego saluda' pide tres tomas en una sola toma. Elige la única acción para la que el clip realmente tiene tiempo.
  • Sin instrucción de cámara. Si omites la cámara, la mayoría de los modelos usan por defecto un plano medio estático — a veces está bien, pero renuncias a control.
  • Duración y acción contradictorias. Una toma de 8 segundos no puede contener una conversación entera. Ajusta la acción a los segundos que estás generando.
  • Cambiar cinco cosas a la vez cuando un resultado casi funciona. Así no puedes saber qué edición arregló — o rompió — la toma, y terminas adivinando en vez de iterar.
Dos amigos en un sofá viendo un video juntos en un teléfono, riendo, luz cálida de lámpara
Un prompt que funciona se lee como una lista de tomas, no como una lista de deseos.

¿Con qué modelo empezar gratis?

No necesitas un crédito premium para aprender esta fórmula. Seedance Pro Fast, Wan 2.6 y PixVerse son gratuitos en VIBE, sin necesidad de cuenta, y leen la misma estructura sujeto–acción–cámara–luz que los modelos premium — así que es el lugar más barato para fallar rápido y aprender qué hace realmente tu redacción antes de gastar un crédito de Veo 3.1 Fast o Kling 3 Pro. Cada modelo aparece con su costo en créditos y su nivel en la lista de modelos de VIBE, y la guía completa de apps generadoras de video IA profundiza en gratis frente a pago. Si a continuación quieres vocabulario específico de estilo — trazo de anime, cel-shading, gradación cinematográfica — consulta nuestra guía del generador de video anime IA.

Gratis para probarSeedance Pro Fast

Plano medio, a la altura de los ojos: un cachorro de golden retriever persigue una pelota de tenis que rueda por el césped soleado de un jardín, las orejas ondeando. Sol brillante de mediodía, poca profundidad de campo, 6 segundos.

El escritorio de un creador con un teléfono en un pequeño soporte, un cuaderno en blanco, un bolígrafo y una taza de café con luz de mañana
Lleva una nota de qué frases funcionaron en qué modelo — la fórmula es constante, pero tu propia abreviatura te hace más rápido.

Preguntas frecuentes

¿Cuál es la mejor fórmula para los prompts para video IA?

Sujeto, acción, cámara, luz y duración, escritos en ese orden: describe quién o qué aparece en cuadro, lo único que hace, cómo está encuadrada o se mueve la cámara, cómo está iluminada la escena y cuántos segundos debe durar el clip. Esta estructura funciona tanto en los modelos premium como en los gratuitos de VIBE.

¿Qué tan largo debe ser un prompt para video IA?

Por lo general basta con una a tres frases. Un prompt que ocupa un párrafo entero suele enterrar la única acción y el único movimiento de cámara que un modelo puede ejecutar realmente en un clip de 8 a 15 segundos — limita cada frase a una sola instrucción visible en vez de una descripción de escena completa.

¿Necesito prompts distintos para Veo 3.1 Fast, Kling 3 Pro y Sora 2 Pro?

La misma estructura sujeto-acción-cámara-luz funciona para los tres, pero pondérala según la fortaleza de cada modelo: apóyate en pistas sonoras para Veo 3.1 Fast y Kling 3 Pro, ya que ambos generan audio nativo en VIBE, y en el detalle de cámara y luz para Sora 2 Pro, que no genera audio.

¿Puedo escribir prompts para video IA gratis?

Sí. Seedance Pro Fast, Wan 2.6 y PixVerse son gratuitos en VIBE sin necesidad de cuenta, y leen la misma fórmula sujeto-acción-cámara-luz que los modelos premium, así que puedes aprender qué efecto tiene tu redacción antes de gastar un crédito premium en Veo 3.1 Fast, Kling 3 Pro o Sora 2 Pro.

¿Por qué mi generador de video IA ignora parte de mi prompt?

Normalmente porque el prompt pide más de lo que permite la duración del clip, o apila dos acciones en una frase. Ajusta una sola acción a los segundos que estás generando, y si un detalle sigue desapareciendo, muévelo antes en la frase para que tenga más peso.

¿Qué palabras de cámara funcionan de verdad en los prompts para video IA?

Tipos de plano y movimientos concretos: plano general, primer plano medio, travelling lento de acercamiento, toma en mano con seguimiento. Una dirección vaga como 'trabajo de cámara cinematográfico' es mucho menos fiable que nombrar el plano y el movimiento reales que quieres que el modelo genere.

  • #aivideoprompts
  • #howtowriteaivideoprompts
  • #texttovideoprompts
  • #aivideopromptexamples
Compartir este artículo
VIBE - Generador de Video IA

Empieza a Crear Videos IA Hoy

Descarga VIBE gratis en iOS y Android. Sin necesidad de iniciar sesión. Accede a más de 10 modelos de video IA y genera videos a partir de prompts de texto o imágenes.