Cómo creo videos con IA y cómo automatizo todo con agentes
Producir un video con IA no consiste en pedirle un clip a un modelo. Consiste en encadenar decisiones: un personaje que se mantenga igual en todas las escenas, imágenes coherentes, prompts cinematográficos precisos, audio sincronizado y un montaje que se sienta intencional.
Esta guía recorre mi flujo en seis escenas y termina donde empieza lo interesante: cómo delegar cada etapa a agentes de IA para que el proceso se ejecute prácticamente solo.
El personaje consistente
baseEl personaje es el activo más valioso del proyecto. Si cambia de cara entre escenas, el video pierde credibilidad de inmediato.
- Escribo una biblia de personaje: un párrafo fijo con los rasgos inmutables. No se improvisa nunca; se copia y pega igual en todos los prompts.
- Genero una hoja de referencia: 4–6 imágenes en frontal, ambos perfiles, tres cuartos y plano medio, con luz neutra y fondo liso.
- Fijo la semilla (seed) para que las variaciones no alteren la identidad.
- Uso las referencias como entrada en las herramientas que aceptan imagen de origen, en vez de volver a describir la cara con palabras.
Mariana, mujer latina de 32 años, rostro ovalado, piel morena clara, ojos color avellana ligeramente rasgados, cejas gruesas, cabello negro ondulado a la altura del hombro con raya al centro, lunar pequeño bajo el ojo derecho, complexión atlética. Viste chaqueta de mezclilla azul desgastada sobre camiseta blanca lisa. Expresión serena, mirada directa.
Para que no se rompa
- Un solo personaje por prompt. Dos personas multiplican los errores.
- Misma lente y misma distancia (ej. 50 mm siempre) para que el rostro no se deforme.
- Carpeta canon: solo los mejores renders sirven de referencia; el resto se descarta.
- Cambia el entorno y la luz, nunca la descripción física.
- Revisa siempre tres puntos de fallo: ojos, orejas y manos.
Las imágenes de cada escena
1 keyframe / escenaPrimero convierto el guion en un storyboard textual: cada escena con locación, acción, encuadre y emoción. Luego genero un fotograma clave por escena.
Mariana, mujer latina de 32 años, rostro ovalado, piel morena clara, ojos avellana, cabello negro ondulado al hombro, lunar bajo el ojo derecho, chaqueta de mezclilla azul sobre camiseta blanca. Está de pie junto a una ventana empañada de un café vacío, sosteniendo una taza con ambas manos. Plano medio, ligeramente a tres cuartos. Luz natural fría entrando desde la izquierda, sombras suaves. Fotografía cinematográfica, lente 50 mm, f/2.0, grano fino, paleta azul apagada. Formato 16:9.
Genero cuatro variantes por escena y me quedo con una. Si ninguna respeta al personaje, no ajusto el texto: vuelvo a la referencia visual.
Prompts cinematográficos para Flow AI
8 s máx.Un prompt de video no es una descripción: es una instrucción de dirección. La diferencia entre un clip amateur y uno cinematográfico está en especificar el movimiento de cámara y el tiempo de la acción.
Plantilla de seis capas
- Sujeto — quién, con la ficha o la imagen de referencia.
- Acción — un solo verbo, ejecutable en 5–8 segundos.
- Cámara — plano y movimiento: dolly in, pan, tracking, estático.
- Entorno — locación y detalles atmosféricos.
- Luz y óptica — fuente, hora del día, lente, profundidad de campo.
- Estilo y ritmo — referencia visual, paleta, velocidad.
Plano medio de Mariana junto a la ventana empañada de un café vacío. Deja lentamente la taza sobre la mesa y gira la cabeza hacia la ventana. Cámara: dolly in muy lento hacia su rostro, terminando en primer plano. Luz natural fría desde la izquierda, atmósfera de mañana lluviosa, gotas resbalando en el cristal. Lente 50 mm, f/2.0, profundidad de campo reducida, fondo desenfocado. Estética cinematográfica contemporánea, paleta azul apagada, ritmo pausado. 8 segundos, 16:9, 24 fps.
Errores que aprendí a evitar
- Encadenar tres acciones en un clip: el modelo las comprime y todo se ve acelerado.
- Movimientos de cámara contradictorios (zoom out + dolly in).
- Prompts poéticos sin datos técnicos: «hermoso y emotivo» no produce nada consistente.
- Escenas de más de 8–10 segundos. Divide y une en edición.
Audio y sincronización labial
manda el audio- Guion de voz por escena, con marcas de pausa. La duración del audio define la duración del clip, no al revés.
- Voz sintética clonada o de catálogo, siempre la misma para el personaje. Ajusto velocidad y énfasis hasta que suene natural.
- Lip sync: envío clip y audio a la herramienta de sincronización. Funciona mucho mejor en planos medios y primeros planos frontales que en generales o perfiles.
- Capas sonoras: música a −18 dB respecto a la voz, ambiente (lluvia, café, calle) y efectos puntuales. El ambiente es lo que hace creíble una escena generada.
El montaje final
un LUT para todo- Ensamblo por audio: coloco primero la locución completa y encajo los clips encima. El ritmo lo marca la narración.
- Continuidad: verifico que la dirección de la luz y el vestuario no salten entre escenas.
- Transiciones: corte directo por defecto. Fundidos solo para saltos de tiempo.
- Color: un único LUT para todo el proyecto. Unifica clips generados en sesiones distintas y disimula variaciones del personaje.
- Exportación: 16:9 para YouTube; recorte a 9:16 con reencuadre del sujeto para TikTok, Reels y Shorts.
Los agentes que lo hacen solo
9 rolesUn agente no es un prompt largo: es un rol con objetivo, herramientas, entradas, salidas y criterios de calidad. Divido el pipeline en especialistas y los encadeno. Cada uno entrega un archivo estructurado que el siguiente consume.
| Agente | Función | Entrada → salida |
|---|---|---|
| Investigador | Busca tendencias, datos y ángulos del tema | tema → informe |
| Guionista | Escribe gancho, desarrollo y cierre | informe → guion |
| Dir. de arte | Genera prompts de imagen con la ficha de personaje | guion → prompts |
| Imágenes | Produce keyframes y descarta los fallidos | prompts → canon |
| Prompt eng. | Convierte cada escena en prompt cinematográfico | escena → prompt |
| Productor | Genera clips y valida duración y encuadre | prompts → clips |
| Editor | Ensambla, sincroniza, aplica LUT y exporta | clips → master |
| Publicador | Redacta copies, hashtags y programa | master → posts |
| Analista | Lee métricas y propone ajustes | métricas → notas |
Cómo los orquesto
- Estado compartido: una carpeta del proyecto donde viven la ficha de personaje, el guion y los assets. Todos leen de ahí.
- Contratos estrictos: cada agente devuelve un esquema fijo. Si el formato falla, se reintenta automáticamente.
- Puntos de control humano: apruebo el guion y el corte final. El resto corre solo.
- Disparador: un cron semanal o un webhook lanza al Investigador y la cadena avanza sola.
Eres guionista de video corto. Recibes un informe de investigación en JSON. Escribe un guion de 60 segundos dividido en 8 escenas. Cada escena incluye: id, locacion, accion (un solo verbo), encuadre, emocion y locucion (máximo 18 palabras). La escena 1 debe abrir con un gancho de menos de 3 segundos. Devuelve únicamente JSON válido, sin texto adicional.
Lo que la IA reemplaza de verdad
La IA no reemplaza el criterio creativo: reemplaza la repetición. Escribir el mismo tipo de prompt cuarenta veces, renombrar archivos, recortar a 9:16, redactar el copy, programar la publicación. Todas son tareas deterministas, y todo lo determinista es automatizable.
Lo que queda del lado humano es lo que decide si un video funciona: qué historia vale la pena contar, qué personaje merece existir y qué se corta. Los agentes ejecutan; tú diriges.
Y una recomendación práctica: no automatices las nueve etapas el primer día. Automatiza una, mídela dos semanas y solo entonces añade la siguiente. Un pipeline construido paso a paso resiste; uno construido de golpe se rompe en la primera escena inconsistente.