Modelos de video en 2026: de la demo al anuncio
En un año, OpenAI cerró Sora, Google pasó de Veo a Gemini Omni y los modelos de Alibaba, MiniMax y ByteDance llegaron a la cima de los rankings. Esto es lo que ya sirve para una marca, lo que todavía no, cuánto cuesta y cómo se etiqueta en Europa.
A septiembre de 2026, el video generativo para marcas se reparte entre Gemini Omni Flash y Veo 3.1 de Google, Kling 3.0, Seedance, Wan 3.0, MiniMax H3, Runway, Luma y FLUX 3, con precios de lista de USD 0,05 a 0,80 por segundo y tomas de 3 a 30 segundos. OpenAI salió del mercado: la API de Sora se apagó el 24 de septiembre.
Sirve para spots cortos, piezas sociales, previsualización y bucles de DOOH; todavía no para continuidad larga, activos exactos de marca ni rostros sin autorización limpia. Desde el 2 de agosto de 2026, quien publica un deepfake en la UE debe señalarlo desde la primera exposición.
El panorama verificado a septiembre de 2026
Modelos con especificaciones y precios confirmados en la documentación de cada proveedor.
| Modelo (proveedor) | Duración por generación | Resolución máx. | Audio nativo | Acceso | USD por segundo |
|---|---|---|---|---|---|
| Gemini Omni Flash (Google) | 3 a 10 s, extensible a 40 s | 4K (escalado) | Sí | API de Gemini, Google Cloud, Flow | 0,10 (720p) a 0,30 (4K), aprox. |
| Veo 3.1, Fast y Lite (Google) | 4, 6 u 8 s, extensible a 148 s | 4K (Lite: 1080p) | Sí; sin audio, más barato en Google Cloud | API de Gemini, Google Cloud, Flow | 0,40 (4K: 0,60); Fast 0,10 a 0,30; Lite 0,05 a 0,08 |
| Kling 3.0 (Kuaishou) | 3 a 15 s | 4K | Sí | App y API | 0,084 a 0,168; 4K: 0,42 |
| Seedance 2.0 y 2.5 (ByteDance) | 4 a 15 s (2.0); 4 a 30 s (2.5) | 4K (2.0); 1080p (2.5) | Sí | API de BytePlus | 2.0: 0,15 a 0,78; 2.5: 0,23 a 0,57 |
| Wan 3.0 (Alibaba) | Hasta 30 s | 1080p | Figura en rankings con audio | API de Model Studio | 0,05 (480p) a 0,20 (1080p) |
| MiniMax H3 | 4 a 15 s | 2K (regenerado) | Sí, estéreo | API y pesos abiertos con licencia comunitaria | 0,13 aprox. |
| Runway Gen-4.5 | No confirmada | No confirmada | Sí | App y API | 0,12 |
| Luma Ray3.2 | Hasta 20 s | 1080p HDR | No anunciado | App y API | 0,06 (720p) a 0,24 (1080p) |
| FLUX 3 (Black Forest Labs) | Hasta 20 s | 4K | Opcional, sin costo extra | API | 0,17 (HD) a 0,80 (4K) |
| LTX-2.5 (Lightricks) | No confirmada | 4K (escalado) | Sí | Pesos abiertos; gratis bajo USD 10 millones de ingresos | Tu cómputo |
| HunyuanVideo 1.5 (Tencent) | Unos 5 s | 720p (1080p con superresolución) | No | Pesos abiertos; la licencia excluye la UE | Tu cómputo |
Google ya recomienda Omni Flash como modelo por defecto y reserva Veo 3.1 para extender escenas o fijar el último cuadro. En los rankings de preferencia (Artificial Analysis el 26 de septiembre, Arena el 21), los primeros puestos son de Gemini Omni Flash, Wan 3.0, MiniMax H3 y Seedance 2.x; los líderes de 2025 (Kling, Runway Gen-4.5, Veo 3.1, Luma y Sora 2 Pro) quedaron a media tabla.
El cierre de Sora: una lección de riesgo de proveedor
OpenAI lanzó Sora 2 el 30 de septiembre de 2025 y lo abrió en su API una semana después. El 12 de marzo de 2026 amplió esa API (clips de 20 s, 1080p, personajes reutilizables) y doce días más tarde avisó que la retiraría. La app y la web cerraron el 26 de abril y la API se apagó el 24 de septiembre de 2026, sin reemplazo. Según TechCrunch, la app quemaba cerca de USD 1 millón diario en cómputo mientras sus usuarios caían por debajo de 500.000, y el acuerdo de USD 1.000 millones con Disney se cayó antes de que se moviera dinero.
- Flujo independiente del modelo: guion, storyboard, cuadros clave y prompts son tuyos; el motor de video debe poder cambiarse en días.
- Un segundo motor probado: valida al menos dos modelos con tus cuadros clave antes de comprometer un calendario de campaña.
Descarga y archiva cada toma aprobada el mismo día, con su prompt y su cuadro de origen. Google, por ejemplo, borra de sus servidores los videos de Veo a los dos días.
Qué funciona en producción y qué no
Los casos documentados dan la escala real. Para el anuncio de Kalshi emitido en las finales de la NBA de 2025, hecho sobre todo con Veo 3, su autor reportó entre 300 y 400 generaciones para 15 clips útiles, una persona, dos o tres días y unos USD 2.000. Coca-Cola usó cinco especialistas, más de 70.000 clips y unos 30 días para sus anuncios navideños de 2025, y Svedka dedicó unos cuatro meses a reconstruir un personaje para su spot del Super Bowl LX (8 de febrero de 2026).
Funciona hoy
- Spots cortos y piezas sociales montados con tomas de pocos segundos.
- Previsualización y animatics: AMC Networks acordó en 2025 usar Runway para previsualizar series.
- Variantes a escala: según Google, WPP usa Veo e Imagen para convertir una idea creativa en cientos o miles de versiones.
- Bucles para pantallas y fondos de experiencias en vivo.
Todavía no
- Continuidad larga: cada generación dura segundos, las extensiones de Veo bajan a 720p y un personaje estable exige semanas.
- Activos exactos de marca: logos, envases y textos legales se componen en posproducción.
- Rostros reales sin autorización limpia: los proveedores los bloquean o restringen, sobre todo en Europa.
- Voz en francés sin prueba: Kling 3.0 habla inglés, chino, japonés, coreano y español, y Seedance 2.5 anuncia 11 idiomas, entre ellos español.
El riesgo principal es la recepción. Coca-Cola volvió a recibir críticas en 2025 y McDonald's Países Bajos retiró en cuatro días (del 6 al 10 de diciembre de 2025) un anuncio navideño hecho con IA. IAB mide la brecha: el 82 % de los ejecutivos publicitarios cree que a los consumidores jóvenes les gustan los anuncios con IA, frente al 45 % de esos consumidores.
Un flujo de producción en siete pasos
El que recomendamos en Slash, de la demo a la emisión.
- Guion: duración, formatos (16:9, 9:16), con o sin sonido, mercados, idiomas y qué debe ser real.
- Storyboard: planos de pocos segundos, porque ningún modelo verificado pasa de 30 s por generación.
- Cuadros clave aprobados: se generan con un modelo de imagen y referencias de producto; el cliente aprueba imágenes fijas, que cuestan centavos, antes de pagar video.
- Imagen a video: cada plano parte de su cuadro aprobado, con primer y último cuadro cuando el modelo lo permite, y varias tomas por plano.
- Edición: montaje, color y escalado en tu editor; logo, packshot y textos legales se componen encima.
- Sonido: el audio nativo sirve para maquetas; la mezcla final lleva música con licencia y voces con contrato.
- Cumplimiento: consentimientos, licencias, procedencia conservada, etiqueta según el mercado y masters archivados.
Los pasos 1 a 3 siguen el método de modelos de imagen en 2026, y el sonido lo tratamos en voz y audio con IA.
Cuánto cuesta: un cálculo ilustrativo
El precio por segundo importa menos que la tasa de tomas útiles.
Supuestos ilustrativos: un spot de 30 segundos con 10 planos; cada toma se genera en 8 s a 1080p y se conserva 1 de cada 20, la proporción que reportó el autor del anuncio de Kalshi. Total: 200 tomas y 1.600 segundos generados.
| Modelo y modo | USD por segundo | Costo de 1.600 s |
|---|---|---|
| Veo 3.1 Lite, 1080p | 0,08 | USD 128 |
| Veo 3.1 Fast, 1080p | 0,12 | USD 192 |
| Gemini Omni Flash, 1080p | 0,15 aprox. | USD 240 |
| Kling 3.0, 1080p con audio | 0,168 | USD 268,80 |
| Veo 3.1, 1080p sin audio (Google Cloud) | 0,20 | USD 320 |
| Wan 3.0, 1080p | 0,20 | USD 320 |
| Seedance 2.0, 1080p | 0,37 | USD 592 |
| Veo 3.1, 1080p con audio | 0,40 | USD 640 |
La factura de generación va de unos USD 130 a 640. El multiplicador que manda es la tasa de tomas útiles: si baja a la mitad, el costo se duplica. Y el trabajo humano domina: el anuncio de Kalshi costó unos USD 2.000 en total según su autor, y la producción navideña de McDonald's Países Bajos ocupó a unas 10 personas durante cinco semanas, según NBC. Para pantallas sin sonido, Veo 3.1 sin audio en Google Cloud cuesta la mitad.
Rostros, voces y consentimiento
Los proveedores ya limitan a las personas reales, y más en Europa. En la UE, el Reino Unido, Suiza y Oriente Medio y el Norte de África, Veo solo genera personas adultas. Gemini Omni Flash no permite editar videos subidos en el Espacio Económico Europeo, Suiza y el Reino Unido, restringe allí las imágenes con menores e impide que ciertas personas reconocibles aparezcan en imágenes subidas.
La ley va en la misma dirección. En Colombia, la Ley 2502 de 2025 agrava la suplantación hecha con IA y la Ley 1581 exige autorización para tratar datos personales, entre ellos la imagen de una persona; en Francia, la publicidad de influencia con rostros generados lleva la mención Images virtuelles. Para actores y embajadores, el contrato debe nombrar el uso con IA, los medios, los territorios, la duración y el pago; para el público de una activación, un consentimiento explícito y una política de borrado. Más sobre el riesgo de suplantación en fraude con deepfakes.
Artículo 50: cómo etiquetar un video en la UE
Desde el 2 de agosto de 2026, quien publica un deepfake en la UE debe revelarlo de forma clara y a más tardar en la primera exposición (artículo 50, apartados 4 y 5). El AI Act llama deepfake al contenido que se parece a personas, objetos, lugares, entidades o sucesos existentes y podría pasar por auténtico (artículo 3, punto 60): un video fotorrealista de un producto real en una ciudad real puede entrar. Los proveedores, por su parte, deben marcar sus salidas de forma legible por máquina; Veo y Omni llevan SynthID en cada clip.
El código de buenas prácticas del 10 de junio de 2026 lo baja a la práctica: un icono o etiqueta perceptible en la primera exposición sin acción del usuario, por ejemplo arriba a la derecha, y en video, al inicio y a intervalos regulares, tanto en línea como fuera de línea. Las obras evidentemente artísticas o de ficción pueden llevarlo en notas o créditos, siempre que se perciba en la primera exposición. La Comisión publicó el 24 de septiembre iconos opcionales en SVG y PNG.
Aplica también a agencias de fuera de la UE cuando el video se difunde en la Unión (artículo 2), con multas de hasta 15 millones de euros o el 3 % de la facturación mundial. Detalle en derechos y procedencia del contenido con IA.
Ante la duda, etiqueta. En el estudio de IAB de enero de 2026, el 89 % de los anunciantes que usan IA generativa dice revelarlo, pero menos de la mitad lo hace siempre; y el 73 % de los consumidores jóvenes encuestados en EE. UU. afirma que la revelación aumentaría o no cambiaría su intención de compra.
DOOH: lo que cambia en las pantallas de calle
Prácticas de producción que recomendamos, no estadísticas.
- Formatos: Veo 3.1 y Omni Flash solo entregan 16:9 o 9:16, y Seedance 2.0 va de 21:9 a 9:16. Para pantallas panorámicas o LED de medidas especiales, genera en el formato estándar más cercano y adapta en posproducción.
- Bucles: una pieza de calle se repite, así que el inicio y el final deben empalmar. El control de primer y último cuadro de Veo 3.1 ayuda, y Midjourney documenta bucles en su modelo de video.
- Sin sonido: la mayoría de las pantallas de calle no reproducen audio; no lo pagues. Veo 3.1 sin audio en Google Cloud y Kling 3.0 sin audio cuestan menos.
- Legibilidad: movimiento lento, alto contraste y textos grandes compuestos en posproducción, para un público que mira pocos segundos y a distancia.
- Especificaciones del operador: resolución, cuadros por segundo, códec, duración del espacio y política de contenidos cambian según la red; pídelas antes de generar.
- Etiqueta: el código exige la señal también fuera de línea; en un bucle corto, lo más simple es un icono fijo durante toda la pieza.
Es el enfoque que recomendamos para DOOH. Para activaciones con público, ver experiencias de marca con IA generativa.
Lo esencial
- Google recomienda Gemini Omni Flash como modelo de video por defecto; Wan 3.0, MiniMax H3 y Seedance comparten con él la cima de los rankings.
- Sora cerró (app el 26 de abril, API el 24 de septiembre de 2026): archiva tus masters y ten un segundo motor probado.
- Funciona en spots cortos, social, previsualización y bucles; la continuidad larga, los logos y los rostros reales siguen siendo trabajo humano.
- En nuestro ejemplo ilustrativo, generar un spot de 30 s cuesta de USD 128 a 640; la tasa de tomas útiles y las horas humanas mandan.
- En la UE, un deepfake se señala en la primera exposición y, en video, al inicio y a intervalos; en DOOH, un icono fijo es lo más simple.
Fuentes
- Generate videos with Veo 3.1
- Gemini Omni Flash video generation
- Gemini Developer API pricing
- Deprecations (Videos API and Sora 2)
- Why OpenAI really shut down Sora
- Kling API pricing
- ModelArk pricing (Seedance)
- Wan 3.0: 30-second AI video generation from any input
- Text-to-video leaderboard
- Kalshi airs AI-generated ad during NBA Finals using Google's Veo 3
- Code of Practice on transparency of AI-generated content (final text)
- The AI Ad Gap Widens
Nota editorial: este análisis refleja la información pública disponible en la fecha de revisión. Modelos, precios y normas cambian rápido; cada dato de terceros enlaza a su fuente y nuestras opiniones se presentan como tales. ¿Ves un error? Escríbenos a contact@slash-digital.io.
Las preguntas que escuchamos a menudo
¿Cuál es el mejor modelo de video con IA en 2026?
A 26 de septiembre de 2026, Gemini Omni Flash, Wan 3.0, MiniMax H3 y Seedance 2.x encabezan los rankings de preferencia. Para una marca cuentan además la licencia, el audio, los idiomas y las reglas sobre personas: pruébalos con tus cuadros clave.
¿Qué pasó con Sora?
OpenAI cerró la app y la web de Sora el 26 de abril de 2026 y apagó la API (sora-2 y sora-2-pro) el 24 de septiembre de 2026, sin reemplazo.
¿Cuánto cuesta un segundo de video generado?
Entre USD 0,05 (Veo 3.1 Lite en 720p) y 0,80 (FLUX 3 en 4K) según los precios de lista de septiembre de 2026. Multiplícalo por las tomas descartadas: con una toma útil de cada 20, la factura se multiplica por 20.
¿Hay que etiquetar un anuncio hecho con IA?
En la UE sí, desde el 2 de agosto de 2026, si es un deepfake: contenido que se parece a personas, objetos, lugares o sucesos reales y podría pasar por auténtico. Las obras evidentemente creativas tienen un régimen más ligero, no una exención.
¿Sirve el video generativo para pantallas DOOH?
Sí, para bucles cortos sin sonido en 16:9 o 9:16, con textos y logos compuestos en posproducción. Pide antes las especificaciones del operador y prevé el icono de IA si la pieza se difunde en la UE.
Más análisis para seguir
Modelos de imagen en 2026: cuál usar para trabajo de marca
Nano Banana 2 y Pro, GPT Image 2.5, Qwen-Image: qué modelo usar para piezas de marca, cuánto cuesta cada imagen y qué exige el AI Act desde agosto de 2026.
Imagen, video y audioIA generativa en experiencias de marca y DOOH: lo que funciona en vivo
Fotomatones con IA, face swap y pantallas DOOH: latencia, moderación, consentimiento biométrico, etiquetado del AI Act y cómo medir una activación en vivo.
Imagen, video y audioDerechos y procedencia del contenido con IA
¿De quién es lo que genera la IA? Demandas y acuerdos, indemnidades de proveedores, imagen y voz, artículo 50 del AI Act, C2PA, SynthID y una política para marcas.
¿Y después de esto?
Pongámoslo en producción
Cuéntanos tu reto. Respondemos en menos de 24 horas laborales con una primera lectura honesta: si podemos ayudarte, te diremos cómo; si no, te diremos quién puede.
Contesto personalmente. Sin formularios eternos ni respuestas automáticas.