Modèles vidéo en 2026 : de la démo à la publicité
En un an, OpenAI a fermé Sora, Google est passé de Veo à Gemini Omni et les modèles d'Alibaba, MiniMax et ByteDance ont atteint le haut des classements. Voici ce qui fonctionne déjà pour une marque, ce qui ne fonctionne pas encore, ce que cela coûte et comment l'étiqueter en Europe.
En septembre 2026, la vidéo générative pour les marques se partage entre Gemini Omni Flash et Veo 3.1 de Google, Kling 3.0, Seedance, Wan 3.0, MiniMax H3, Runway, Luma et FLUX 3, à des prix catalogue de 0,05 $ à 0,80 $ par seconde, pour des plans de 3 à 30 secondes. OpenAI a quitté le marché : l'API Sora a été arrêtée le 24 septembre.
Elle fonctionne pour les spots courts, les contenus sociaux, la prévisualisation et les boucles DOOH ; pas encore pour la continuité longue, les éléments de marque exacts ou les visages sans autorisation en règle. Depuis le 2 août 2026, celui qui publie un deepfake dans l'UE doit le signaler dès la première exposition.
Le paysage vérifié en septembre 2026
Des modèles dont nous avons confirmé les caractéristiques et les prix dans la documentation de chaque éditeur.
| Modèle (éditeur) | Durée par génération | Résolution max. | Audio natif | Accès | Dollars par seconde |
|---|---|---|---|---|---|
| Gemini Omni Flash (Google) | 3 à 10 s, extensible à 40 s | 4K (mise à l'échelle) | Oui | API Gemini, Google Cloud, Flow | Environ 0,10 (720p) à 0,30 (4K) |
| Veo 3.1, Fast et Lite (Google) | 4, 6 ou 8 s, extensible à 148 s | 4K (Lite : 1080p) | Oui ; sans audio, moins cher sur Google Cloud | API Gemini, Google Cloud, Flow | 0,40 (4K : 0,60) ; Fast 0,10 à 0,30 ; Lite 0,05 à 0,08 |
| Kling 3.0 (Kuaishou) | 3 à 15 s | 4K | Oui | App et API | 0,084 à 0,168 ; 4K : 0,42 |
| Seedance 2.0 et 2.5 (ByteDance) | 4 à 15 s (2.0) ; 4 à 30 s (2.5) | 4K (2.0) ; 1080p (2.5) | Oui | API BytePlus | 2.0 : 0,15 à 0,78 ; 2.5 : 0,23 à 0,57 |
| Wan 3.0 (Alibaba) | Jusqu'à 30 s | 1080p | Classé dans les arènes avec audio | API Model Studio | 0,05 (480p) à 0,20 (1080p) |
| MiniMax H3 | 4 à 15 s | 2K (régénération) | Oui, stéréo | API et poids ouverts sous licence communautaire | Environ 0,13 |
| Runway Gen-4.5 | Non confirmée | Non confirmée | Oui | App et API | 0,12 |
| Luma Ray3.2 | Jusqu'à 20 s | 1080p HDR | Non annoncé | App et API | 0,06 (720p) à 0,24 (1080p) |
| FLUX 3 (Black Forest Labs) | Jusqu'à 20 s | 4K | En option, sans surcoût | API | 0,17 (HD) à 0,80 (4K) |
| LTX-2.5 (Lightricks) | Non confirmée | 4K (mise à l'échelle) | Oui | Poids ouverts ; gratuit sous 10 millions de dollars de CA | Votre calcul |
| HunyuanVideo 1.5 (Tencent) | Environ 5 s | 720p (1080p en super-résolution) | Non | Poids ouverts ; la licence exclut l'UE | Votre calcul |
Google recommande désormais Omni Flash comme modèle par défaut et réserve Veo 3.1 à l'extension de scènes ou au contrôle de la dernière image. Dans les classements de préférence (Artificial Analysis le 26 septembre, Arena le 21), les premières places reviennent à Gemini Omni Flash, Wan 3.0, MiniMax H3 et Seedance 2.x ; les leaders de 2025 (Kling, Runway Gen-4.5, Veo 3.1, Luma et Sora 2 Pro) sont en milieu de tableau.
La fin de Sora : une leçon sur le risque fournisseur
OpenAI a lancé Sora 2 le 30 septembre 2025 et l'a ouvert dans son API une semaine plus tard. Le 12 mars 2026, il a enrichi cette API (clips de 20 s, 1080p, personnages réutilisables), puis a annoncé son retrait douze jours plus tard. L'app et le site ont fermé le 26 avril et l'API a été arrêtée le 24 septembre 2026, sans remplaçant. Selon TechCrunch, l'app brûlait environ 1 million de dollars par jour en calcul alors que ses utilisateurs passaient sous les 500 000, et l'accord d'un milliard de dollars avec Disney est tombé avant tout versement.
- Une chaîne indépendante du modèle : script, storyboard, images clés et prompts vous appartiennent ; le moteur vidéo doit pouvoir changer en quelques jours.
- Un second moteur testé : validez au moins deux modèles sur vos images clés avant de vous engager sur un calendrier de campagne.
Téléchargez et archivez chaque prise validée le jour même, avec son prompt et son image source. Google, par exemple, supprime les vidéos Veo de ses serveurs au bout de deux jours.
Ce qui marche en production et ce qui ne marche pas
Les cas documentés donnent l'échelle réelle. Pour la publicité Kalshi diffusée pendant les finales NBA 2025, réalisée surtout avec Veo 3, son auteur a déclaré 300 à 400 générations pour 15 clips utilisables, une personne, deux à trois jours et environ 2 000 dollars. Coca-Cola a mobilisé cinq spécialistes, plus de 70 000 clips et une trentaine de jours pour ses publicités de Noël 2025, et Svedka a passé environ quatre mois à reconstruire un personnage pour son spot du Super Bowl LX (8 février 2026).
Ce qui marche aujourd'hui
- Spots courts et contenus sociaux montés à partir de plans de quelques secondes.
- Prévisualisation et animatiques : AMC Networks a accepté en 2025 d'utiliser Runway pour prévisualiser ses séries.
- Déclinaisons à grande échelle : selon Google, WPP utilise Veo et Imagen pour transformer une idée créative en centaines ou milliers de versions.
- Boucles pour écrans et fonds d'expériences en direct.
Pas encore
- Continuité longue : chaque génération dure quelques secondes, les extensions Veo retombent en 720p et un personnage stable demande des semaines.
- Éléments de marque exacts : logos, emballages et mentions légales se composent en post-production.
- Visages réels sans autorisation en règle : les éditeurs les bloquent ou les restreignent, surtout en Europe.
- Voix en français sans test : Kling 3.0 parle anglais, chinois, japonais, coréen et espagnol, et Seedance 2.5 annonce 11 langues, dont l'espagnol.
Le principal risque tient à la réception. Coca-Cola a de nouveau été critiqué en 2025 et McDonald's Pays-Bas a retiré en quatre jours (du 6 au 10 décembre 2025) une publicité de Noël réalisée avec l'IA. L'IAB mesure l'écart : 82 % des dirigeants publicitaires pensent que les jeunes consommateurs aiment les publicités faites avec l'IA, contre 45 % de ces consommateurs.
Une chaîne de production en sept étapes
Celle que nous recommandons chez Slash, de la démo à la diffusion.
- Script : durée, formats (16:9, 9:16), avec ou sans son, marchés, langues et ce qui doit être réel.
- Storyboard : des plans de quelques secondes, car aucun modèle vérifié ne dépasse 30 s par génération.
- Images clés validées : générées avec un modèle d'image et des références produit ; le client valide des images fixes, qui coûtent quelques centimes, avant de payer de la vidéo.
- Image vers vidéo : chaque plan part de son image validée, avec première et dernière image quand le modèle le permet, et plusieurs prises par plan.
- Montage : montage, étalonnage et mise à l'échelle dans votre logiciel ; logo, packshot et mentions légales se composent par-dessus.
- Son : l'audio natif suffit pour les maquettes ; le mixage final utilise de la musique sous licence et des voix sous contrat.
- Conformité : consentements, licences, provenance conservée, étiquetage adapté au marché et masters archivés.
Les étapes 1 à 3 suivent la méthode de modèles d'image en 2026, et le son est traité dans voix et audio par IA.
Ce que cela coûte : un calcul illustratif
Le prix à la seconde compte moins que le taux de prises utilisables.
Hypothèses illustratives : un spot de 30 secondes en 10 plans ; chaque prise est générée en 8 s et en 1080p, et l'on en garde 1 sur 20, le ratio déclaré par l'auteur de la publicité Kalshi. Total : 200 prises et 1 600 secondes générées.
| Modèle et mode | Dollars par seconde | Coût de 1 600 s |
|---|---|---|
| Veo 3.1 Lite, 1080p | 0,08 | 128 $ |
| Veo 3.1 Fast, 1080p | 0,12 | 192 $ |
| Gemini Omni Flash, 1080p | Environ 0,15 | 240 $ |
| Kling 3.0, 1080p avec audio | 0,168 | 268,80 $ |
| Veo 3.1, 1080p sans audio (Google Cloud) | 0,20 | 320 $ |
| Wan 3.0, 1080p | 0,20 | 320 $ |
| Seedance 2.0, 1080p | 0,37 | 592 $ |
| Veo 3.1, 1080p avec audio | 0,40 | 640 $ |
La facture de génération va d'environ 130 $ à 640 $. Le multiplicateur décisif est le taux de prises utilisables : s'il est divisé par deux, le coût double. Et le travail humain domine : la publicité Kalshi a coûté environ 2 000 $ au total selon son auteur, et la production de Noël de McDonald's Pays-Bas a occupé une dizaine de personnes pendant cinq semaines, selon NBC. Pour des écrans sans son, Veo 3.1 sans audio sur Google Cloud coûte moitié moins.
Visages, voix et consentement
Les éditeurs limitent déjà les personnes réelles, et davantage en Europe. Dans l'UE, au Royaume-Uni, en Suisse et dans la région Moyen-Orient et Afrique du Nord, Veo ne génère que des adultes. Gemini Omni Flash ne permet pas d'éditer des vidéos importées dans l'Espace économique européen, en Suisse et au Royaume-Uni, y restreint les images avec des mineurs et empêche certaines personnes reconnaissables d'apparaître dans les images importées.
Le droit va dans le même sens. En Colombie, la loi 2502 de 2025 aggrave l'usurpation d'identité commise avec l'IA et la loi 1581 exige une autorisation pour traiter des données personnelles, dont l'image d'une personne ; en France, la publicité d'influence montrant des visages générés porte la mention Images virtuelles. Pour les acteurs et ambassadeurs, le contrat doit nommer l'usage par IA, les médias, les territoires, la durée et la rémunération ; pour le public d'une activation, un consentement explicite et une politique de suppression. Plus sur le risque d'usurpation dans fraude aux deepfakes.
Article 50 : comment étiqueter une vidéo dans l'UE
Depuis le 2 août 2026, celui qui publie un deepfake dans l'UE doit le signaler clairement et au plus tard lors de la première exposition (article 50, paragraphes 4 et 5). L'AI Act qualifie de deepfake un contenu qui ressemble à des personnes, objets, lieux, entités ou événements existants et pourrait passer pour authentique (article 3, point 60) : une vidéo photoréaliste d'un vrai produit dans une vraie ville peut en relever. Les fournisseurs, eux, doivent marquer leurs sorties de façon lisible par machine ; Veo et Omni apposent SynthID sur chaque clip.
Le code de bonnes pratiques du 10 juin 2026 le rend concret : une icône ou une étiquette perceptible dès la première exposition sans action de l'utilisateur, par exemple en haut à droite, et pour la vidéo, au début et à intervalles réguliers, en ligne comme hors ligne. Les œuvres manifestement artistiques ou de fiction peuvent la placer dans des notes ou au générique, à condition qu'elle soit perceptible dès la première exposition. Le 24 septembre, la Commission a publié des icônes facultatives en SVG et PNG.
Cela vaut aussi pour les agences hors UE dès que la vidéo est diffusée dans l'Union (article 2), avec des amendes pouvant atteindre 15 millions d'euros ou 3 % du chiffre d'affaires mondial. Détails dans droits et provenance des contenus IA.
Dans le doute, étiquetez. Dans l'étude de l'IAB de janvier 2026, 89 % des annonceurs qui utilisent l'IA générative disent le signaler, mais moins de la moitié le font toujours ; et 73 % des jeunes consommateurs américains interrogés affirment que la mention augmenterait ou ne changerait pas leur intention d'achat.
DOOH : ce qui change sur les écrans urbains
Des pratiques de production que nous recommandons, pas des statistiques.
- Formats : Veo 3.1 et Omni Flash ne livrent que du 16:9 ou du 9:16, et Seedance 2.0 va du 21:9 au 9:16. Pour des écrans panoramiques ou des murs LED aux dimensions particulières, générez dans le format standard le plus proche et adaptez en post-production.
- Boucles : un visuel urbain tourne en boucle, le début et la fin doivent donc se raccorder. Le contrôle première et dernière image de Veo 3.1 aide, et Midjourney documente les boucles dans son modèle vidéo.
- Sans son : la plupart des écrans urbains ne diffusent pas d'audio ; ne le payez pas. Veo 3.1 sans audio sur Google Cloud et Kling 3.0 sans audio coûtent moins cher.
- Lisibilité : mouvements lents, fort contraste et textes de grande taille composés en post-production, pour un public qui regarde quelques secondes et de loin.
- Spécifications de l'opérateur : résolution, cadence, codec, durée du spot et politique de contenus varient selon le réseau ; demandez-les avant de générer.
- Étiquette : le code exige le signal hors ligne aussi ; dans une boucle courte, le plus simple est une icône présente pendant toute la durée.
C'est l'approche que nous recommandons pour le DOOH. Pour les activations avec public, voir expériences de marque et IA générative.
L'essentiel
- Google recommande Gemini Omni Flash comme modèle vidéo par défaut ; Wan 3.0, MiniMax H3 et Seedance partagent avec lui le haut des classements.
- Sora a fermé (app le 26 avril, API le 24 septembre 2026) : archivez vos masters et gardez un second moteur testé.
- Cela marche pour les spots courts, le social, la prévisualisation et les boucles ; la continuité longue, les logos et les visages réels restent un travail humain.
- Dans notre exemple illustratif, générer un spot de 30 s coûte de 128 $ à 640 $ ; le taux de prises utilisables et les heures humaines font le budget.
- Dans l'UE, un deepfake se signale dès la première exposition et, en vidéo, au début et à intervalles réguliers ; en DOOH, une icône fixe est le plus simple.
Sources
- Generate videos with Veo 3.1
- Gemini Omni Flash video generation
- Gemini Developer API pricing
- Deprecations (Videos API and Sora 2)
- Why OpenAI really shut down Sora
- Kling API pricing
- ModelArk pricing (Seedance)
- Wan 3.0: 30-second AI video generation from any input
- Text-to-video leaderboard
- Kalshi airs AI-generated ad during NBA Finals using Google's Veo 3
- Code of Practice on transparency of AI-generated content (final text)
- The AI Ad Gap Widens
Note éditoriale : cette analyse reflète les informations publiques disponibles à la date de révision. Modèles, prix et règles évoluent vite ; chaque donnée tierce renvoie à sa source et nos opinions sont présentées comme telles. Une erreur ? Écrivez à contact@slash-digital.io.
Les questions qu'on nous pose souvent
Quel est le meilleur modèle vidéo IA en 2026 ?
Au 26 septembre 2026, Gemini Omni Flash, Wan 3.0, MiniMax H3 et Seedance 2.x mènent les classements de préférence. Pour une marque, la licence, l'audio, les langues et les règles sur les personnes comptent aussi : testez-les sur vos images clés.
Qu'est devenu Sora ?
OpenAI a fermé l'app et le site Sora le 26 avril 2026 et arrêté l'API (sora-2 et sora-2-pro) le 24 septembre 2026, sans remplaçant.
Combien coûte une seconde de vidéo générée ?
Entre 0,05 $ (Veo 3.1 Lite en 720p) et 0,80 $ (FLUX 3 en 4K) aux prix catalogue de septembre 2026. Multipliez par les prises écartées : avec une prise utilisable sur 20, la facture est multipliée par 20.
Faut-il étiqueter une publicité faite avec l'IA ?
Dans l'UE, oui, depuis le 2 août 2026, s'il s'agit d'un deepfake : un contenu qui ressemble à des personnes, objets, lieux ou événements réels et pourrait passer pour authentique. Les œuvres manifestement créatives ont un régime allégé, pas une exemption.
La vidéo générative convient-elle aux écrans DOOH ?
Oui, pour des boucles courtes sans son en 16:9 ou 9:16, avec textes et logos composés en post-production. Demandez d'abord les spécifications de l'opérateur et prévoyez l'icône IA si le visuel est diffusé dans l'UE.
D'autres analyses à lire
Modèles d'image en 2026 : lequel choisir pour le travail de marque
Nano Banana 2 et Pro, GPT Image 2.5, Qwen-Image : quel modèle pour vos visuels de marque, combien coûte une image et ce qu'exige l'AI Act depuis août 2026.
Image, vidéo et audioIA générative dans les expériences de marque et le DOOH : ce qui marche en live
Photobooths IA, face swap et écrans DOOH : latence, modération, consentement biométrique, étiquetage AI Act et mesure d'une activation en live.
Image, vidéo et audioDroits et provenance des contenus IA
À qui appartient ce que produit l'IA ? Procès et accords, garanties des fournisseurs, image et voix, article 50 de l'AI Act, C2PA, SynthID et une politique pour les marques.
Et ensuite ?
Mettons-le en production
Racontez-nous votre défi. Nous répondons sous 24 heures ouvrées avec une première lecture honnête : si nous pouvons aider, nous dirons comment ; sinon, nous dirons qui peut.
Je réponds en personne. Pas de formulaires interminables ni de réponses automatiques.