Image, vidéo et audio · Septembre 2026

La voix devient une interface de production : quoi utiliser et quoi surveiller en 2026

Septembre 2026 a apporté GPT-Live-1, Gemini 3.8 Live, Gemini 3.8 Flash TTS et Suno v6, pendant que tribunaux et maisons de disques redessinent la musique générée utilisable. Ce guide fait le tri entre modèles, latences, prix et règles pour une équipe qui met la voix en production en espagnol et en français.

0,05 $/min GPT-Live-1, hors agent backend2 août 2026 l'article 50 de l'AI Act s'applique31 juil. 2026 jugement GEMA contre Suno à Munich
En bref

OpenAI a rendu GPT-Live-1 disponible pour tous le 10 septembre 2026 : un modèle qui écoute et parle en même temps et délègue le raisonnement à un agent backend, pour 0,05 $ la minute. Google a suivi avec Gemini 3.8 Live le 15 septembre et Gemini 3.8 Flash TTS le 22.

En musique, Suno a lancé v6 avec Warner, BMG et Believe, mais Sony et Universal l'ont attaqué en justice le 18 septembre, et un tribunal de Munich a donné tort à Suno pour s'être entraîné sur des œuvres de la GEMA. Notre lecture : choisissez l'architecture selon la latence et le contrôle, testez toujours dans votre espagnol et votre français, traitez le clonage de voix comme un risque juridique et de fraude, et annoncez dès la première seconde que l'interlocuteur est une IA.

Synthèse vocale (TTS) : offres commerciales et modèles ouverts

Ce qui est vérifié en septembre 2026, et ce que vous devez tester vous-même en espagnol et en français.

D'après la documentation et les pages de prix de chaque fournisseur, consultées en septembre 2026. Latences de modèle déclarées par l'éditeur, hors réseau et gestion des tours.
ModèleAccèsLangues et limitesLatence ou prix publié
gpt-4o-mini-tts (OpenAI)APIModèle TTS actuel du catalogue OpenAI0,60 $ par million de tokens de texte, 12 $ par million de tokens audio
Gemini 3.8 Flash TTS (Google, 22 sept. 2026)APIPrésenté comme un TTS créatif de qualité studio0,50 $ par million de tokens de texte, 9 $ par million de tokens audio (offre payante)
eleven_flash_v2_5 (ElevenLabs)API32 langues, 40 000 caractères par requêteenviron 75 ms
eleven_v3 et v3_conversational (ElevenLabs)APIv3 : plus de 70 langues, 5 000 caractères par requête ; v3_conversational : temps réelenviron 280 ms (conversational)
Chatterbox (Resemble AI)Poids ouverts, MIT23 langues selon sa fiche ; filigrane PerTh sur chaque sortieAuto-hébergé
VibeVoice-1.5B (Microsoft)Poids ouverts, MITFormat long, plusieurs locuteurs ; anglais et chinois uniquementAuto-hébergé

Quoi tester. Notre règle : rédigez 50 phrases difficiles par langue (chiffres, dates et montants avec les séparateurs locaux, SIRET, noms propres, sigles, termes anglais), générez-les avec deux ou trois fournisseurs et organisez une écoute à l'aveugle avec cinq personnes du public cible. Une voix à l'accent d'Espagne peut sonner étrangère à Bogotá, et le français du Québec n'est pas celui de Paris.

Transcription (STT) : précision, diarisation et migrations

OpenAI renouvelle sa gamme : GPT Transcribe (fichiers) et GPT Live Transcribe (faible latence) coûtent 0,017 $ la minute, comme GPT-Realtime-Whisper, son modèle de transcription en streaming sorti en mai. whisper-1, gpt-4o-transcribe, gpt-4o-mini-transcribe et gpt-4o-transcribe-diarize quittent l'API le 26 février 2027. Si vous payez aujourd'hui l'ancien Whisper à 0,006 $ la minute, votre coût va presque tripler à la migration.

Google affiche Gemini 3.5 Transcribe à environ 0,005 $ la minute. ElevenLabs propose scribe_v2 (plus de 90 langues), scribe_v2_realtime (environ 150 ms selon l'éditeur) et scribe_v2_medical pour l'audio clinique. Côté poids ouverts sous licence claire : Whisper large-v3-turbo (environ 809 millions de paramètres, MIT), NVIDIA Parakeet TDT 0.6B v3 (CC-BY-4.0, 25 langues européennes) et Mistral Voxtral Mini 3B (Apache 2.0, espagnol et français inclus).

Précision : mesurez sur votre audio. Le WER d'un classement public ne dit pas comment se comportera votre centre de contact. Testez l'audio téléphonique en 8 kHz avec du vrai bruit, les accents régionaux et les chiffres dictés (numéros client, SIRET, immatriculations) : OpenAI a d'ailleurs mis en avant une meilleure reconnaissance alphanumérique dans GPT-Realtime-2.1 en juillet 2026. Si vous dépendez de la diarisation, vérifiez que le remplaçant de gpt-4o-transcribe-diarize couvre votre cas avant 2027.

Agents vocaux : voix à voix ou cascade

Voix à voix. Un seul modèle reçoit de l'audio et répond en audio. GPT-Live-1 est full duplex (il écoute pendant qu'il parle) et délègue le raisonnement et les outils à un agent backend. Il ne tourne que sur l'endpoint Live d'OpenAI et ses limites se comptent en sessions simultanées : de 25 au niveau 1 à 500 au niveau 5, sans offre gratuite. Google présente Gemini 3.8 Live comme le modèle par défaut de sa Live API pour les agents à faible latence.

Cascade. STT en streaming, un LLM avec outils et TTS en streaming, chaque brique étant remplaçable. Vous gagnez en contrôle : vous voyez le texte de chaque tour, appliquez des règles avant que quoi que ce soit ne soit prononcé et choisissez la meilleure voix française. Vous le payez en latence et en ingénierie des tours de parole.

Prix catalogue d'OpenAI et de Google consultés en septembre 2026. Hors téléphonie et hors LLM backend.
OptionArchitecturePrix publié
GPT-Live-1 (OpenAI, 10 sept. 2026)Voix à voix full duplex, backend séparé0,05 $/min, facturé à la seconde
gpt-realtime-2.1 et 2.1-mini (OpenAI, 6 juil. 2026)Voix à voix sur l'API Realtime32 $ / 64 $ par million de tokens audio (entrée / sortie) ; mini : 10 $ / 20 $
Gemini 3.8 Live (Google, 15 sept. 2026)Audio vers audio sur la Live APIEnviron 0,005 $/min en entrée et 0,018 $/min en sortie
Cascade STT + LLM + TTSTrois briques remplaçablesSomme des trois ; plus de contrôle par tour

Notre règle de décision : si la conversation est ouverte et que le naturel compte plus que le contrôle, commencez par le voix à voix. S'il y a des démarches avec données personnelles, des règles métier ou des besoins d'audit, commencez par une cascade, ou par un modèle voix à voix qui délègue à un backend où vous gardez la main sur les outils et les règles, ce que propose GPT-Live-1. Plus de détails dans les agents d'IA en production.

Latence, tours de parole et interruptions

Un budget par étape et cinq règles pour que la conversation ne sonne pas robotique.

Guide de conception de Slash pour planifier et mesurer, ni une mesure ni un chiffre d'éditeur. L'étape TTS part des latences de modèle publiées par ElevenLabs (environ 75 et 280 ms).
ÉtapeCascadeVoix à voixCe qu'il faut mesurer
Réseau et audio entrant50–150 ms50–150 msCodec, gigue, 8 kHz ou 16 kHz
Détection de fin de tour200–500 msIntégrée au modèleCoupures en milieu de phrase, longs silences
Transcription finale100–300 msSans objetErreurs sur les chiffres et les noms
Premier token du LLM200–600 msSans objetAvec vos prompts et outils réels
Premier son75–300 ms300–800 ms après la fin du tourDélai jusqu'au premier octet audio
Réseau et lecture50–150 ms50–150 msTampon du lecteur
Total jusqu'à la première syllabe0,7–2,0 s0,4–1,1 sp50 et p95 par appel

Interruptions (barge-in) et tours de parole

  1. Continuez d'écouter pendant que l'agent parle, avec annulation d'écho.
  2. Si l'utilisateur interrompt, coupez le son et retirez de l'historique ce qui n'a pas été dit : le modèle doit savoir ce que la personne a entendu.
  3. Ne comptez pas un « hmm » ou une toux comme une interruption ; réglez le seuil sur de vrais enregistrements.
  4. Détectez la fin de tour par le sens, pas seulement par le silence : quelqu'un qui dicte un numéro marque des pauses.
  5. Relisez les données critiques (identifiants, montants, dates) et faites confirmer avant d'agir.
Règle pratique

Budgétez et surveillez la latence au 95e percentile, pas en moyenne, et déclenchez une alerte par appel quand un tour dépasse votre seuil.

Musique générée : modèles, procès et licences

Le marché passe de l'entraînement sans autorisation aux modèles sous licence, au rythme des tribunaux.

Situation au 26 septembre 2026 d'après les entreprises, la GEMA et la presse spécialisée.
ActeurAccords et licencesContentieux et conditions clés
SunoWarner (nov. 2025), BMG (août 2026), Believe et TuneCore (sept. 2026) ; v6 lancé le 9 sept. 2026Nouvelle plainte de Sony et Universal contre v6 (18 sept. 2026, 60 202 enregistrements cités) ; jugement GEMA à Munich ; actions de Koda et de la SOCAN
UdioUniversal (oct. 2025) et Warner (nov. 2025), avec une plateforme sous licence annoncée pour 2026Sony poursuit : seconde plainte en juillet 2026 pour environ 30 000 titres de plus
Google Lyria 3.5 (3 sept. 2026)Filtres qui bloquent les voix d'artistes précis et les paroles protégées0,08 $ par chanson via l'API ; SynthID sur tout l'audio
ElevenLabs (Eleven Music)Accord pluriannuel avec Universal (10 sept. 2026)Usage commercial sur les offres payantes, avec des limites par offre

Suno résume la période. Sa v6 a été construite avec Warner, BMG et Believe, et l'entreprise retire tous ses modèles précédents. Sony et Universal, qui n'ont pas signé, soutiennent que v6 « blanchit » la contrefaçon passée parce qu'il a été entraîné en partie sur les sorties des anciens modèles.

En Europe, le tribunal régional de Munich a jugé le 31 juillet 2026 que Suno avait porté atteinte aux droits en s'entraînant sans licence sur des œuvres de la GEMA et en reproduisant des œuvres qui reprennent la mélodie, l'harmonie et le rythme de chansons célèbres.

Si votre marque utilise de la musique générée

  • Choisissez des offres avec droits commerciaux explicites : chez Suno, les téléchargements Pro et Premier les incluent, ceux de l'offre gratuite sont réservés à un usage personnel.
  • Conservez la preuve de chaque élément de campagne : outil, offre, date, prompt et fichier.
  • Ne demandez pas d'imiter un artiste précis ni une voix reconnaissable.
  • Attendez-vous à des frictions de diffusion : Deezer indique que plus de 50 % des nouveaux titres mis en ligne en juin 2026 étaient entièrement générés par IA et les exclut de ses recommandations.

Clonage de voix : consentement, filigranes et fraude

Le clonage de voix est devenu une fonction produit : depuis v5.5 (mars 2026), Suno permet d'enregistrer sa propre voix et de la réutiliser dans des chansons. La règle est le consentement explicite : un contrat qui précise quelle voix, pour quels usages, dans quelles langues, pour quelle durée et comment le révoquer.

Depuis le 2 août 2026, l'article 50 de l'AI Act impose de marquer l'audio synthétique de façon détectable par machine et de signaler les deepfakes audio ; le code de bonnes pratiques de la Commission demande des métadonnées signées et un filigrane. Le NIST a conclu qu'aucune technique de provenance ou de détection ne suffit seule.

Fraude

Le rapport 2025 de l'IC3 du FBI recense plus de 5 millions de dollars perdus dans des arnaques « de détresse » à la voix clonée, et selon une étude de Kaspersky publiée en septembre 2026, 31 % des victimes d'arnaques par messagerie ont signalé des voix clonées ou synthétiques. N'utilisez jamais la voix comme facteur d'authentification. Plus de détails dans la fraude aux deepfakes.

Architecture de référence et conformité : un agent vocal en espagnol

  1. Entrée : téléphonie SIP ou WebRTC avec un message d'accueil : vous parlez à une IA, l'appel est enregistré, dans quel but et comment joindre un humain.
  2. Moteur : voix à voix ou cascade, derrière votre propre interface pour changer de fournisseur.
  3. Voix : STT et TTS choisis avec votre test de 50 phrases en espagnol de Colombie, et une voix de marque sous contrat.
  4. Backend : un LLM avec des outils stricts (CRM, commandes, tickets), le moindre privilège, une confirmation orale avant toute modification et des défenses contre l'injection de prompt.
  5. Transfert : vers un humain, avec un résumé, à la demande de l'utilisateur ou après deux échecs ; l'identité se vérifie par un facteur autre que la voix.
  6. Exploitation : latence p50 et p95, échantillon de transcriptions relu, taux de résolution sans humain et suppression automatique des enregistrements à l'échéance.

Conformité

Union européenne. Depuis le 2 août 2026, l'article 50 de l'AI Act impose d'indiquer clairement, au plus tard lors de la première interaction, que l'on parle à une IA ; l'amende peut atteindre 15 millions d'euros ou 3 % du chiffre d'affaires mondial, le montant le plus élevé étant retenu. Un enregistrement est une donnée personnelle au sens du RGPD, et une empreinte vocale servant à identifier une personne est une donnée biométrique de catégorie particulière (article 9) qui exige en pratique, le plus souvent, un consentement explicite. Déduire par IA les émotions de vos propres salariés est interdit depuis février 2025, sauf pour raisons médicales ou de sécurité.

Colombie. La loi 1581 de 2012 exige une autorisation préalable et éclairée que vous puissiez prouver ensuite (article 9) : conservez le message d'accueil et l'acceptation avec chaque appel. Les données biométriques sont sensibles (articles 5 et 6) et demandent une autorisation explicite, et confier l'audio à un prestataire à l'étranger suppose un contrat de transmission (décret 1074 de 2015) ou, pour un transfert, le respect de l'article 26. Il n'existe pas encore de loi sur l'IA, mais la loi 2502 de 2025 fait déjà de l'usurpation d'identité par IA une circonstance aggravante. Détails dans notre carte réglementaire 2026.

L'essentiel

  • GPT-Live-1 (10 septembre 2026) et Gemini 3.8 Live (15 septembre) font entrer le voix à voix en production ; GPT-Live-1 coûte 0,05 $ la minute, backend en plus.
  • OpenAI retire whisper-1 et ses modèles de transcription gpt-4o le 26 février 2027 : planifiez la migration et son coût.
  • Aucun classement ne mesure votre espagnol ni votre français : testez TTS et STT avec 50 phrases difficiles et une écoute à l'aveugle.
  • La musique générée passe aux modèles sous licence, mais Sony et Universal poursuivent toujours Suno, qui a perdu face à la GEMA à Munich.
  • Annoncez l'IA dès la première phrase, obtenez l'autorisation d'enregistrer et traitez l'empreinte vocale comme une donnée biométrique.

Sources

  1. API changelog · OpenAI, 2026-09
  2. GPT-Live-1 model page · OpenAI, 2026-09-10
  3. API pricing · OpenAI, 2026-09
  4. Gemini API changelog · Google, 2026-09
  5. Gemini API pricing · Google, 2026-09
  6. Models · ElevenLabs documentation, 2026-09
  7. Introducing v6 · Suno, 2026-09-09
  8. GEMA prevails over Suno · GEMA, 2026-07-31
  9. Sony Music and Universal Music sue Suno over its label-backed model · Variety, 2026-09-18
  10. Article 50: transparency obligations for providers and deployers · AI Act Service Desk, European Commission, 2026-08-02
  11. 2025 IC3 Annual Report · FBI Internet Crime Complaint Center, 2026-04
  12. Regulation (EU) 2016/679 (GDPR) · EUR-Lex, 2016-04-27

Note éditoriale : cette analyse reflète les informations publiques disponibles à la date de révision. Modèles, prix et règles évoluent vite ; chaque donnée tierce renvoie à sa source et nos opinions sont présentées comme telles. Une erreur ? Écrivez à contact@slash-digital.io.

Questions fréquentes

Les questions qu'on nous pose souvent

Qu'est-ce que GPT-Live-1 ?

Un modèle vocal d'OpenAI, disponible depuis le 10 septembre 2026, qui écoute et parle en même temps (full duplex) et délègue le raisonnement et les outils à un agent backend. Il coûte 0,05 $ la minute, facturé à la seconde, le backend étant payé à part.

Vaut-il mieux un agent voix à voix ou une cascade STT, LLM et TTS ?

Cela dépend du cas. Le voix à voix vise des tours de parole plus naturels ; la cascade donne plus de contrôle et une trace écrite de chaque tour. Pour des démarches avec données personnelles, commencez par une cascade ou par un voix à voix qui délègue à un backend que vous maîtrisez, et mesurez la latence p95 sur votre réseau.

Que devient Whisper dans l'API d'OpenAI ?

OpenAI a annoncé le 26 août 2026 que whisper-1, gpt-4o-transcribe, gpt-4o-mini-transcribe et gpt-4o-transcribe-diarize quitteront l'API le 26 février 2027. Les remplaçants sont GPT Transcribe et GPT Live Transcribe, à 0,017 $ la minute.

Puis-je utiliser une musique Suno dans une campagne ?

Avec une offre Pro ou Premier, les conditions de Suno accordent des droits commerciaux sur les téléchargements ; l'offre gratuite est réservée à un usage personnel. Le risque contentieux demeure : Sony et Universal ont attaqué v6 et, dans l'affaire initiale, Suno a reconnu avoir obtenu de l'audio YouTube avec yt-dlp. Aux États-Unis, un prompt seul ne rend pas le résultat protégeable.

Faut-il dire que l'agent est une IA ?

Dans l'Union européenne, oui : l'article 50 de l'AI Act l'impose depuis le 2 août 2026, au plus tard lors de la première interaction. La Colombie n'a pas de loi sur l'IA en vigueur, mais la loi 1581 exige une autorisation éclairée pour enregistrer et traiter les données, et nous recommandons de toujours l'annoncer.

Parler à Slash

Mettons-le en production

Racontez-nous votre défi. Nous répondons sous 24 heures ouvrées avec une première lecture honnête : si nous pouvons aider, nous dirons comment ; sinon, nous dirons qui peut.

Je réponds en personne. Pas de formulaires interminables ni de réponses automatiques.

Écrire à Esteban