La voix devient une interface de production : quoi utiliser et quoi surveiller en 2026
Septembre 2026 a apporté GPT-Live-1, Gemini 3.8 Live, Gemini 3.8 Flash TTS et Suno v6, pendant que tribunaux et maisons de disques redessinent la musique générée utilisable. Ce guide fait le tri entre modèles, latences, prix et règles pour une équipe qui met la voix en production en espagnol et en français.
OpenAI a rendu GPT-Live-1 disponible pour tous le 10 septembre 2026 : un modèle qui écoute et parle en même temps et délègue le raisonnement à un agent backend, pour 0,05 $ la minute. Google a suivi avec Gemini 3.8 Live le 15 septembre et Gemini 3.8 Flash TTS le 22.
En musique, Suno a lancé v6 avec Warner, BMG et Believe, mais Sony et Universal l'ont attaqué en justice le 18 septembre, et un tribunal de Munich a donné tort à Suno pour s'être entraîné sur des œuvres de la GEMA. Notre lecture : choisissez l'architecture selon la latence et le contrôle, testez toujours dans votre espagnol et votre français, traitez le clonage de voix comme un risque juridique et de fraude, et annoncez dès la première seconde que l'interlocuteur est une IA.
Synthèse vocale (TTS) : offres commerciales et modèles ouverts
Ce qui est vérifié en septembre 2026, et ce que vous devez tester vous-même en espagnol et en français.
| Modèle | Accès | Langues et limites | Latence ou prix publié |
|---|---|---|---|
| gpt-4o-mini-tts (OpenAI) | API | Modèle TTS actuel du catalogue OpenAI | 0,60 $ par million de tokens de texte, 12 $ par million de tokens audio |
| Gemini 3.8 Flash TTS (Google, 22 sept. 2026) | API | Présenté comme un TTS créatif de qualité studio | 0,50 $ par million de tokens de texte, 9 $ par million de tokens audio (offre payante) |
| eleven_flash_v2_5 (ElevenLabs) | API | 32 langues, 40 000 caractères par requête | environ 75 ms |
| eleven_v3 et v3_conversational (ElevenLabs) | API | v3 : plus de 70 langues, 5 000 caractères par requête ; v3_conversational : temps réel | environ 280 ms (conversational) |
| Chatterbox (Resemble AI) | Poids ouverts, MIT | 23 langues selon sa fiche ; filigrane PerTh sur chaque sortie | Auto-hébergé |
| VibeVoice-1.5B (Microsoft) | Poids ouverts, MIT | Format long, plusieurs locuteurs ; anglais et chinois uniquement | Auto-hébergé |
Quoi tester. Notre règle : rédigez 50 phrases difficiles par langue (chiffres, dates et montants avec les séparateurs locaux, SIRET, noms propres, sigles, termes anglais), générez-les avec deux ou trois fournisseurs et organisez une écoute à l'aveugle avec cinq personnes du public cible. Une voix à l'accent d'Espagne peut sonner étrangère à Bogotá, et le français du Québec n'est pas celui de Paris.
Transcription (STT) : précision, diarisation et migrations
OpenAI renouvelle sa gamme : GPT Transcribe (fichiers) et GPT Live Transcribe (faible latence) coûtent 0,017 $ la minute, comme GPT-Realtime-Whisper, son modèle de transcription en streaming sorti en mai. whisper-1, gpt-4o-transcribe, gpt-4o-mini-transcribe et gpt-4o-transcribe-diarize quittent l'API le 26 février 2027. Si vous payez aujourd'hui l'ancien Whisper à 0,006 $ la minute, votre coût va presque tripler à la migration.
Google affiche Gemini 3.5 Transcribe à environ 0,005 $ la minute. ElevenLabs propose scribe_v2 (plus de 90 langues), scribe_v2_realtime (environ 150 ms selon l'éditeur) et scribe_v2_medical pour l'audio clinique. Côté poids ouverts sous licence claire : Whisper large-v3-turbo (environ 809 millions de paramètres, MIT), NVIDIA Parakeet TDT 0.6B v3 (CC-BY-4.0, 25 langues européennes) et Mistral Voxtral Mini 3B (Apache 2.0, espagnol et français inclus).
Précision : mesurez sur votre audio. Le WER d'un classement public ne dit pas comment se comportera votre centre de contact. Testez l'audio téléphonique en 8 kHz avec du vrai bruit, les accents régionaux et les chiffres dictés (numéros client, SIRET, immatriculations) : OpenAI a d'ailleurs mis en avant une meilleure reconnaissance alphanumérique dans GPT-Realtime-2.1 en juillet 2026. Si vous dépendez de la diarisation, vérifiez que le remplaçant de gpt-4o-transcribe-diarize couvre votre cas avant 2027.
Agents vocaux : voix à voix ou cascade
Voix à voix. Un seul modèle reçoit de l'audio et répond en audio. GPT-Live-1 est full duplex (il écoute pendant qu'il parle) et délègue le raisonnement et les outils à un agent backend. Il ne tourne que sur l'endpoint Live d'OpenAI et ses limites se comptent en sessions simultanées : de 25 au niveau 1 à 500 au niveau 5, sans offre gratuite. Google présente Gemini 3.8 Live comme le modèle par défaut de sa Live API pour les agents à faible latence.
Cascade. STT en streaming, un LLM avec outils et TTS en streaming, chaque brique étant remplaçable. Vous gagnez en contrôle : vous voyez le texte de chaque tour, appliquez des règles avant que quoi que ce soit ne soit prononcé et choisissez la meilleure voix française. Vous le payez en latence et en ingénierie des tours de parole.
| Option | Architecture | Prix publié |
|---|---|---|
| GPT-Live-1 (OpenAI, 10 sept. 2026) | Voix à voix full duplex, backend séparé | 0,05 $/min, facturé à la seconde |
| gpt-realtime-2.1 et 2.1-mini (OpenAI, 6 juil. 2026) | Voix à voix sur l'API Realtime | 32 $ / 64 $ par million de tokens audio (entrée / sortie) ; mini : 10 $ / 20 $ |
| Gemini 3.8 Live (Google, 15 sept. 2026) | Audio vers audio sur la Live API | Environ 0,005 $/min en entrée et 0,018 $/min en sortie |
| Cascade STT + LLM + TTS | Trois briques remplaçables | Somme des trois ; plus de contrôle par tour |
Notre règle de décision : si la conversation est ouverte et que le naturel compte plus que le contrôle, commencez par le voix à voix. S'il y a des démarches avec données personnelles, des règles métier ou des besoins d'audit, commencez par une cascade, ou par un modèle voix à voix qui délègue à un backend où vous gardez la main sur les outils et les règles, ce que propose GPT-Live-1. Plus de détails dans les agents d'IA en production.
Latence, tours de parole et interruptions
Un budget par étape et cinq règles pour que la conversation ne sonne pas robotique.
| Étape | Cascade | Voix à voix | Ce qu'il faut mesurer |
|---|---|---|---|
| Réseau et audio entrant | 50–150 ms | 50–150 ms | Codec, gigue, 8 kHz ou 16 kHz |
| Détection de fin de tour | 200–500 ms | Intégrée au modèle | Coupures en milieu de phrase, longs silences |
| Transcription finale | 100–300 ms | Sans objet | Erreurs sur les chiffres et les noms |
| Premier token du LLM | 200–600 ms | Sans objet | Avec vos prompts et outils réels |
| Premier son | 75–300 ms | 300–800 ms après la fin du tour | Délai jusqu'au premier octet audio |
| Réseau et lecture | 50–150 ms | 50–150 ms | Tampon du lecteur |
| Total jusqu'à la première syllabe | 0,7–2,0 s | 0,4–1,1 s | p50 et p95 par appel |
Interruptions (barge-in) et tours de parole
- Continuez d'écouter pendant que l'agent parle, avec annulation d'écho.
- Si l'utilisateur interrompt, coupez le son et retirez de l'historique ce qui n'a pas été dit : le modèle doit savoir ce que la personne a entendu.
- Ne comptez pas un « hmm » ou une toux comme une interruption ; réglez le seuil sur de vrais enregistrements.
- Détectez la fin de tour par le sens, pas seulement par le silence : quelqu'un qui dicte un numéro marque des pauses.
- Relisez les données critiques (identifiants, montants, dates) et faites confirmer avant d'agir.
Budgétez et surveillez la latence au 95e percentile, pas en moyenne, et déclenchez une alerte par appel quand un tour dépasse votre seuil.
Musique générée : modèles, procès et licences
Le marché passe de l'entraînement sans autorisation aux modèles sous licence, au rythme des tribunaux.
| Acteur | Accords et licences | Contentieux et conditions clés |
|---|---|---|
| Suno | Warner (nov. 2025), BMG (août 2026), Believe et TuneCore (sept. 2026) ; v6 lancé le 9 sept. 2026 | Nouvelle plainte de Sony et Universal contre v6 (18 sept. 2026, 60 202 enregistrements cités) ; jugement GEMA à Munich ; actions de Koda et de la SOCAN |
| Udio | Universal (oct. 2025) et Warner (nov. 2025), avec une plateforme sous licence annoncée pour 2026 | Sony poursuit : seconde plainte en juillet 2026 pour environ 30 000 titres de plus |
| Google Lyria 3.5 (3 sept. 2026) | Filtres qui bloquent les voix d'artistes précis et les paroles protégées | 0,08 $ par chanson via l'API ; SynthID sur tout l'audio |
| ElevenLabs (Eleven Music) | Accord pluriannuel avec Universal (10 sept. 2026) | Usage commercial sur les offres payantes, avec des limites par offre |
Suno résume la période. Sa v6 a été construite avec Warner, BMG et Believe, et l'entreprise retire tous ses modèles précédents. Sony et Universal, qui n'ont pas signé, soutiennent que v6 « blanchit » la contrefaçon passée parce qu'il a été entraîné en partie sur les sorties des anciens modèles.
En Europe, le tribunal régional de Munich a jugé le 31 juillet 2026 que Suno avait porté atteinte aux droits en s'entraînant sans licence sur des œuvres de la GEMA et en reproduisant des œuvres qui reprennent la mélodie, l'harmonie et le rythme de chansons célèbres.
Si votre marque utilise de la musique générée
- Choisissez des offres avec droits commerciaux explicites : chez Suno, les téléchargements Pro et Premier les incluent, ceux de l'offre gratuite sont réservés à un usage personnel.
- Conservez la preuve de chaque élément de campagne : outil, offre, date, prompt et fichier.
- Ne demandez pas d'imiter un artiste précis ni une voix reconnaissable.
- Attendez-vous à des frictions de diffusion : Deezer indique que plus de 50 % des nouveaux titres mis en ligne en juin 2026 étaient entièrement générés par IA et les exclut de ses recommandations.
Clonage de voix : consentement, filigranes et fraude
Le clonage de voix est devenu une fonction produit : depuis v5.5 (mars 2026), Suno permet d'enregistrer sa propre voix et de la réutiliser dans des chansons. La règle est le consentement explicite : un contrat qui précise quelle voix, pour quels usages, dans quelles langues, pour quelle durée et comment le révoquer.
Depuis le 2 août 2026, l'article 50 de l'AI Act impose de marquer l'audio synthétique de façon détectable par machine et de signaler les deepfakes audio ; le code de bonnes pratiques de la Commission demande des métadonnées signées et un filigrane. Le NIST a conclu qu'aucune technique de provenance ou de détection ne suffit seule.
Le rapport 2025 de l'IC3 du FBI recense plus de 5 millions de dollars perdus dans des arnaques « de détresse » à la voix clonée, et selon une étude de Kaspersky publiée en septembre 2026, 31 % des victimes d'arnaques par messagerie ont signalé des voix clonées ou synthétiques. N'utilisez jamais la voix comme facteur d'authentification. Plus de détails dans la fraude aux deepfakes.
Architecture de référence et conformité : un agent vocal en espagnol
- Entrée : téléphonie SIP ou WebRTC avec un message d'accueil : vous parlez à une IA, l'appel est enregistré, dans quel but et comment joindre un humain.
- Moteur : voix à voix ou cascade, derrière votre propre interface pour changer de fournisseur.
- Voix : STT et TTS choisis avec votre test de 50 phrases en espagnol de Colombie, et une voix de marque sous contrat.
- Backend : un LLM avec des outils stricts (CRM, commandes, tickets), le moindre privilège, une confirmation orale avant toute modification et des défenses contre l'injection de prompt.
- Transfert : vers un humain, avec un résumé, à la demande de l'utilisateur ou après deux échecs ; l'identité se vérifie par un facteur autre que la voix.
- Exploitation : latence p50 et p95, échantillon de transcriptions relu, taux de résolution sans humain et suppression automatique des enregistrements à l'échéance.
Conformité
Union européenne. Depuis le 2 août 2026, l'article 50 de l'AI Act impose d'indiquer clairement, au plus tard lors de la première interaction, que l'on parle à une IA ; l'amende peut atteindre 15 millions d'euros ou 3 % du chiffre d'affaires mondial, le montant le plus élevé étant retenu. Un enregistrement est une donnée personnelle au sens du RGPD, et une empreinte vocale servant à identifier une personne est une donnée biométrique de catégorie particulière (article 9) qui exige en pratique, le plus souvent, un consentement explicite. Déduire par IA les émotions de vos propres salariés est interdit depuis février 2025, sauf pour raisons médicales ou de sécurité.
Colombie. La loi 1581 de 2012 exige une autorisation préalable et éclairée que vous puissiez prouver ensuite (article 9) : conservez le message d'accueil et l'acceptation avec chaque appel. Les données biométriques sont sensibles (articles 5 et 6) et demandent une autorisation explicite, et confier l'audio à un prestataire à l'étranger suppose un contrat de transmission (décret 1074 de 2015) ou, pour un transfert, le respect de l'article 26. Il n'existe pas encore de loi sur l'IA, mais la loi 2502 de 2025 fait déjà de l'usurpation d'identité par IA une circonstance aggravante. Détails dans notre carte réglementaire 2026.
L'essentiel
- GPT-Live-1 (10 septembre 2026) et Gemini 3.8 Live (15 septembre) font entrer le voix à voix en production ; GPT-Live-1 coûte 0,05 $ la minute, backend en plus.
- OpenAI retire whisper-1 et ses modèles de transcription gpt-4o le 26 février 2027 : planifiez la migration et son coût.
- Aucun classement ne mesure votre espagnol ni votre français : testez TTS et STT avec 50 phrases difficiles et une écoute à l'aveugle.
- La musique générée passe aux modèles sous licence, mais Sony et Universal poursuivent toujours Suno, qui a perdu face à la GEMA à Munich.
- Annoncez l'IA dès la première phrase, obtenez l'autorisation d'enregistrer et traitez l'empreinte vocale comme une donnée biométrique.
Sources
- API changelog
- GPT-Live-1 model page
- API pricing
- Gemini API changelog
- Gemini API pricing
- Models
- Introducing v6
- GEMA prevails over Suno
- Sony Music and Universal Music sue Suno over its label-backed model
- Article 50: transparency obligations for providers and deployers
- 2025 IC3 Annual Report
- Regulation (EU) 2016/679 (GDPR)
Note éditoriale : cette analyse reflète les informations publiques disponibles à la date de révision. Modèles, prix et règles évoluent vite ; chaque donnée tierce renvoie à sa source et nos opinions sont présentées comme telles. Une erreur ? Écrivez à contact@slash-digital.io.
Les questions qu'on nous pose souvent
Qu'est-ce que GPT-Live-1 ?
Un modèle vocal d'OpenAI, disponible depuis le 10 septembre 2026, qui écoute et parle en même temps (full duplex) et délègue le raisonnement et les outils à un agent backend. Il coûte 0,05 $ la minute, facturé à la seconde, le backend étant payé à part.
Vaut-il mieux un agent voix à voix ou une cascade STT, LLM et TTS ?
Cela dépend du cas. Le voix à voix vise des tours de parole plus naturels ; la cascade donne plus de contrôle et une trace écrite de chaque tour. Pour des démarches avec données personnelles, commencez par une cascade ou par un voix à voix qui délègue à un backend que vous maîtrisez, et mesurez la latence p95 sur votre réseau.
Que devient Whisper dans l'API d'OpenAI ?
OpenAI a annoncé le 26 août 2026 que whisper-1, gpt-4o-transcribe, gpt-4o-mini-transcribe et gpt-4o-transcribe-diarize quitteront l'API le 26 février 2027. Les remplaçants sont GPT Transcribe et GPT Live Transcribe, à 0,017 $ la minute.
Puis-je utiliser une musique Suno dans une campagne ?
Avec une offre Pro ou Premier, les conditions de Suno accordent des droits commerciaux sur les téléchargements ; l'offre gratuite est réservée à un usage personnel. Le risque contentieux demeure : Sony et Universal ont attaqué v6 et, dans l'affaire initiale, Suno a reconnu avoir obtenu de l'audio YouTube avec yt-dlp. Aux États-Unis, un prompt seul ne rend pas le résultat protégeable.
Faut-il dire que l'agent est une IA ?
Dans l'Union européenne, oui : l'article 50 de l'AI Act l'impose depuis le 2 août 2026, au plus tard lors de la première interaction. La Colombie n'a pas de loi sur l'IA en vigueur, mais la loi 1581 exige une autorisation éclairée pour enregistrer et traiter les données, et nous recommandons de toujours l'annoncer.
D'autres analyses à lire
Fraude aux deepfakes : un protocole pour les entreprises
Du cas Arup aux chiffres du FBI : comment fonctionne la fraude aux voix clonées et aux deepfakes, et un protocole de vérification pour la finance, les RH et les assistants.
Agents et ingénierieAgents IA en production : ce qui marche en 2026
Workflow ou agent, les huit briques, données d'adoption et d'échec, usage de l'ordinateur, règles de conception, coûts, sécurité et check-list.
Image, vidéo et audioIA générative dans les expériences de marque et le DOOH : ce qui marche en live
Photobooths IA, face swap et écrans DOOH : latence, modération, consentement biométrique, étiquetage AI Act et mesure d'une activation en live.
Et ensuite ?
Mettons-le en production
Racontez-nous votre défi. Nous répondons sous 24 heures ouvrées avec une première lecture honnête : si nous pouvons aider, nous dirons comment ; sinon, nous dirons qui peut.
Je réponds en personne. Pas de formulaires interminables ni de réponses automatiques.