La voz ya es una interfaz de producción: qué usar y qué vigilar en 2026
Septiembre de 2026 trajo GPT-Live-1, Gemini 3.8 Live, Gemini 3.8 Flash TTS y Suno v6, mientras tribunales y sellos redefinen qué música con IA se puede usar. Esta guía ordena modelos, latencias, precios y reglas para un equipo que quiere poner voz en producción en español y en francés.
OpenAI puso GPT-Live-1 en disponibilidad general el 10 de septiembre de 2026: un modelo que escucha y habla a la vez y delega el razonamiento en un agente de backend, a USD 0,05 por minuto. Google respondió con Gemini 3.8 Live el 15 de septiembre y Gemini 3.8 Flash TTS el 22.
En música, Suno lanzó v6 con Warner, BMG y Believe, pero Sony y Universal lo demandaron el 18 de septiembre, y un tribunal de Múnich falló contra Suno por entrenar con obras de GEMA. Nuestra lectura: elige la arquitectura por latencia y control, prueba siempre en tu español y tu francés, trata la clonación de voz como un riesgo legal y de fraude, y anuncia desde el primer segundo que quien atiende es una IA.
Síntesis de voz (TTS): opciones comerciales y abiertas
Lo verificado a septiembre de 2026 y lo que te toca probar en español y en francés.
| Modelo | Acceso | Idiomas y límites | Latencia o precio publicado |
|---|---|---|---|
| gpt-4o-mini-tts (OpenAI) | API | Modelo TTS vigente en el catálogo de OpenAI | USD 0,60 por millón de tokens de texto y USD 12 por millón de tokens de audio |
| Gemini 3.8 Flash TTS (Google, 22 sept. 2026) | API | Presentado como TTS creativo con calidad de estudio | USD 0,50 por millón de tokens de texto y USD 9 por millón de tokens de audio (nivel de pago) |
| eleven_flash_v2_5 (ElevenLabs) | API | 32 idiomas, 40.000 caracteres por petición | unos 75 ms |
| eleven_v3 y v3_conversational (ElevenLabs) | API | v3: más de 70 idiomas, 5.000 caracteres por petición; v3_conversational: tiempo real | unos 280 ms (conversational) |
| Chatterbox (Resemble AI) | Pesos abiertos, MIT | 23 idiomas según su ficha; marca de agua PerTh en cada salida | Autoalojado |
| VibeVoice-1.5B (Microsoft) | Pesos abiertos, MIT | Formato largo y varios locutores; solo inglés y chino | Autoalojado |
Qué probar. Nuestra regla: escribe 50 frases difíciles por idioma (cifras, fechas y montos con separadores locales, NIT, nombres propios, siglas, términos en inglés), genéralas con dos o tres proveedores y haz una escucha a ciegas con cinco personas del público objetivo. Una voz con acento de España puede sonar ajena en Bogotá, y el francés de Quebec no es el de París.
Transcripción (STT): precisión, diarización y migraciones
OpenAI renueva su línea: GPT Transcribe (archivos) y GPT Live Transcribe (baja latencia) cuestan USD 0,017 por minuto, igual que GPT-Realtime-Whisper, su modelo de transcripción en streaming de mayo. whisper-1, gpt-4o-transcribe, gpt-4o-mini-transcribe y gpt-4o-transcribe-diarize dejan la API el 26 de febrero de 2027. Si hoy pagas el Whisper antiguo a USD 0,006 por minuto, tu costo casi se triplica al migrar.
Google lista Gemini 3.5 Transcribe a unos USD 0,005 por minuto. ElevenLabs ofrece scribe_v2 (más de 90 idiomas), scribe_v2_realtime (unos 150 ms según la empresa) y scribe_v2_medical para audio clínico. En pesos abiertos con licencia clara: Whisper large-v3-turbo (unos 809 millones de parámetros, MIT), NVIDIA Parakeet TDT 0.6B v3 (CC-BY-4.0, 25 idiomas europeos) y Mistral Voxtral Mini 3B (Apache 2.0, con español y francés).
Precisión: mide con tu audio. El WER de un ranking público no dice cómo le irá a tu centro de contacto. Prueba audio telefónico de 8 kHz con ruido real, acentos regionales y cifras dictadas (cédula, NIT, placas): OpenAI destacó justamente una mejor precisión alfanumérica en GPT-Realtime-2.1, en julio de 2026. Si dependes de la diarización, confirma que el reemplazo de gpt-4o-transcribe-diarize cubre tu caso antes de 2027.
Agentes de voz: voz a voz o cascada
Voz a voz. Un solo modelo recibe audio y responde con audio. GPT-Live-1 es full dúplex (escucha mientras habla) y delega el razonamiento y las herramientas en un agente de backend. Solo funciona en el endpoint Live de OpenAI y sus límites se cuentan en sesiones simultáneas: de 25 en el nivel 1 a 500 en el nivel 5, sin nivel gratuito. Google presenta Gemini 3.8 Live como el modelo por defecto de su Live API para agentes de baja latencia.
Cascada. STT en streaming, un LLM con herramientas y TTS en streaming, cada pieza intercambiable. Ganas control: ves el texto de cada turno, aplicas reglas antes de que algo se pronuncie y eliges la mejor voz en español. Pagas en latencia y en ingeniería de turnos.
| Opción | Arquitectura | Precio publicado |
|---|---|---|
| GPT-Live-1 (OpenAI, 10 sept. 2026) | Voz a voz full dúplex, backend aparte | USD 0,05/min, facturado por segundo |
| gpt-realtime-2.1 y 2.1-mini (OpenAI, 6 jul. 2026) | Voz a voz en la API Realtime | USD 32 / 64 por millón de tokens de audio (entrada / salida); mini: 10 / 20 |
| Gemini 3.8 Live (Google, 15 sept. 2026) | Audio a audio en la Live API | Unos USD 0,005/min de entrada y 0,018/min de salida |
| Cascada STT + LLM + TTS | Tres piezas intercambiables | Suma de las tres; más control por turno |
Nuestra regla de decisión: si la conversación es abierta y la naturalidad pesa más que el control, empieza por voz a voz. Si hay trámites con datos personales, reglas de negocio o auditoría, empieza por la cascada o por un modelo voz a voz que delegue en un backend donde tú controlas herramientas y reglas, que es lo que propone GPT-Live-1. Más en agentes de IA en producción.
Latencia, turnos e interrupciones
Un presupuesto por tramo y cinco reglas para que la conversación no suene robótica.
| Tramo | Cascada | Voz a voz | Qué medir |
|---|---|---|---|
| Red y audio de entrada | 50–150 ms | 50–150 ms | Códec, jitter, 8 kHz o 16 kHz |
| Detección de fin de turno | 200–500 ms | Incluida en el modelo | Cortes a mitad de frase, silencios largos |
| Transcripción final | 100–300 ms | No aplica | Errores en cifras y nombres |
| Primer token del LLM | 200–600 ms | No aplica | Con tus prompts y herramientas reales |
| Primer audio | 75–300 ms | 300–800 ms desde el fin del turno | Tiempo al primer byte de audio |
| Red y reproducción de salida | 50–150 ms | 50–150 ms | Búfer del reproductor |
| Total hasta la primera sílaba | 0,7–2,0 s | 0,4–1,1 s | p50 y p95 por llamada |
Interrupciones (barge-in) y turnos
- Escucha también mientras el agente habla, con cancelación de eco.
- Si el usuario interrumpe, corta el audio y borra del historial lo no dicho: el modelo debe saber qué oyó la persona.
- No cuentes un «ajá» o una tos como interrupción; ajusta el umbral con grabaciones reales.
- Detecta el fin de turno por sentido, no solo por silencio: quien dicta un número hace pausas.
- Lee en voz alta los datos críticos (cédula, montos, fechas) y confirma antes de actuar.
Presupuesta y vigila la latencia en el percentil 95, no en el promedio, y dispara una alerta por llamada cuando un turno supere tu umbral.
Música con IA: modelos, pleitos y licencias
El mercado pasa de entrenar sin permiso a modelos con licencia, y los tribunales marcan el ritmo.
| Actor | Acuerdos y licencias | Litigios y condiciones clave |
|---|---|---|
| Suno | Warner (nov. 2025), BMG (ago. 2026), Believe y TuneCore (sept. 2026); v6 lanzado el 9 sept. 2026 | Nueva demanda de Sony y Universal contra v6 (18 sept. 2026, 60.202 grabaciones citadas); fallo de GEMA en Múnich; demandas de Koda y SOCAN |
| Udio | Universal (oct. 2025) y Warner (nov. 2025), con una plataforma con licencia anunciada para 2026 | Sony sigue litigando: segunda demanda en julio de 2026 por unas 30.000 canciones más |
| Google Lyria 3.5 (3 sept. 2026) | Filtros que bloquean voces de artistas concretos y letras protegidas | USD 0,08 por canción en la API; SynthID en todo el audio |
| ElevenLabs (Eleven Music) | Acuerdo plurianual con Universal (10 sept. 2026) | Uso comercial en planes de pago, con límites por plan |
Suno resume el momento. Su v6 se hizo con Warner, BMG y Believe, y la empresa retira todos sus modelos anteriores. Sony y Universal, que no firmaron, alegan que v6 «lava» la infracción porque se entrenó en parte con salidas de modelos previos.
En Europa, el Tribunal Regional de Múnich falló el 31 de julio de 2026 que Suno infringió derechos al entrenar con obras de GEMA sin licencia y al reproducir obras que coinciden en melodía, armonía y ritmo con canciones conocidas.
Si tu marca usa música generada
- Usa planes con derechos comerciales explícitos: en Suno, las descargas de Pro y Premier los incluyen y las del plan gratuito son solo para uso personal.
- Guarda la prueba de cada pieza de campaña: herramienta, plan, fecha, prompt y archivo.
- No pidas imitar a un artista concreto ni una voz reconocible.
- Cuenta con fricción en la distribución: Deezer dice que más del 50 % de las canciones nuevas subidas en junio de 2026 eran totalmente generadas con IA y las saca de sus recomendaciones.
Clonación de voz: consentimiento, marcas de agua y fraude
Clonar una voz ya es una función de producto: desde v5.5 (marzo de 2026), Suno permite grabar tu propia voz y reutilizarla en canciones. La regla es el consentimiento explícito: un contrato que diga qué voz, para qué usos, en qué idiomas, por cuánto tiempo y cómo se revoca.
Desde el 2 de agosto de 2026, el artículo 50 del AI Act obliga a marcar el audio sintético de forma detectable por máquina y a revelar los deepfakes de audio; el código de buenas prácticas de la Comisión pide metadatos firmados más una marca de agua. Según el NIST, ninguna técnica de procedencia o detección basta por sí sola.
El informe 2025 del IC3 del FBI suma más de USD 5 millones perdidos en estafas de «emergencia» con voz clonada, y según un estudio de Kaspersky de septiembre de 2026, el 31 % de las víctimas de estafas por mensajería reportó voces clonadas o sintéticas. No uses la voz como factor de autenticación. Más en fraude con deepfakes.
Arquitectura de referencia y cumplimiento: agente de voz en español
- Entrada: telefonía SIP o WebRTC con un aviso inicial: hablas con una IA, la llamada se graba, para qué y cómo pedir un humano.
- Motor: voz a voz o cascada, detrás de una interfaz propia para cambiar de proveedor.
- Voz: STT y TTS elegidos con tu prueba de 50 frases en español colombiano, y una voz de marca con contrato.
- Backend: un LLM con herramientas estrictas (CRM, pedidos, tickets), permisos mínimos, confirmación en voz alta antes de cualquier cambio y defensas contra la inyección de instrucciones.
- Traspaso: a un humano, con resumen, cuando el usuario lo pida o tras dos intentos fallidos; la identidad se verifica con un factor distinto de la voz.
- Operación: latencia p50 y p95, muestra de transcripciones revisada, tasa de resolución sin humano y borrado automático de las grabaciones al vencer el plazo.
Cumplimiento
Unión Europea. Desde el 2 de agosto de 2026, el artículo 50 del AI Act exige avisar de forma clara, a más tardar en la primera interacción, que se habla con una IA; la multa llega a 15 millones de euros o al 3 % de la facturación mundial, lo que sea mayor. Una grabación es un dato personal según el RGPD, y una huella de voz usada para identificar a alguien es un dato biométrico de categoría especial (artículo 9) que, en la práctica, suele exigir consentimiento explícito. Inferir con IA las emociones de tus propios empleados está prohibido desde febrero de 2025, salvo por razones médicas o de seguridad.
Colombia. La Ley 1581 de 2012 exige una autorización previa e informada que puedas probar después (artículo 9): guarda el aviso y la aceptación con cada llamada. Los datos biométricos son sensibles (artículos 5 y 6) y requieren autorización explícita, y enviar audio a un proveedor en el exterior exige un contrato de transmisión (Decreto 1074 de 2015) o, si es una transferencia, cumplir el artículo 26. No hay ley de IA en vigor, pero la Ley 2502 de 2025 ya agrava la suplantación con IA. Detalle en el mapa regulatorio de 2026.
Lo esencial
- GPT-Live-1 (10 de septiembre de 2026) y Gemini 3.8 Live (15 de septiembre) llevan la voz a voz a producción; GPT-Live-1 cuesta USD 0,05 por minuto más el backend.
- OpenAI retira whisper-1 y sus modelos gpt-4o de transcripción el 26 de febrero de 2027: planea la migración y su costo.
- Ningún ranking mide tu español ni tu francés: prueba TTS y STT con 50 frases difíciles y una escucha a ciegas.
- La música con IA pasa a modelos con licencia, pero Sony y Universal siguen demandando a Suno, que perdió ante GEMA en Múnich.
- Anuncia la IA desde la primera frase, pide autorización para grabar y trata la huella de voz como dato biométrico.
Fuentes
- API changelog
- GPT-Live-1 model page
- API pricing
- Gemini API changelog
- Gemini API pricing
- Models
- Introducing v6
- GEMA prevails over Suno
- Sony Music and Universal Music sue Suno over its label-backed model
- Article 50: transparency obligations for providers and deployers
- 2025 IC3 Annual Report
- Regulation (EU) 2016/679 (GDPR)
Nota editorial: este análisis refleja la información pública disponible en la fecha de revisión. Modelos, precios y normas cambian rápido; cada dato de terceros enlaza a su fuente y nuestras opiniones se presentan como tales. ¿Ves un error? Escríbenos a contact@slash-digital.io.
Las preguntas que escuchamos a menudo
¿Qué es GPT-Live-1?
Un modelo de voz de OpenAI, disponible desde el 10 de septiembre de 2026, que escucha y habla a la vez (full dúplex) y delega el razonamiento y las herramientas en un agente de backend. Cuesta USD 0,05 por minuto, facturado por segundo, y el backend se paga aparte.
¿Es mejor un agente voz a voz o una cascada STT, LLM y TTS?
Depende del caso. El voz a voz busca turnos más naturales; la cascada da más control y un registro en texto de cada turno. Para trámites con datos personales, empieza por la cascada o por un voz a voz que delegue en un backend que tú controlas, y mide la latencia p95 en tu red.
¿Qué pasa con Whisper en la API de OpenAI?
OpenAI anunció el 26 de agosto de 2026 que whisper-1, gpt-4o-transcribe, gpt-4o-mini-transcribe y gpt-4o-transcribe-diarize salen de la API el 26 de febrero de 2027. Los reemplazos son GPT Transcribe y GPT Live Transcribe, a USD 0,017 por minuto.
¿Puedo usar música de Suno en una campaña?
Con un plan Pro o Premier, las condiciones de Suno dan derechos comerciales sobre las descargas; el plan gratuito es solo para uso personal. El riesgo de litigio sigue abierto: Sony y Universal demandaron por v6 y, en el caso original, Suno reconoció haber obtenido audio de YouTube con yt-dlp. Además, en Estados Unidos un prompt por sí solo no hace protegible el resultado.
¿Tengo que decir que el agente es una IA?
En la Unión Europea, sí: el artículo 50 del AI Act lo exige desde el 2 de agosto de 2026, a más tardar en la primera interacción. En Colombia no hay ley de IA en vigor, pero la Ley 1581 exige autorización informada para grabar y tratar datos, y te recomendamos anunciarlo siempre.
Más análisis para seguir
Fraude con deepfakes: protocolo para empresas
Del caso Arup a las cifras del FBI: cómo opera el fraude con voz clonada y deepfakes, y un protocolo de verificación para finanzas, talento humano y asistentes.
Agentes e ingenieríaAgentes de IA en producción: lo que funciona en 2026
Flujo o agente, los ocho componentes, datos de adopción y fracaso, uso de computador, reglas de diseño, costos, seguridad y checklist de lanzamiento.
Imagen, video y audioIA generativa en experiencias de marca y DOOH: lo que funciona en vivo
Fotomatones con IA, face swap y pantallas DOOH: latencia, moderación, consentimiento biométrico, etiquetado del AI Act y cómo medir una activación en vivo.
¿Y después de esto?
Pongámoslo en producción
Cuéntanos tu reto. Respondemos en menos de 24 horas laborales con una primera lectura honesta: si podemos ayudarte, te diremos cómo; si no, te diremos quién puede.
Contesto personalmente. Sin formularios eternos ni respuestas automáticas.