Imagen, video y audio · Septiembre 2026

La voz ya es una interfaz de producción: qué usar y qué vigilar en 2026

Septiembre de 2026 trajo GPT-Live-1, Gemini 3.8 Live, Gemini 3.8 Flash TTS y Suno v6, mientras tribunales y sellos redefinen qué música con IA se puede usar. Esta guía ordena modelos, latencias, precios y reglas para un equipo que quiere poner voz en producción en español y en francés.

USD 0,05/min GPT-Live-1, sin el agente de backend2 ago. 2026 rige el artículo 50 del AI Act31 jul. 2026 fallo de GEMA contra Suno en Múnich
En resumen

OpenAI puso GPT-Live-1 en disponibilidad general el 10 de septiembre de 2026: un modelo que escucha y habla a la vez y delega el razonamiento en un agente de backend, a USD 0,05 por minuto. Google respondió con Gemini 3.8 Live el 15 de septiembre y Gemini 3.8 Flash TTS el 22.

En música, Suno lanzó v6 con Warner, BMG y Believe, pero Sony y Universal lo demandaron el 18 de septiembre, y un tribunal de Múnich falló contra Suno por entrenar con obras de GEMA. Nuestra lectura: elige la arquitectura por latencia y control, prueba siempre en tu español y tu francés, trata la clonación de voz como un riesgo legal y de fraude, y anuncia desde el primer segundo que quien atiende es una IA.

Síntesis de voz (TTS): opciones comerciales y abiertas

Lo verificado a septiembre de 2026 y lo que te toca probar en español y en francés.

Según la documentación y las páginas de precios de cada proveedor, consultadas en septiembre de 2026. Latencias de modelo reportadas por el fabricante, sin red ni turnos.
ModeloAccesoIdiomas y límitesLatencia o precio publicado
gpt-4o-mini-tts (OpenAI)APIModelo TTS vigente en el catálogo de OpenAIUSD 0,60 por millón de tokens de texto y USD 12 por millón de tokens de audio
Gemini 3.8 Flash TTS (Google, 22 sept. 2026)APIPresentado como TTS creativo con calidad de estudioUSD 0,50 por millón de tokens de texto y USD 9 por millón de tokens de audio (nivel de pago)
eleven_flash_v2_5 (ElevenLabs)API32 idiomas, 40.000 caracteres por peticiónunos 75 ms
eleven_v3 y v3_conversational (ElevenLabs)APIv3: más de 70 idiomas, 5.000 caracteres por petición; v3_conversational: tiempo realunos 280 ms (conversational)
Chatterbox (Resemble AI)Pesos abiertos, MIT23 idiomas según su ficha; marca de agua PerTh en cada salidaAutoalojado
VibeVoice-1.5B (Microsoft)Pesos abiertos, MITFormato largo y varios locutores; solo inglés y chinoAutoalojado

Qué probar. Nuestra regla: escribe 50 frases difíciles por idioma (cifras, fechas y montos con separadores locales, NIT, nombres propios, siglas, términos en inglés), genéralas con dos o tres proveedores y haz una escucha a ciegas con cinco personas del público objetivo. Una voz con acento de España puede sonar ajena en Bogotá, y el francés de Quebec no es el de París.

Transcripción (STT): precisión, diarización y migraciones

OpenAI renueva su línea: GPT Transcribe (archivos) y GPT Live Transcribe (baja latencia) cuestan USD 0,017 por minuto, igual que GPT-Realtime-Whisper, su modelo de transcripción en streaming de mayo. whisper-1, gpt-4o-transcribe, gpt-4o-mini-transcribe y gpt-4o-transcribe-diarize dejan la API el 26 de febrero de 2027. Si hoy pagas el Whisper antiguo a USD 0,006 por minuto, tu costo casi se triplica al migrar.

Google lista Gemini 3.5 Transcribe a unos USD 0,005 por minuto. ElevenLabs ofrece scribe_v2 (más de 90 idiomas), scribe_v2_realtime (unos 150 ms según la empresa) y scribe_v2_medical para audio clínico. En pesos abiertos con licencia clara: Whisper large-v3-turbo (unos 809 millones de parámetros, MIT), NVIDIA Parakeet TDT 0.6B v3 (CC-BY-4.0, 25 idiomas europeos) y Mistral Voxtral Mini 3B (Apache 2.0, con español y francés).

Precisión: mide con tu audio. El WER de un ranking público no dice cómo le irá a tu centro de contacto. Prueba audio telefónico de 8 kHz con ruido real, acentos regionales y cifras dictadas (cédula, NIT, placas): OpenAI destacó justamente una mejor precisión alfanumérica en GPT-Realtime-2.1, en julio de 2026. Si dependes de la diarización, confirma que el reemplazo de gpt-4o-transcribe-diarize cubre tu caso antes de 2027.

Agentes de voz: voz a voz o cascada

Voz a voz. Un solo modelo recibe audio y responde con audio. GPT-Live-1 es full dúplex (escucha mientras habla) y delega el razonamiento y las herramientas en un agente de backend. Solo funciona en el endpoint Live de OpenAI y sus límites se cuentan en sesiones simultáneas: de 25 en el nivel 1 a 500 en el nivel 5, sin nivel gratuito. Google presenta Gemini 3.8 Live como el modelo por defecto de su Live API para agentes de baja latencia.

Cascada. STT en streaming, un LLM con herramientas y TTS en streaming, cada pieza intercambiable. Ganas control: ves el texto de cada turno, aplicas reglas antes de que algo se pronuncie y eliges la mejor voz en español. Pagas en latencia y en ingeniería de turnos.

Precios de lista de OpenAI y Google consultados en septiembre de 2026. No incluyen telefonía ni el LLM de backend.
OpciónArquitecturaPrecio publicado
GPT-Live-1 (OpenAI, 10 sept. 2026)Voz a voz full dúplex, backend aparteUSD 0,05/min, facturado por segundo
gpt-realtime-2.1 y 2.1-mini (OpenAI, 6 jul. 2026)Voz a voz en la API RealtimeUSD 32 / 64 por millón de tokens de audio (entrada / salida); mini: 10 / 20
Gemini 3.8 Live (Google, 15 sept. 2026)Audio a audio en la Live APIUnos USD 0,005/min de entrada y 0,018/min de salida
Cascada STT + LLM + TTSTres piezas intercambiablesSuma de las tres; más control por turno

Nuestra regla de decisión: si la conversación es abierta y la naturalidad pesa más que el control, empieza por voz a voz. Si hay trámites con datos personales, reglas de negocio o auditoría, empieza por la cascada o por un modelo voz a voz que delegue en un backend donde tú controlas herramientas y reglas, que es lo que propone GPT-Live-1. Más en agentes de IA en producción.

Latencia, turnos e interrupciones

Un presupuesto por tramo y cinco reglas para que la conversación no suene robótica.

Guía de diseño de Slash para planificar y medir, no una medición ni un dato de proveedor. El tramo de TTS parte de las latencias de modelo que publica ElevenLabs (unos 75 y 280 ms).
TramoCascadaVoz a vozQué medir
Red y audio de entrada50–150 ms50–150 msCódec, jitter, 8 kHz o 16 kHz
Detección de fin de turno200–500 msIncluida en el modeloCortes a mitad de frase, silencios largos
Transcripción final100–300 msNo aplicaErrores en cifras y nombres
Primer token del LLM200–600 msNo aplicaCon tus prompts y herramientas reales
Primer audio75–300 ms300–800 ms desde el fin del turnoTiempo al primer byte de audio
Red y reproducción de salida50–150 ms50–150 msBúfer del reproductor
Total hasta la primera sílaba0,7–2,0 s0,4–1,1 sp50 y p95 por llamada

Interrupciones (barge-in) y turnos

  1. Escucha también mientras el agente habla, con cancelación de eco.
  2. Si el usuario interrumpe, corta el audio y borra del historial lo no dicho: el modelo debe saber qué oyó la persona.
  3. No cuentes un «ajá» o una tos como interrupción; ajusta el umbral con grabaciones reales.
  4. Detecta el fin de turno por sentido, no solo por silencio: quien dicta un número hace pausas.
  5. Lee en voz alta los datos críticos (cédula, montos, fechas) y confirma antes de actuar.
Regla práctica

Presupuesta y vigila la latencia en el percentil 95, no en el promedio, y dispara una alerta por llamada cuando un turno supere tu umbral.

Música con IA: modelos, pleitos y licencias

El mercado pasa de entrenar sin permiso a modelos con licencia, y los tribunales marcan el ritmo.

Estado al 26 de septiembre de 2026, según las empresas, GEMA y prensa especializada.
ActorAcuerdos y licenciasLitigios y condiciones clave
SunoWarner (nov. 2025), BMG (ago. 2026), Believe y TuneCore (sept. 2026); v6 lanzado el 9 sept. 2026Nueva demanda de Sony y Universal contra v6 (18 sept. 2026, 60.202 grabaciones citadas); fallo de GEMA en Múnich; demandas de Koda y SOCAN
UdioUniversal (oct. 2025) y Warner (nov. 2025), con una plataforma con licencia anunciada para 2026Sony sigue litigando: segunda demanda en julio de 2026 por unas 30.000 canciones más
Google Lyria 3.5 (3 sept. 2026)Filtros que bloquean voces de artistas concretos y letras protegidasUSD 0,08 por canción en la API; SynthID en todo el audio
ElevenLabs (Eleven Music)Acuerdo plurianual con Universal (10 sept. 2026)Uso comercial en planes de pago, con límites por plan

Suno resume el momento. Su v6 se hizo con Warner, BMG y Believe, y la empresa retira todos sus modelos anteriores. Sony y Universal, que no firmaron, alegan que v6 «lava» la infracción porque se entrenó en parte con salidas de modelos previos.

En Europa, el Tribunal Regional de Múnich falló el 31 de julio de 2026 que Suno infringió derechos al entrenar con obras de GEMA sin licencia y al reproducir obras que coinciden en melodía, armonía y ritmo con canciones conocidas.

Si tu marca usa música generada

  • Usa planes con derechos comerciales explícitos: en Suno, las descargas de Pro y Premier los incluyen y las del plan gratuito son solo para uso personal.
  • Guarda la prueba de cada pieza de campaña: herramienta, plan, fecha, prompt y archivo.
  • No pidas imitar a un artista concreto ni una voz reconocible.
  • Cuenta con fricción en la distribución: Deezer dice que más del 50 % de las canciones nuevas subidas en junio de 2026 eran totalmente generadas con IA y las saca de sus recomendaciones.

Clonación de voz: consentimiento, marcas de agua y fraude

Clonar una voz ya es una función de producto: desde v5.5 (marzo de 2026), Suno permite grabar tu propia voz y reutilizarla en canciones. La regla es el consentimiento explícito: un contrato que diga qué voz, para qué usos, en qué idiomas, por cuánto tiempo y cómo se revoca.

Desde el 2 de agosto de 2026, el artículo 50 del AI Act obliga a marcar el audio sintético de forma detectable por máquina y a revelar los deepfakes de audio; el código de buenas prácticas de la Comisión pide metadatos firmados más una marca de agua. Según el NIST, ninguna técnica de procedencia o detección basta por sí sola.

Fraude

El informe 2025 del IC3 del FBI suma más de USD 5 millones perdidos en estafas de «emergencia» con voz clonada, y según un estudio de Kaspersky de septiembre de 2026, el 31 % de las víctimas de estafas por mensajería reportó voces clonadas o sintéticas. No uses la voz como factor de autenticación. Más en fraude con deepfakes.

Arquitectura de referencia y cumplimiento: agente de voz en español

  1. Entrada: telefonía SIP o WebRTC con un aviso inicial: hablas con una IA, la llamada se graba, para qué y cómo pedir un humano.
  2. Motor: voz a voz o cascada, detrás de una interfaz propia para cambiar de proveedor.
  3. Voz: STT y TTS elegidos con tu prueba de 50 frases en español colombiano, y una voz de marca con contrato.
  4. Backend: un LLM con herramientas estrictas (CRM, pedidos, tickets), permisos mínimos, confirmación en voz alta antes de cualquier cambio y defensas contra la inyección de instrucciones.
  5. Traspaso: a un humano, con resumen, cuando el usuario lo pida o tras dos intentos fallidos; la identidad se verifica con un factor distinto de la voz.
  6. Operación: latencia p50 y p95, muestra de transcripciones revisada, tasa de resolución sin humano y borrado automático de las grabaciones al vencer el plazo.

Cumplimiento

Unión Europea. Desde el 2 de agosto de 2026, el artículo 50 del AI Act exige avisar de forma clara, a más tardar en la primera interacción, que se habla con una IA; la multa llega a 15 millones de euros o al 3 % de la facturación mundial, lo que sea mayor. Una grabación es un dato personal según el RGPD, y una huella de voz usada para identificar a alguien es un dato biométrico de categoría especial (artículo 9) que, en la práctica, suele exigir consentimiento explícito. Inferir con IA las emociones de tus propios empleados está prohibido desde febrero de 2025, salvo por razones médicas o de seguridad.

Colombia. La Ley 1581 de 2012 exige una autorización previa e informada que puedas probar después (artículo 9): guarda el aviso y la aceptación con cada llamada. Los datos biométricos son sensibles (artículos 5 y 6) y requieren autorización explícita, y enviar audio a un proveedor en el exterior exige un contrato de transmisión (Decreto 1074 de 2015) o, si es una transferencia, cumplir el artículo 26. No hay ley de IA en vigor, pero la Ley 2502 de 2025 ya agrava la suplantación con IA. Detalle en el mapa regulatorio de 2026.

Lo esencial

  • GPT-Live-1 (10 de septiembre de 2026) y Gemini 3.8 Live (15 de septiembre) llevan la voz a voz a producción; GPT-Live-1 cuesta USD 0,05 por minuto más el backend.
  • OpenAI retira whisper-1 y sus modelos gpt-4o de transcripción el 26 de febrero de 2027: planea la migración y su costo.
  • Ningún ranking mide tu español ni tu francés: prueba TTS y STT con 50 frases difíciles y una escucha a ciegas.
  • La música con IA pasa a modelos con licencia, pero Sony y Universal siguen demandando a Suno, que perdió ante GEMA en Múnich.
  • Anuncia la IA desde la primera frase, pide autorización para grabar y trata la huella de voz como dato biométrico.

Fuentes

  1. API changelog · OpenAI, 2026-09
  2. GPT-Live-1 model page · OpenAI, 2026-09-10
  3. API pricing · OpenAI, 2026-09
  4. Gemini API changelog · Google, 2026-09
  5. Gemini API pricing · Google, 2026-09
  6. Models · ElevenLabs documentation, 2026-09
  7. Introducing v6 · Suno, 2026-09-09
  8. GEMA prevails over Suno · GEMA, 2026-07-31
  9. Sony Music and Universal Music sue Suno over its label-backed model · Variety, 2026-09-18
  10. Article 50: transparency obligations for providers and deployers · AI Act Service Desk, European Commission, 2026-08-02
  11. 2025 IC3 Annual Report · FBI Internet Crime Complaint Center, 2026-04
  12. Regulation (EU) 2016/679 (GDPR) · EUR-Lex, 2016-04-27

Nota editorial: este análisis refleja la información pública disponible en la fecha de revisión. Modelos, precios y normas cambian rápido; cada dato de terceros enlaza a su fuente y nuestras opiniones se presentan como tales. ¿Ves un error? Escríbenos a contact@slash-digital.io.

Preguntas frecuentes

Las preguntas que escuchamos a menudo

¿Qué es GPT-Live-1?

Un modelo de voz de OpenAI, disponible desde el 10 de septiembre de 2026, que escucha y habla a la vez (full dúplex) y delega el razonamiento y las herramientas en un agente de backend. Cuesta USD 0,05 por minuto, facturado por segundo, y el backend se paga aparte.

¿Es mejor un agente voz a voz o una cascada STT, LLM y TTS?

Depende del caso. El voz a voz busca turnos más naturales; la cascada da más control y un registro en texto de cada turno. Para trámites con datos personales, empieza por la cascada o por un voz a voz que delegue en un backend que tú controlas, y mide la latencia p95 en tu red.

¿Qué pasa con Whisper en la API de OpenAI?

OpenAI anunció el 26 de agosto de 2026 que whisper-1, gpt-4o-transcribe, gpt-4o-mini-transcribe y gpt-4o-transcribe-diarize salen de la API el 26 de febrero de 2027. Los reemplazos son GPT Transcribe y GPT Live Transcribe, a USD 0,017 por minuto.

¿Puedo usar música de Suno en una campaña?

Con un plan Pro o Premier, las condiciones de Suno dan derechos comerciales sobre las descargas; el plan gratuito es solo para uso personal. El riesgo de litigio sigue abierto: Sony y Universal demandaron por v6 y, en el caso original, Suno reconoció haber obtenido audio de YouTube con yt-dlp. Además, en Estados Unidos un prompt por sí solo no hace protegible el resultado.

¿Tengo que decir que el agente es una IA?

En la Unión Europea, sí: el artículo 50 del AI Act lo exige desde el 2 de agosto de 2026, a más tardar en la primera interacción. En Colombia no hay ley de IA en vigor, pero la Ley 1581 exige autorización informada para grabar y tratar datos, y te recomendamos anunciarlo siempre.

Hablar con Slash

Pongámoslo en producción

Cuéntanos tu reto. Respondemos en menos de 24 horas laborales con una primera lectura honesta: si podemos ayudarte, te diremos cómo; si no, te diremos quién puede.

Contesto personalmente. Sin formularios eternos ni respuestas automáticas.

Escribirle a Esteban