OpenAI lanzó GPT-Live el miércoles, presentando dos nuevos modelos de voz que reemplazan el modo de voz avanzado existente. Los modelos GPT-Live-1 y GPT-Live-1 mini permiten escuchar y hablar simultáneamente, imitando la conversación humana. GPT-Live-1 es el valor predeterminado para usuarios pagos en los niveles Go, Plus y Pro, mientras que GPT-Live-1 mini es para usuarios de nivel gratuito.
El lanzamiento comienza a nivel mundial en iOS, Android y ChatGPT.com. OpenAI planea integrar los modelos en su API para desarrolladores. GPT-Live representa la tercera generación de la tecnología de voz de ChatGPT desarrollada en dos años.
La característica clave de GPT-Live es una “arquitectura full-duplex”, que permite el procesamiento de audio en tiempo real mientras genera respuestas. “En lugar de procesar una secuencia de mensajes separados, GPT-Live procesa continuamente la entrada mientras genera la salida”, dijo OpenAI en una publicación de blog. Esto permite reconocimientos conversacionales como “mhmm” y evita interrupciones durante los intercambios.
El modo de voz avanzado anterior, lanzado en septiembre de 2024, operaba mediante intercambios rígidos paso a paso, lo que generaba frustraciones en la experiencia del usuario. El ruido de fondo podría desencadenar respuestas prematuras y afectar el flujo de la conversación.
GPT-Live también separa la interacción de voz del razonamiento al delegar consultas complejas a un modelo en segundo plano, concretamente GPT-5.5, mientras continúa la conversación sin problemas. “Mientras funciona, GPT-Live puede seguir hablando con usted y mantener el flujo de la conversación”, explicó OpenAI.
La voz original de ChatGPT, lanzada en 2023, se basaba en un proceso complejo que introducía latencia y pérdida de información en todos los modelos. Esta configuración se perfeccionó en el modo de voz avanzado, que intentó agilizar el proceso pero aun así provocó pausas e interrupciones incómodas.
OpenAI busca mitigar las preocupaciones de controversias pasadas sobre la suplantación de voces, particularmente derivadas de la voz de “Sky” que se parece a la de la actriz Scarlett Johansson. La empresa enfatizó que GPT-Live evita la suplantación e incorpora salvaguardias contra la imitación de voces de personas reales.
Actualmente, más de 150 millones de usuarios interactúan semanalmente con las funciones de voz de ChatGPT, parte de un total de 900 millones de usuarios activos. Con GPT-Live, los usuarios pueden acceder a tarjetas visuales enriquecidas y elegir entre tres niveles de razonamiento de respuesta: Instantáneo, Medio y Alto. El sistema también promete un rendimiento mejorado en la gestión del ruido de fondo y las interrupciones de los usuarios durante las conversaciones.
Las medidas de seguridad han evolucionado junto con los nuevos modelos. OpenAI realizó evaluaciones exhaustivas, demostrando el rendimiento mejorado de GPT-Live en categorías que incluyen autolesión y discurso de odio, abordando riesgos únicos asociados con interacciones de voz en tiempo real.
Mientras OpenAI avanza en su tecnología de voz, competidores como Google, ByteDance y Nvidia también han lanzado recientemente sus propios sistemas full-duplex. Actualmente, GPT-Live carece de ciertas funciones, como interacción de video o uso compartido de pantalla, que se están convirtiendo en estándar en las ofertas de inteligencia artificial de voz.
En general, GPT-Live representa un avance significativo para OpenAI, ya que posiciona la voz como una capa de interacción principal para la inteligencia artificial, apuntando a capacidades más naturales y agentes en la comunicación de IA.








