OpenAI lanzó GPT-Live el miércoles, presentando dos nuevos modelos de voz que reemplazan el modo de voz avanzado existente. Los modelos GPT-Live-1 y GPT-Live-1 mini permiten escuchar y hablar simultáneamente, imitando la conversación humana. GPT-Live-1 es el valor predeterminado para usuarios pagos en los niveles Go, Plus y Pro, mientras que GPT-Live-1 mini es para usuarios de nivel gratuito.

El lanzamiento comienza a nivel mundial en iOS, Android y ChatGPT.com. OpenAI planea integrar los modelos en su API para desarrolladores. GPT-Live representa la tercera generación de la tecnología de voz de ChatGPT desarrollada en dos años.

La característica clave de GPT-Live es una “arquitectura full-duplex”, que permite el procesamiento de audio en tiempo real mientras genera respuestas. “En lugar de procesar una secuencia de mensajes separados, GPT-Live procesa continuamente la entrada mientras genera la salida”, dijo OpenAI en una publicación de blog. Esto permite reconocimientos conversacionales como “mhmm” y evita interrupciones durante los intercambios.

El modo de voz avanzado anterior, lanzado en septiembre de 2024, operaba mediante intercambios rígidos paso a paso, lo que generaba frustraciones en la experiencia del usuario. El ruido de fondo podría desencadenar respuestas prematuras y afectar el flujo de la conversación.

  MBZUAI presenta el modelo de razonamiento K2 Think

GPT-Live también separa la interacción de voz del razonamiento al delegar consultas complejas a un modelo en segundo plano, concretamente GPT-5.5, mientras continúa la conversación sin problemas. “Mientras funciona, GPT-Live puede seguir hablando con usted y mantener el flujo de la conversación”, explicó OpenAI.

La voz original de ChatGPT, lanzada en 2023, se basaba en un proceso complejo que introducía latencia y pérdida de información en todos los modelos. Esta configuración se perfeccionó en el modo de voz avanzado, que intentó agilizar el proceso pero aun así provocó pausas e interrupciones incómodas.

OpenAI busca mitigar las preocupaciones de controversias pasadas sobre la suplantación de voces, particularmente derivadas de la voz de “Sky” que se parece a la de la actriz Scarlett Johansson. La empresa enfatizó que GPT-Live evita la suplantación e incorpora salvaguardias contra la imitación de voces de personas reales.

  OpenAI lanza la alternancia para los niveles de esfuerzo de pensamiento GPT-5

Actualmente, más de 150 millones de usuarios interactúan semanalmente con las funciones de voz de ChatGPT, parte de un total de 900 millones de usuarios activos. Con GPT-Live, los usuarios pueden acceder a tarjetas visuales enriquecidas y elegir entre tres niveles de razonamiento de respuesta: Instantáneo, Medio y Alto. El sistema también promete un rendimiento mejorado en la gestión del ruido de fondo y las interrupciones de los usuarios durante las conversaciones.

Las medidas de seguridad han evolucionado junto con los nuevos modelos. OpenAI realizó evaluaciones exhaustivas, demostrando el rendimiento mejorado de GPT-Live en categorías que incluyen autolesión y discurso de odio, abordando riesgos únicos asociados con interacciones de voz en tiempo real.

Mientras OpenAI avanza en su tecnología de voz, competidores como Google, ByteDance y Nvidia también han lanzado recientemente sus propios sistemas full-duplex. Actualmente, GPT-Live carece de ciertas funciones, como interacción de video o uso compartido de pantalla, que se están convirtiendo en estándar en las ofertas de inteligencia artificial de voz.

  Firefox agrega controles completos de exclusión de IA a los navegadores iOS y Android

En general, GPT-Live representa un avance significativo para OpenAI, ya que posiciona la voz como una capa de interacción principal para la inteligencia artificial, apuntando a capacidades más naturales y agentes en la comunicación de IA.

Crédito de imagen destacada