OpenAI está actualizando su tecnología de voz AI para que coincida con su inteligencia artificial basada en texto. Dos nuevos modelos, el GPT-Live-1 y una versión mini, ahora están disponibles para todos chatgpt usuarios
Un par de modelos nuevos se basan en los últimos modelos de frontera de OpenAI. Puede seleccionar entre tres niveles diferentes de inteligencia dependiendo de qué tan profundas desee que sean las respuestas. Pero la mayor actualización debería ser que la voz suene más humana y más conversacional, dijo a los periodistas el líder del producto de voz ChatGPT, Atty Eletti.
Uno de los mayores cambios internos es un nuevo mecanismo llamado Interacción persistente. Este marco permite que la IA reciba información y produzca resultados simultáneamente, por lo que, en el caso de la voz, puede “escuchar” y “hablar” al mismo tiempo. Un cambio de esto modo de voz anterior que podrá responder sólo después de que usted haya terminado de hablar.
Esto es útil si desea traducir en vivo y simultáneamente: puede hablar en inglés y ChatGPT puede traducir lo que dice al español, hindi u otro idioma con solo un breve retraso.
Parte de la nueva arquitectura puede delegar o descargar tareas a los modelos Frontier de OpenAI. Por ejemplo, puede responder una pregunta que hizo mientras realizaba otro estudio.
“Cuando GPT-Live necesita pensar detenidamente en una consulta, puede delegar su lógica y su trabajo complejo a GPT-5.5, que puede funcionar en paralelo, y este GPT-Live aún puede estar en conversación con el usuario”, dijo Kundan Kumar, jefe de investigación del modelo GPT-Live. Cuando se hace esto, “teje perfectamente” la respuesta en su respuesta.
“Así es como las personas interactúan entre sí”, añade Eletti. “Mantenemos la conversación mientras pensamos en segundo plano”.
Utiliza OpenAI Nueva tecnología de diseño de IA Crear algunas respuestas visuales, cuando sea apropiado, “porque a veces la mejor respuesta se muestra, no se dice en voz alta”, dijo Eletti. Piense en informes meteorológicos, puntuaciones de juegos y otros tipos de gráficos.
Este es un ejemplo de un ChatGPT gráfico al que se le solicita que informe el clima mientras está en modo de voz.
Estos nuevos modelos de voz ahora están disponibles para todos los usuarios de ChatGPT, incluidos los usuarios gratuitos y los clientes de pago, en la aplicación móvil y el sitio web. No te preocupes si no lo ves de inmediato; OpenAI dice que puede llevar uno o dos días asegurarse de que todos tengan acceso. Esto es diferente a lo que se esperaba el jueves. Suelte la serie GPT-5.6.
Notarás que la forma en que la voz de la IA intenta imitar el habla humana son las palabras de relleno: esos “ums”, “ers” y “likes” que usamos cuando pensamos en voz alta. Aquellos que son nuevos en esta actualización. Puede evitar esto con un retraso bajo. Podrás escucharlo en silencio, respondiendo sólo cuando te llamen por su nombre a modo de llamada de atención. Sin embargo, a diferencia de Siri y Alexa, ChatGPT escuchará activamente hasta que se desactive manualmente.
OpenAI lo excluye automáticamente del entrenamiento de IA con el modo de voz. Los clips de audio se almacenan durante 30 días, por lo que la IA tiene el contexto de conversaciones anteriores y se pueden eliminar.
Tener una IA que se sienta más humana conlleva riesgos. Hemos visto numerosos casos (y caso) pérdida de IA antropogénica Puede ser perjudicial, especialmente para las personas que luchan con su salud mental. OpenAI dijo que los nuevos modelos han ampliado la protección y han funcionado mejor que los modelos anteriores en “áreas clave de seguridad”, incluidas las autolesiones, la psicosis, la violencia y el contenido sexual.











