
ChatGPT Voice está cambiando de motor. OpenAI presentó GPT-Live, una nueva generación de modelos de voz diseñada para que hablar con ChatGPT sea menos rígido, con mejores pausas, menos interrupciones y respuestas capaces de apoyarse en modelos más avanzados mientras la interacción sigue activa.
La diferencia principal está en su arquitectura full-duplex. A diferencia de sistemas anteriores, GPT-Live puede escuchar y hablar al mismo tiempo, lo que permite interacciones más naturales: puede mantenerse atento mientras el usuario piensa, aceptar interrupciones con mayor fluidez o guardar silencio cuando se le pide escuchar.
OpenAI también separó la interacción de voz del trabajo más complejo. Cuando una consulta requiere búsqueda web, razonamiento más profundo o una tarea más elaborada, GPT-Live puede delegarla a otro modelo en segundo plano. En su lanzamiento, ese modelo será GPT-5.5, lo que permite que la experiencia de voz mantenga el ritmo mientras el procesamiento más pesado ocurre detrás.

El cambio llega a ChatGPT Voice, una función usada cada semana por más de 150 millones de personas entre Voice y Dictation, según OpenAI. A partir de esta implementación, los usuarios deberían notar respuestas más naturales, mejor manejo de pausas, menos interrupciones por ruido de fondo y una toma de turnos más precisa.
La experiencia también suma niveles de inteligencia seleccionables. En ChatGPT Voice, los usuarios podrán elegir entre Instant, Medium y High, dependiendo de si necesitan una respuesta rápida o un razonamiento más profundo. OpenAI explica que GPT-Live-1 Instant y GPT-Live-1 mini usan GPT-5.5 Instant en segundo plano, mientras que las opciones Medium y High usan GPT-5.5 Thinking con mayor esfuerzo de razonamiento.
Otra novedad está en las respuestas visuales. Mientras el usuario habla, ChatGPT podrá mostrar tarjetas enriquecidas para temas como clima, deportes, acciones y otros contenidos donde ver la información resulta más útil que solo escucharla. Voice también mantiene compatibilidad con búsqueda, memoria, imágenes y archivos.
La traducción en vivo también debería sentirse más natural con GPT-Live. Al procesar la interacción de forma continua, el modelo puede sostener intercambios más fluidos entre idiomas, sin depender tanto de turnos separados o pausas demasiado marcadas.

OpenAI afirma que GPT-Live fue diseñado con medidas de seguridad específicas para voz. El sistema incorpora entrenamiento dedicado para riesgos como autolesiones, dependencia emocional, violencia y contenido sexual, además de salvaguardas capaces de intervenir durante una respuesta hablada si se detecta una salida insegura.
GPT-Live ya comenzó su despliegue global en iOS, Android y ChatGPT.com. GPT-Live-1 será el modelo de voz predeterminado para usuarios Go, Plus y Pro, mientras que GPT-Live-1 mini quedará como opción predeterminada para usuarios Free. OpenAI también planea llevar estos modelos a la API próximamente.
El lanzamiento deja claro hacia dónde va ChatGPT Voice: menos comandos aislados y más interacción continua. Si GPT-Live cumple lo que promete en el uso diario, hablar con ChatGPT podría sentirse más cercano a trabajar con un asistente que escucha, espera, razona y muestra información cuando hace falta. Sigue atento a T3 Latam para más noticias sobre inteligencia artificial, tecnología, apps y productividad.