El 8 de julio de 2026, OpenAI introdujo GPT-Live, que habilita la capacidad de escuchar y hablar al mismo tiempo, generando interacciones más “naturales”. Los modelos se convirtieron, de manera casi inmediata, en la experiencia de voz predeterminada tras su lanzamiento.

Este cambio no es una actualización incremental: es un reemplazo arquitectónico que modifica por completo la forma en la que funciona la conversación por voz en ChatGPT y resuelve el problema que más frustraba a los usuarios.

Únete a la Comunidad Adtech y entiende hacia dónde se mueve la industria

Conocer más sobre la Comunidad

La frustración de los usuarios con el modelo anterior se debe a que el modo de voz operaba en half-duplex; es decir, tomaba turnos, esperaba a que el usuario terminara de hablar antes de responder y fallaba cuando detectaba pausas naturales en medio de una oración. El resultado era una conversación rígida que se sentía más como dictar instrucciones que como hablar con alguien. La simulación estaba incompleta.

GPT-Live está construido con una arquitectura full-duplex que procesa el audio entrante mientras genera la respuesta simultáneamente, igual que las personas que escuchan para responder. Esto elimina el procesamiento secuencial de los sistemas anteriores y permite intervenciones superpuestas entre el usuario y el modelo durante un mismo intercambio. La arquitectura monitorea de forma continua el audio entrante para detectar intención, pausas e interrupciones mientras el flujo de salida continúa sin interrupción.

No, no es tan simple como “ChatGPT te miente”: el verdadero problema para marketing es cuando la IA aprende a parecer confiable
Nuevos estudios revelan comportamientos engañosos en modelos de IA. El verdadero riesgo no es ChatGPT: es la confianza en la economía digital.

Dos versiones para distintos niveles de acceso

GPT-Live-1 reemplaza Advanced Voice Mode como experiencia de voz predeterminada para los usuarios de pago de ChatGPT —planes Go, Plus y Pro—, mientras que GPT-Live-1 mini se convierte en el modelo predeterminado para usuarios gratuitos. Ambas versiones están disponibles en iOS, Android y web.

Ninguna de las dos versiones está sola: detrás opera GPT-5.5 para tareas que requieren razonamiento más profundo o búsqueda web, lo que significa que la capa de voz puede delegar preguntas complejas al modelo de mayor capacidad sin que el usuario perciba la transición.

Más allá de la arquitectura técnica, las implicaciones prácticas son concretas: los usuarios pueden interrumpir al modelo a mitad de una respuesta sin que el sistema se confunda; las pausas naturales al hablar ya no disparan una respuesta prematura; y el modelo puede insertar reconocimientos breves, como “entendido” o “claro”, mientras el usuario sigue hablando, replicando los patrones de una conversación humana real. La ficción se acerca cada vez más a la realidad.

OpenAI y Hugging Face muestran por qué los agentes necesitan límites reales. El AdTech debería tomar nota
Una evaluación de OpenAI escapó de su entorno aislado y comprometió infraestructura de Hugging Face. Estas son las implicaciones para AdTech.

La ventaja de OpenAI no es que GPT-Live sea técnicamente un sistema sin precedentes: Gemini Live, de Google, ya soporta conversaciones bidireccionales por voz. La ventaja de OpenAI es la distribución: GPT-Live llega a una aplicación que cientos de millones de personas ya abren diariamente. Para la mayoría de los consumidores, “el mejor asistente de voz con IA” va a significar “el asistente de voz que ya está en la app que uso”, y esa es una batalla que OpenAI gana por defecto.

El lanzamiento de GPT-Live llegó un día antes del despliegue público de GPT-5.6, convirtiendo la primera semana de julio en una de las semanas de producto más densas de OpenAI en 2026 y en una señal clara de que la compañía acelera para consolidar su posición antes de que los competidores reduzcan la brecha.

Únete a la Comunidad Adtech y accede a análisis exclusivos sobre el futuro de la publicidad con IA.

Ser parte de la Comunidad