OpenAI lleva GPT-Live-1 a su API: agentes de voz que escuchan y hablan a la vez por 0,05 dólares el minuto
OpenAI habilitó el 10 de septiembre de 2026 GPT-Live-1 en su API, un modelo de voz full-duplex que maneja interrupciones y conversación mientras delega el razonamiento a modelos de backend. La capa de voz cuesta 0,05 dólares por minuto.

La noticia en 30 segundos
OpenAI habilitó GPT-Live-1 en su API el 10 de septiembre de 2026. Es un modelo de voz full-duplex que escucha y habla al mismo tiempo, maneja interrupciones y ruido de fondo, y delega el razonamiento y las herramientas a modelos de backend como Luna o GPT-6 Astra mientras la conversación continúa. La capa de voz cuesta 0,05 dólares por minuto, sin incluir el backend. OpenAI reporta 30 puntos porcentuales de mejora sobre GPT-Realtime-2.1 en Full Duplex Bench, soporte de telefonía y 12 voces nuevas.
OpenAI lanzó el jueves 10 de septiembre de 2026 GPT-Live-1 en su API. La compañía lo describe como la llegada a la API de las conversaciones naturales y full-duplex de ChatGPT, con más control sobre cómo hablan y actúan los agentes de voz. El dato que más llama la atención es el precio de la capa de voz: 0,05 dólares por minuto.
Full-duplex significa que el modelo escucha y habla al mismo tiempo, como en una llamada entre personas, en lugar de esperar a que el usuario termine su turno para responder. Para quienes operan equipos de ventas, agendamiento o servicio al cliente por teléfono, ese detalle técnico define si un agente de voz suena como un menú automatizado o como una conversación.
¿Qué es GPT-Live-1 y en qué se diferencia de un agente de voz tradicional?
Según OpenAI, los agentes de voz tradicionales encadenan tres piezas: reconocimiento de voz, un modelo de razonamiento y síntesis de voz. Cada traspaso agrega latencia y abre espacio para perder el ritmo, el contexto o la naturalidad de la conversación. GPT-Live-1 maneja la escucha y el habla en un solo modelo, lo que simplifica la capa de voz.
El modelo puede responder a interrupciones y confirmaciones a medida que ocurren, mientras delega el razonamiento profundo y las llamadas a herramientas a un modelo de texto en el backend. Así la conversación sigue mientras el trabajo ocurre en segundo plano. OpenAI sugiere combinarlo con un modelo como Luna para tareas de alto volumen, como agendamiento o actualizaciones de pedidos, y con un modelo como Astra para casos de clientes complejos que requieren razonamiento.
¿Cuánto cuesta GPT-Live-1 y qué capacidades incluye?
El precio es de 0,05 dólares por minuto para la capa de voz. A eso se suma el costo del modelo de backend y del harness de agente que cada empresa elija. Entre las capacidades anunciadas:
- Manejo de interrupciones con un solo modelo que razona sobre el audio entrante y saliente a la vez.
- Control del tono, el ritmo y el estilo conversacional del agente a través del prompt de sistema.
- Mejor manejo del ruido de fondo y de los silencios sin interrumpir al usuario.
- Mayor retención de contexto y calidad conversacional en interacciones largas.
- Soporte de telefonía para desplegar agentes de voz full-duplex en llamadas.
- Transcripciones nativas, detección de turnos, comprensión de datos alfanuméricos y sesgo por palabras clave.
- 12 voces nuevas; las voces personalizadas requieren contactar al equipo de ventas.
El anuncio no especifica qué idiomas soporta. OpenAI indica que seguirá ampliando las opciones de voz y la disponibilidad de idiomas en los próximos meses.
¿Qué resultados muestran los benchmarks y los primeros clientes?
Según OpenAI, GPT-Live-1 supera por 30 puntos porcentuales a GPT-Realtime-2.1 en Full Duplex Bench. Combinado con GPT-6 Astra con esfuerzo de razonamiento medio, ocupa el primer lugar en Tau3, un benchmark que mide la inteligencia de agentes de voz en tareas completas.
Entre los clientes, Speak redujo casi 80% las interrupciones durante las pausas en que el usuario piensa, frente a sistemas anteriores basados en turnos. Alex Levy, director de tecnología citado por OpenAI, afirmó que incorporar GPT-Live-1 en Yelp Host y Hatch mejoró la toma de turnos y la precisión frente a su arquitectura de voz tradicional. Fin destacó que el modelo lleva el soporte por voz desde un ritmo de pausas y arranques hacia el flujo natural de una llamada, y Cognition lo integra en Devin para que trabajar con un ingeniero de IA se parezca más a colaborar con un compañero.
¿Qué significa para las empresas en Chile y Latinoamérica?
En Chile y Latinoamérica, buena parte de la operación comercial y de servicio todavía pasa por llamadas: confirmaciones, seguimientos, cobranzas y atención de consultas. Un costo de voz de 0,05 dólares por minuto, más el backend, acerca a empresas medianas casos que antes solo se justificaban en grandes contact centers, como confirmar reuniones, calificar leads entrantes o reagendar visitas.
El punto crítico es el idioma. Como OpenAI no detalla qué idiomas soporta GPT-Live-1, cualquier equipo que quiera usarlo en español debe probar su desempeño con acentos locales, modismos y el ruido real de las llamadas antes de comprometer un despliegue.
Análisis de Revenue Hub
El precio por minuto engaña si se lee solo. Los 0,05 dólares corresponden a la capa de voz; el costo real de una llamada depende del modelo de backend, de cuántas herramientas consulta el agente y de cuánto dura la conversación. Antes de proyectar ahorros frente a un equipo de SDR o de servicio, construye el costo por conversación completa y compáralo con el costo por reunión agendada o por caso resuelto, que es la unidad que realmente importa en la operación comercial.
La recomendación concreta es partir por llamadas de alto volumen y baja ambigüedad: confirmación de reuniones, recordatorios de renovación o recontacto de leads que no respondieron. Son procesos donde el agente de voz no reemplaza la conversación de venta, sino que libera horas de los ejecutivos para las conversaciones que sí la requieren. Cada llamada debe quedar registrada en el CRM con transcripción, resultado y siguiente paso; de lo contrario, el agente genera actividad sin trazabilidad.
Hay además una condición de confianza que no se negocia: el cliente debe saber que habla con un agente de IA y tener una salida clara hacia una persona. Una voz más natural facilita la conversación, pero también eleva el costo reputacional de no transparentarlo. Seguimos la evolución de los agentes de voz y ventas en IA para ventas y en el blog de Revenue Hub.
Fuente y criterio editorial
Revenue Hub resume, contextualiza y analiza esta información para equipos B2B de Chile y Latinoamérica. La publicación original pertenece a OpenAI.
Leer la fuente originalPara profundizar
Preguntas frecuentes
¿Qué es GPT-Live-1 de OpenAI?
Es un modelo de voz full-duplex que OpenAI habilitó en su API el 10 de septiembre de 2026. Escucha y habla al mismo tiempo, maneja interrupciones y ruido de fondo, y delega el razonamiento profundo y las llamadas a herramientas a un modelo de texto en el backend.
¿Cuánto cuesta GPT-Live-1 en la API?
La capa de voz cuesta 0,05 dólares por minuto. A ese valor se suma el costo del modelo de backend, como Luna o Astra, y del harness de agente que use cada empresa, por lo que el costo final depende de cada caso.
¿Qué significa que un modelo de voz sea full-duplex?
Significa que puede escuchar y hablar simultáneamente, como en una llamada entre personas. A diferencia de los sistemas por turnos, responde a interrupciones y confirmaciones mientras ocurren, lo que hace la conversación más natural.
¿GPT-Live-1 funciona para llamadas telefónicas?
Sí. OpenAI incluye soporte de telefonía para desplegar agentes de voz full-duplex en llamadas. También ofrece transcripciones nativas, detección de turnos, sesgo por palabras clave y 12 voces nuevas.
¿GPT-Live-1 habla español?
El anuncio de OpenAI no especifica qué idiomas soporta el modelo y solo indica que ampliará la disponibilidad de idiomas en los próximos meses. Las empresas que quieran usarlo en español deben probar su desempeño con acentos y condiciones reales antes de desplegarlo.
¿Qué resultados reportan las empresas que usan GPT-Live-1?
Speak redujo casi 80% las interrupciones durante las pausas de sus usuarios frente a sistemas por turnos. Yelp Host y Hatch reportaron mejoras en la toma de turnos y la precisión, y OpenAI afirma que supera por 30 puntos porcentuales a GPT-Realtime-2.1 en Full Duplex Bench.
¿Cómo pueden usar agentes de voz las empresas de Chile y Latinoamérica?
Conviene partir por llamadas de alto volumen y baja ambigüedad, como confirmar reuniones, enviar recordatorios de renovación o recontactar leads. Cada llamada debe registrarse en el CRM y el cliente debe saber que habla con un agente de IA, con opción de derivar a una persona.




¿Cómo se vive esto en tu equipo?
Participa con tu nombre o un alias. Sin crear una cuenta ni dejar tu correo.
Cargando comentarios…