OpenAI presenta Ultrafast, que corre GPT-5.6 Sol hasta 14 veces más rápido
OpenAI abrió una vista previa de Ultrafast, un nuevo nivel de servicio de su API que ejecuta GPT-5.6 Sol a hasta 750 tokens de salida por segundo con infraestructura de Cerebras. Apunta a soporte por voz, comercio, respuesta a incidentes e investigación financiera.

La noticia en 30 segundos
Ultrafast es un nuevo nivel de servicio de la API de OpenAI, anunciado el 13 de agosto de 2026, que ejecuta GPT-5.6 Sol hasta 14 veces más rápido que el procesamiento estándar. Funciona sobre infraestructura de Cerebras y genera hasta 750 tokens de salida por segundo. Está en vista previa limitada con un grupo inicial de clientes, entre ellos Jane Street, Podium, Basis y Rogo. El objetivo es llevar el modelo más capaz de OpenAI a procesos donde cada segundo cuenta: soporte por voz, comercio, respuesta a incidentes e investigación financiera.
OpenAI anunció el jueves 13 de agosto de 2026 Ultrafast, un nuevo nivel de servicio que ejecuta GPT-5.6 Sol hasta 14 veces más rápido que el procesamiento estándar. Se lanza primero en la API de OpenAI, funciona sobre infraestructura de Cerebras y genera hasta 750 tokens de salida por segundo. Por ahora está en vista previa limitada para un grupo seleccionado de clientes.
El argumento de la compañía es que hasta ahora conseguir velocidad en tiempo real obligaba a elegir un modelo más chico o más especializado. Ultrafast apunta en otra dirección, que OpenAI resume como «más trabajo útil por segundo»: la velocidad deja de pagarse con inteligencia.
¿Para qué sirve tener un modelo 14 veces más rápido?
OpenAI enumera cinco escenarios donde la latencia era el cuello de botella real, no la capacidad del modelo:
- Respuesta a incidentes: analizar registros de aplicación, cambios recientes de código y reportes de ingenieros para identificar la causa probable mientras la caída todavía está ocurriendo.
- Investigación financiera y seguridad: evaluar señales de mercado y transacciones e identificar actividad sospechosa mientras las condiciones siguen cambiando.
- Soporte al cliente y voz: resolver casos complejos en tiempo real sin interrumpir la conversación, incluso cuando la respuesta exige varios pasos y sistemas.
- Comercio: responder preguntas de producto, revisar inventario, personalizar recomendaciones y resolver problemas de pago mientras el comprador todavía está decidiendo, antes de que la duda se convierta en carro abandonado.
- Investigación y experimentación en vivo: convertir un proceso que antes corría de un día para otro en una sesión de trabajo interactiva.
¿Qué dicen los primeros clientes?
OpenAI publicó testimonios de cuatro compañías que están probando el nivel en producción. Courtland Lykins, líder de producto de Voice AI en Podium, señala que «Ultrafast ha sido invaluable en nuestro stack de voz» y que «la velocidad cambia completamente la experiencia de llamada para el trabajo más complejo». Alex Wang, de IA aplicada en Rogo, agrega que «la velocidad no solo hace que el producto se sienta mejor, cambia para qué la gente puede usarlo realmente».
Desde Basis, el cofundador Mitch Troyanovsky apunta a un matiz técnico relevante: «muchas veces la barrera para productos verdaderamente rápidos no son solo los tokens por segundo, sino también la inteligencia del modelo, y Ultrafast combina ambas». John Crepezzi, de asistentes de IA en Jane Street, describe el aumento de velocidad de Cerebras como «impresionante».
¿Cómo lo usa OpenAI internamente?
Dentro de la compañía, un grupo de desarrolladores usa Ultrafast para respuesta a incidentes. Cuando se dispara una alerta, los equipos lo emplean para leer registros, analizar trazas, sintetizar conversaciones e identificar las siguientes verificaciones, con la salvedad explícita de que los ingenieros siguen siendo responsables del criterio y del despliegue. En investigación, el equipo pasó de lanzar lotes de experimentos durante la noche y revisarlos en la mañana, a correr varias iteraciones dentro de la misma jornada.
¿Qué significa esto para las empresas en Chile y Latinoamérica?
La disponibilidad todavía es restringida: vista previa limitada, con expansión a medida que crezca la capacidad, y hay un formulario de registro para recibir avisos de acceso. Eso importa en la región porque las capacidades más nuevas suelen llegar primero a clientes grandes de Estados Unidos. Para un equipo en Chile, Colombia o México, la lectura práctica no es «cuándo lo tendré», sino qué procesos de su operación comercial hoy están limitados por latencia y no por capacidad del modelo.
Análisis de Revenue Hub
El caso de uso que más debería llamar la atención de un líder comercial en Latinoamérica es el de comercio, porque es el único donde OpenAI nombra la métrica de negocio: el carro abandonado. La tesis es que hay ingresos que se pierden en la ventana de segundos entre que el comprador duda y se va, y que hasta ahora esa ventana era demasiado corta para meter un modelo capaz. Si eso se confirma, el impacto no está en productividad interna sino en tasa de conversión, que es una línea distinta del negocio.
Lo mismo aplica al soporte por voz. La mayoría de los despliegues de voz en la región fracasaron por una razón poco glamorosa: el silencio. Un agente que tarda tres segundos en responder rompe la conversación y el cliente pide un humano. Bajar esa latencia con el modelo bueno, no con uno degradado, es la diferencia entre un piloto que se cancela y uno que escala. Vale la advertencia: OpenAI no publicó precios de este nivel, y velocidad frontier casi nunca sale barata.
La recomendación es concreta y no depende de tener acceso hoy: identifica en tu operación los tres procesos donde el retraso mata la conversión, en vez de los procesos donde el modelo se equivoca. Son problemas distintos y hasta ahora se confundían. Puedes seguir esta línea en nuestra cobertura de IA en ventas y en el blog de Revenue Hub.
Fuente y criterio editorial
Revenue Hub resume, contextualiza y analiza esta información para equipos B2B de Chile y Latinoamérica. La publicación original pertenece a OpenAI.
Leer la fuente originalPara profundizar
Preguntas frecuentes
¿Qué es Ultrafast de OpenAI?
Es un nuevo nivel de servicio de la API de OpenAI, anunciado el 13 de agosto de 2026, que ejecuta el modelo GPT-5.6 Sol hasta 14 veces más rápido que el procesamiento estándar, generando hasta 750 tokens de salida por segundo. Corre sobre infraestructura de Cerebras.
¿Cuánto cuesta Ultrafast?
OpenAI no publicó precios para este nivel de servicio en el anuncio. Está en vista previa limitada con un grupo seleccionado de clientes y la compañía habilitó un formulario para recibir avisos cuando el acceso se expanda.
¿Qué es Cerebras y qué rol cumple en Ultrafast?
Cerebras es el proveedor de infraestructura de inferencia de ultra baja latencia con el que OpenAI mantiene una asociación. En Ultrafast, Cerebras es la capa que permite alcanzar los 750 tokens de salida por segundo sobre GPT-5.6 Sol, el modelo más capaz de OpenAI.
¿Qué empresas ya están usando Ultrafast?
OpenAI cita a Jane Street en asistentes de IA, Podium en su stack de voz, Basis en experiencias sincrónicas y Rogo en investigación financiera. Todas participan del grupo inicial de vista previa en entornos de producción reales.
¿Ultrafast usa un modelo más chico para ir más rápido?
No. Ese es precisamente el punto del anuncio. OpenAI señala que hasta ahora conseguir velocidad en tiempo real implicaba elegir un modelo más pequeño o especializado, y que Ultrafast entrega la velocidad corriendo GPT-5.6 Sol, su modelo más inteligente, sin degradarlo.
¿Está disponible Ultrafast en Chile y Latinoamérica?
Por ahora no hay disponibilidad general en ninguna región. Es una vista previa limitada a un grupo seleccionado de clientes, que OpenAI ampliará a medida que crezca la capacidad. Las empresas interesadas pueden registrarse para recibir avisos de acceso.
¿Qué casos de uso comerciales habilita la baja latencia?
Los cuatro más directos para un equipo de ingresos son soporte al cliente por voz en tiempo real, resolución de dudas de producto e inventario durante el proceso de compra, recomendaciones personalizadas antes del abandono del carro, e investigación financiera sobre condiciones que cambian.
¿Cómo se compara Ultrafast con Gemini 3.7 Flash?
Optimizan variables distintas. Gemini 3.7 Flash busca bajar el costo por token para trabajo de alto volumen, mientras Ultrafast busca bajar la latencia sin sacrificar inteligencia del modelo. Uno responde a un problema de margen y el otro a un problema de experiencia en tiempo real.

.png)

