IA en Ventas

Cómo activar dos ajustes de la API triplicó los puntajes de OpenAI en el benchmark ARC-AGI-3

OpenAI mostró que retener el razonamiento y activar compactación en su Responses API llevaron a GPT-5.6 Sol de 13,3% a 38,3% en ARC-AGI-3, con 6 veces menos tokens de salida. El hallazgo pone en duda cómo se comparan los modelos.

6 min de lecturaFuente: OpenAI
Imagen de portada del análisis de OpenAI sobre el benchmark ARC-AGI-3 y GPT-5.6 Sol
Imagen: OpenAI

La noticia en 30 segundos

OpenAI publicó el 29 de julio de 2026 que activar dos ajustes de su API, razonamiento retenido y compactación, triplicó el puntaje de GPT-5.6 Sol en el benchmark ARC-AGI-3: pasó de 13,3% con el harness oficial a 38,3%, usando 6 veces menos tokens de salida. La lección práctica es que un benchmark no mide solo al modelo, también mide decisiones invisibles de configuración. Para equipos que construyen agentes en Chile y Latinoamérica, OpenAI recomienda usar la Responses API, retener el razonamiento entre turnos y activar compactación en vez de truncar el contexto.

OpenAI publicó el 29 de julio de 2026 un análisis firmado por Ilan Bigio y Ted Sanders sobre un resultado que no cuadraba: GPT-5.6 Sol rendía muy por debajo de lo esperado en ARC-AGI-3, un benchmark de juegos de puzzle en dos dimensiones. El mismo modelo había resuelto problemas abiertos de matemáticas y completado videojuegos como Pokémon FireRed, pero en ARC-AGI-3 marcaba apenas 7,8%. La explicación no estaba en el modelo, sino en la configuración con la que se lo estaba evaluando.

¿Qué es ARC-AGI-3 y por qué GPT-5.6 Sol puntuaba tan bajo?

ARC-AGI-3 mide qué tan bien un agente de IA aprende y razona en juegos que nunca vio, sin instrucciones explícitas. Usa a propósito un harness genérico, sin herramientas ni funciones especiales, con la idea de que un entorno simple hace más visibles las debilidades del modelo y vuelve más justa la comparación.

Al revisar los intentos, OpenAI encontró dos decisiones del harness que explicaban el bajo desempeño. Primero, después de cada acción del juego se descartaba todo el razonamiento privado del modelo, es decir, en cada movimiento el modelo tenía que reinterpretar el juego desde cero. Segundo, el harness usaba una ventana de truncamiento rodante: al superar los 175.000 caracteres, los mensajes más antiguos desaparecían. El modelo no solo perdía su pensamiento previo, también perdía memoria de sus acciones anteriores.

¿Qué hacen el razonamiento retenido y la compactación?

Los modelos de OpenAI se entrenan para razonar en mensajes privados antes de responder o llamar a una herramienta, y esos mensajes quedan en el historial de la conversación. Es así como operan en ChatGPT y en Codex. Al reimplementar el harness de ARC-AGI-3 sobre la Responses API, pasando el ID de la respuesta anterior, ese razonamiento se retiene automáticamente entre turnos y llamadas a herramientas.

El segundo cambio fue reemplazar el truncamiento rodante por compactación: en vez de botar los mensajes más antiguos, el historial se resume y la conversación continúa. Con razonamiento retenido, el modelo dedicó menos tiempo a pensar antes de cada acción y sostuvo estrategias coherentes a lo largo del juego. Con compactación, preservó mejor lo aprendido en partidas largas y llegó a un puntaje más alto con menos tokens generados.

¿Qué cifras reporta OpenAI?

  • Con el harness oficial, GPT-5.6 Sol obtuvo 13,3% en el set público de ARC-AGI-3.
  • Con razonamiento retenido y compactación, subió a 38,3%, cerca de 3 veces el puntaje original.
  • La misma configuración usó 6 veces menos tokens de salida.
  • El puntaje se mide en RHAE, una métrica relativa a una línea base humana estimada en 48% según los registros oficiales de juego.
  • GPT-5.5 apenas lograba jugar, con 0,4%.
  • En uno de los juegos donde ningún modelo frontera pasa del primer nivel, el harness de OpenAI resolvió los seis niveles.

¿Qué recomienda OpenAI a quienes desarrollan sobre su API?

La recomendación es explícita y de bajo costo de implementación: usar la Responses API en lugar de la antigua Chat Completions, retener el razonamiento y activar compactación. OpenAI agrega una advertencia para quien compara modelos: conviene apoyarse en evaluaciones que usen esos ajustes, porque son los que reflejan el uso real en ChatGPT y Codex. La compañía reconoce además que no es la primera vez que un puntaje público bajo se explicaba por un evaluador genérico que descartaba los mensajes de razonamiento.

Análisis de Revenue Hub

Para un líder comercial en Chile y Latinoamérica que está evaluando qué modelo usar para su agente de ventas, servicio o RevOps, el mensaje incómodo es este: la tabla comparativa que está mirando probablemente no mide lo que cree que mide. La diferencia entre 13,3% y 38,3% no vino de un modelo mejor, vino de dos parámetros de configuración. Si su equipo o su proveedor eligió proveedor de IA con un ranking público, esa decisión se tomó con información incompleta.

La consecuencia operativa es doble. Por un lado, antes de concluir que un modelo no sirve para su caso de uso, revise cómo está construido el harness: si el agente pierde el razonamiento entre pasos o trunca el historial, va a rendir mal sin importar qué modelo tenga detrás. Por otro lado, el dato de los 6 veces menos tokens es un argumento de costo directo: la misma configuración que sube la calidad también baja la factura de API, algo relevante cuando el presupuesto de IA se aprueba en pesos y el consumo se cobra en dólares.

Nuestra recomendación para equipos GTM en la región es tratar la configuración del agente como parte del proyecto, no como detalle técnico delegable. Antes de firmar un piloto de agentes, exija al proveedor que documente qué API usa, si retiene razonamiento y cómo maneja el contexto largo. Puede revisar más contenido sobre implementación de IA en operaciones comerciales en nuestro blog y seguir la cobertura del tema en Noticias de IA en ventas.

Fuente y criterio editorial

Revenue Hub resume, contextualiza y analiza esta información para equipos B2B de Chile y Latinoamérica. La publicación original pertenece a OpenAI.

Leer la fuente original

Para profundizar

Preguntas frecuentes

¿Qué anunció OpenAI el 29 de julio de 2026 sobre ARC-AGI-3?

OpenAI publicó un análisis mostrando que activar dos ajustes de su API, razonamiento retenido y compactación, triplicó el puntaje de GPT-5.6 Sol en el benchmark ARC-AGI-3, de 13,3% a 38,3% en el set público, con 6 veces menos tokens de salida.

¿Qué es el benchmark ARC-AGI-3?

Es un benchmark que mide qué tan bien los agentes de IA aprenden y razonan explorando juegos de puzzle en dos dimensiones que nunca vieron, sin instrucciones explícitas. Usa un harness genérico a propósito, sin herramientas ni funciones especiales, para hacer más visibles las limitaciones de los modelos. Hay 25 juegos de demostración públicos.

¿Qué significa retener el razonamiento en la API de OpenAI?

Significa que los mensajes de razonamiento privado del modelo se conservan en el historial de la conversación entre acciones y llamadas a herramientas, en vez de descartarse. En la Responses API se logra pasando el ID de la respuesta anterior. Sin esto, el modelo reinterpreta la tarea desde cero en cada paso.

¿Qué es la compactación y en qué se diferencia del truncamiento?

El truncamiento rodante descarta los mensajes más antiguos cuando el contexto se llena, con lo que el modelo pierde observaciones y acciones previas. La compactación, en cambio, resume el historial y continúa la conversación, preservando lo aprendido y consumiendo menos tokens de salida.

¿Cuánto mejoró GPT-5.6 Sol con estos ajustes?

Pasó de 13,3% a 38,3% en el set público de ARC-AGI-3, aproximadamente 3 veces el puntaje inicial, usando 6 veces menos tokens de salida. La línea base humana estimada para ese conjunto es de 48%.

¿Qué recomienda OpenAI a los desarrolladores que usan su API?

Usar la Responses API en lugar de la antigua Chat Completions, retener el razonamiento y activar compactación. Para quienes comparan modelos, recomienda apoyarse en evaluaciones que usen esos ajustes, porque reflejan el uso real en ChatGPT y Codex.

¿Por qué esto importa al comparar GPT-5.6 Sol con Claude o Gemini?

Porque un benchmark no mide solo al modelo: también mide decisiones de configuración, diseño del harness y prompting. Un mismo modelo puede triplicar su puntaje solo cambiando cómo se gestiona su contexto, así que las comparaciones públicas pueden reflejar diferencias de implementación más que de capacidad.

¿Qué deberían hacer los equipos comerciales en Chile y Latinoamérica con esta información?

Antes de descartar un modelo por resultados de benchmark, revisar cómo está configurado el agente que lo usa. Conviene exigir a proveedores que documenten qué API emplean, si retienen razonamiento y cómo manejan el contexto largo, ya que esa configuración afecta tanto la calidad como el costo por tarea.

Comparte este análisis con tu equipo