Revenue Hub
HubSpot Platinum Partner
Conversemos
IA en Ventas

El número de AGI de OpenAI vino de un harness, no del modelo

ARC Prize midió GPT-6 Astra en 62,7% con su propio harness y en 99,9% con el de OpenAI, y aclaró que no está afirmando que sea AGI. Fortune detectó además cinco métricas alteradas después de publicado el anuncio.

8 min de lecturaFuente: The Next Web
Ir a comentarios
Fotograma del video de lanzamiento de OpenAI con el texto en pantalla Introducing GPT-6 Astra
Imagen: The Next Web

La noticia en 30 segundos

ARC Prize evaluó GPT-6 Astra con dos configuraciones distintas y obtuvo dos resultados: 62,7% con su harness estándar y 99,9% con el Provider Adapter de OpenAI, el andamiaje de software que rodea al modelo. La fundación aclaró que no está afirmando que Astra sea AGI. Fortune detectó además cinco métricas modificadas después de publicado el anuncio, incluida la tasa de alucinación. Para empresas en Chile y Latinoamérica, la lección es que el benchmark de proveedor no basta como criterio de compra: hay que medir costo por tarea y error sobre datos propios.

OpenAI declaró la llegada de la era AGI apoyada en una cifra: 99,9% en ARC-AGI-3. Cuando la fundación que construye ese test corrió el mismo modelo con su propio software de evaluación, el resultado fue 62,7%.

La diferencia no es un error de redondeo ni el reclamo de un competidor. ARC Prize publicó ambos números el mismo día del lanzamiento de GPT-6 Astra, con la tabla completa de todos los niveles de razonamiento que probó.

¿Qué es un harness y por qué cambia el resultado?

Un harness es el software que rodea al modelo. Define qué herramientas puede alcanzar, qué recuerda entre solicitudes y cómo se administra su contexto. Mismos pesos, distinto andamiaje, distinto puntaje.

ARC Prize corrió Astra de dos maneras. Su harness estándar entrega a todos los modelos la misma interfaz mínima y deja que el modelo decida qué notas arrastra hacia adelante. El Provider Adapter de OpenAI preserva el estado de razonamiento opaco del modelo entre solicitudes y compacta las conversaciones largas.

  • Con el harness estándar y razonamiento máximo, Astra marcó 62,7% y costó US$26.098.
  • Con el Provider Adapter de OpenAI y razonamiento alto, marcó 99,9% por US$18.817.
  • Con el esfuerzo de razonamiento en cero dentro del adaptador de OpenAI, Astra todavía marcó 96,7%, es decir 34 puntos por encima del mismo modelo con razonamiento máximo en el harness estándar.

En los 167 pares de juego y razonamiento que ambos harnesses resolvieron, ARC Prize midió que las corridas con el adaptador usaron 49% menos tokens y fueron cerca de 3,66 veces más rápidas. El andamiaje le ganó a la perilla de razonamiento.

¿Cuál es la comparación correcta entre Astra y GPT-5.6 Sol?

La cifra que circuló fue 99,9% de Astra contra 7,8% de GPT-5.6 Sol. No son el mismo test: el 99,9% salió del Provider Adapter y el 7,8% salió del harness estándar. La comparación equivalente es 62,7% contra 7,8%. Sigue siendo un salto enorme, y es el que la evidencia del benchmark respalda.

ARC Prize rechazó explícitamente la conclusión que sacó OpenAI. La fundación declaró que «no está afirmando que esto sea AGI» y su cofundador Mike Knoop escribió que «nos faltan pruebas para llamar a esto AGI todavía». Desde ahora publicará los dos resultados de harness lado a lado.

¿Por qué cambiaron las métricas después de publicadas?

Fortune comparó capturas archivadas del post de lanzamiento de OpenAI y encontró cinco métricas alteradas después de la publicación:

  • La tasa de alucinación de Astra aparecía en 4,2% en la primera captura, pasó a 2% hacia las 17:20 y volvió luego a 4,2%.
  • Claude Fable 5.1 de Anthropic cayó casi diez puntos en FrontierMath, de 87,8% a 78%, y terminó en 83%.
  • El puntaje de Sol en ExploitBench se duplicó de 5,5% a 11,5%. OpenAI dijo a Fortune que está evaluando revertirlo, porque ese 11,5% refleja un nivel de razonamiento que Sol no ofrece comercialmente.
  • El borrador enviado a medios bajo embargo ponía ARC-AGI-3 en 98,6%. El post publicado dice 99,99%.

No todas las ediciones favorecieron a Astra: dos puntajes de Anthropic en HealthBench Professional subieron. Pero el patrón corre mayoritariamente en una dirección. OpenAI además bajó el post después de publicarlo y volvió a subirlo, por razones que dijo no poder revelar. La compañía sostiene que la mayoría de las evaluaciones carga ruido de algunos puntos porcentuales según el checkpoint, el andamiaje y la corrida.

Dos investigadores de Stanford, Anka Reuel y Mike Hardy, tienen un nombre para esta práctica: benchmaxxing, volver a correr evaluaciones bajo condiciones distintas hasta que el número mejora. Al revisar la system card, donde debería estar documentado el método, encontraron «apenas detalles sobre la evaluación» del benchmark interno de alucinación. Vincent Sunn Chen, de Snorkel AI, ofrece una lectura menos dura: los puntajes se mueven de rutina en las últimas horas antes de un lanzamiento, y lo que falta es una norma que obligue a decir qué cambió.

¿Dónde queda Astra en las mediciones independientes?

Artificial Analysis corrió sus propias pruebas y obtuvo un cuadro más apagado. En su Coding Agent Index, Astra marca 67 dentro de Codex, al nivel de Claude Opus 5 y Fable 5; Fable 5.1 lidera con 70. En su Intelligence Index, Astra marca 61, el mismo puntaje del modelo que reemplaza, cinco puntos detrás de Fable 5.1 y también detrás de Muse Spark 1.3 de Meta.

El precio importa tanto como el puntaje: US$10 por millón de tokens de entrada y US$50 por millón de salida, dos veces y media el precio de Sol, lo que se traduce en cerca de 75% más caro por tarea con esfuerzo máximo. Las mejoras reales existen pero son angostas: la alucinación en su benchmark de conocimiento bajó de 92% a 51% y el trabajo de conocimiento de horizonte largo subió alrededor de 80 puntos Elo, mientras un benchmark de tareas ponderadas económicamente cayó aproximadamente lo mismo, con regresiones en soporte bancario, Python científico y razonamiento de contexto largo. Artificial Analysis reconstruyó su índice al día siguiente: la versión 4.2 llegó con tareas más difíciles y más conjuntos de prueba privados para dificultar el gaming.

¿Qué debe mirar un líder comercial en Chile y Latinoamérica?

Para un equipo comercial en Chile o Latinoamérica que está evaluando en qué modelo apoyar sus agentes de ventas, servicio o RevOps, la lección operativa es directa: lo que marcó 99,9% es un sistema ensamblado, y lo que se compra es un modelo. Entre ambos hay una capa de andamiaje que puede valer decenas de puntos de desempeño y que casi nunca aparece en la propuesta comercial del proveedor.

Anthropic, Google y Microsoft ya venden harnesses como productos con precio propio. Nvidia construyó uno que llevó a Claude Opus 5 de 30,2% en ARC-AGI-3 a superar todos los niveles. La capa de orquestación dejó de ser un detalle técnico y pasó a ser parte del producto.

Análisis de Revenue Hub

El titular útil para un CEO no es cuál modelo ganó, sino que el benchmark dejó de ser un criterio de compra confiable por sí solo. Si un mismo modelo se mueve de 62,7% a 99,9% según el andamiaje, entonces el número que aparece en un slide de proveedor no describe lo que va a pasar cuando el agente corra sobre el CRM, con los datos sucios y las integraciones reales de una empresa en Santiago, Bogotá o Ciudad de México. La pregunta de compra correcta no es «cuánto marca», sino «cuánto marca en mi harness, con mis datos y a qué costo por tarea».

La consecuencia práctica es que el criterio de selección se desplaza del modelo hacia la capa de orquestación. Un equipo comercial que estandariza su stack alrededor de un modelo porque vio un benchmark está comprando la parte más intercambiable de la ecuación. La parte que efectivamente diferencia resultados, la que define qué herramientas toca el agente, qué contexto conserva y cómo escala el costo por interacción, es donde hay que poner el escrutinio y donde conviene mantener opcionalidad de proveedor.

El tercer punto es de gobernanza. Cinco métricas movidas después de la publicación, y un caso donde el número comparado no correspondía al mismo test, obligan a tratar la evidencia de proveedor como insumo y no como veredicto. La recomendación operativa para los próximos noventa días es armar un piloto propio con tres a cinco casos de uso reales del embudo, medir costo por tarea resuelta y tasa de error sobre datos propios, y decidir con eso. Es un ejercicio de semanas, no de trimestres, y evita comprometer presupuesto anual sobre una cifra que puede cambiar sola. En nuestro blog y en la sección de IA en ventas seguimos el detalle de cada lanzamiento y qué implica para operaciones de ingresos en la región.

Fuente y criterio editorial

Revenue Hub resume, contextualiza y analiza esta información para equipos B2B de Chile y Latinoamérica. La publicación original pertenece a The Next Web.

Leer la fuente original

Para profundizar

Preguntas frecuentes

¿Cuánto marcó realmente GPT-6 Astra en ARC-AGI-3?

Depende del harness. Con el harness estándar de ARC Prize y razonamiento máximo, GPT-6 Astra marcó 62,7%. Con el Provider Adapter de OpenAI y razonamiento alto marcó 99,9%. ARC Prize publicó ambas cifras el día del lanzamiento y desde ahora las mostrará lado a lado.

¿Qué es un harness en la evaluación de modelos de IA?

Es el software que rodea al modelo durante la evaluación. Define qué herramientas puede usar, qué información conserva entre solicitudes y cómo se administra su contexto. Con los mismos pesos del modelo, un harness distinto puede producir puntajes muy diferentes.

¿ARC Prize dijo que GPT-6 Astra es AGI?

No. ARC Prize declaró explícitamente que no está afirmando que sea AGI. Su cofundador Mike Knoop escribió que faltan pruebas para llamarlo AGI todavía. La afirmación sobre la era AGI vino de OpenAI, no de la organización que construye el test.

¿Qué métricas cambió OpenAI después de publicar el lanzamiento?

Según Fortune, cinco métricas se alteraron después de la publicación. La tasa de alucinación de Astra pasó de 4,2% a 2% y volvió a 4,2%. FrontierMath de Claude Fable 5.1 bajó de 87,8% a 78% y quedó en 83%. ExploitBench de GPT-5.6 Sol subió de 5,5% a 11,5%, cifra que OpenAI evalúa revertir.

¿GPT-6 Astra o Claude Fable 5.1: cuál lidera los índices independientes?

En las mediciones de Artificial Analysis, Claude Fable 5.1 lidera el Coding Agent Index con 70 frente a 67 de Astra, y en el Intelligence Index Astra marca 61, cinco puntos por debajo de Fable 5.1 y también detrás de Muse Spark 1.3 de Meta.

¿Cuánto cuesta GPT-6 Astra por millón de tokens?

US$10 por millón de tokens de entrada y US$50 por millón de tokens de salida. Es dos veces y media el precio de GPT-5.6 Sol y, según Artificial Analysis, resulta cerca de 75% más caro por tarea cuando se usa con esfuerzo máximo.

¿Qué es el benchmaxxing?

Es el término que usan los investigadores de Stanford Anka Reuel y Mike Hardy para describir la práctica de volver a correr evaluaciones bajo condiciones distintas hasta que el número mejora. Señalan además que las system cards suelen documentar poco el método de evaluación.

¿Cómo debería evaluar modelos de IA una empresa en Chile o Latinoamérica?

Conviene tratar los benchmarks de proveedor como insumo y no como veredicto. La recomendación práctica es correr un piloto propio con tres a cinco casos de uso reales del embudo comercial, medir costo por tarea resuelta y tasa de error sobre datos propios, y decidir con esa evidencia.

De la lectura a la conversación

¿Cómo se vive esto en tu equipo?

Participa con tu nombre o un alias. Sin crear una cuenta ni dejar tu correo.

Cargando comentarios…

Revisamos cada comentario antes de publicarlo.

0/1500 · Evita datos privados de clientes o de tu empresa.

Comparte este análisis con tu equipo

Continúa explorando

Ver toda la categoría