Claude formalizó el Último Teorema de Fermat en 11 días: 13 millones de líneas de Lean y 29.500 teoremas intermedios
Anthropic publicó la primera prueba completa del Último Teorema de Fermat verificada por computador. Decenas de agentes de Claude trabajaron de forma mayormente autónoma durante 11 días sobre la plataforma Prove2Me, en una tarea que la comunidad matemática esperaba que tomara años.

La noticia en 30 segundos
Anthropic anunció el 4 de septiembre de 2026 la primera prueba completa del Último Teorema de Fermat verificada por computador. Decenas de agentes de Claude trabajaron de forma mayormente autónoma durante 11 días y escribieron 13 millones de líneas de código en el lenguaje Lean, probando 30.300 teoremas intermedios de los cuales 29.500 quedaron en la prueba final. El trabajo consumió cerca de 6.000 millones de tokens de salida de un modelo interno comparable a Claude Fable 5.1. La comunidad matemática estimaba que la formalización tomaría años. El resultado está publicado en GitHub y verificado por Lean.
Anthropic publicó el 4 de septiembre de 2026 la primera prueba completa del Último Teorema de Fermat verificada por computador de punta a punta. La prueba fue escrita por Claude en el lenguaje Lean, trabajando de forma mayormente autónoma durante 11 días.
Los números del trabajo: 13 millones de líneas de código Lean, 30.300 teoremas intermedios probados de los cuales 29.500 quedaron en la prueba final, y cerca de 6.000 millones de tokens de salida consumidos por un modelo interno de investigación de propósito general, descrito por Anthropic como aproximadamente comparable a Claude Fable 5.1. La prueba resultante es más de cinco veces el tamaño de Mathlib, la biblioteca comunitaria de pruebas matemáticas sobre la que se construye.
¿Por qué formalizar una prueba matemática es difícil?
Andrew Wiles publicó la primera prueba correcta del teorema en 1995. Ocupaba 129 páginas y su verificación tomó meses de trabajo minucioso. De hecho, en la primera presentación de 1993 un revisor detectó una brecha crítica que Wiles tardó un año en cerrar junto a Richard Taylor.
Formalizar significa reescribir ese razonamiento en un formato que un computador pueda verificar automáticamente. La dificultad no es conceptual sino de exhaustividad: una prueba escrita para humanos salta pasos obvios, mientras que Lean necesita ver cada paso por trivial que sea. La comunidad matemática venía trabajando en la formalización desde 2024, en un esfuerzo liderado por Kevin Buzzard en Imperial College London, y el solo plano de la fase inicial ocupa 86 páginas.
«Este logro extraordinario de autoformalización, que los investigadores de Anthropic dicen que tomó solo 11 días, prueba el Último Teorema de Fermat sin más supuestos que los axiomas de las matemáticas», dijo Kevin Buzzard, quien revisó el resultado.
¿Cómo lograron que decenas de agentes trabajaran juntos?
Este es el punto que más debería interesar a quien esté evaluando agentes de IA para procesos de negocio. Los primeros intentos de Claude fracasaron: los agentes tuvieron éxito inicial, pero rápidamente perdieron el rastro del estado del proyecto y dejaron de colaborar de forma efectiva. Ese trabajo fallido aportó cerca del 7% de las líneas no estructurales de la prueba final.
El esfuerzo funcionó cuando el equipo pasó a usar Prove2Me, una plataforma colaborativa abierta diseñada por Tianyi Peng y sus colaboradores en la Universidad de Columbia. Prove2Me aportó tres cosas: un grafo dirigido acíclico de enunciados de teoremas que los agentes usaban para decidir qué probar a continuación, separación de enunciados y pruebas en archivos distintos para acelerar la compilación, y una descripción en lenguaje natural de cada teorema para permitir búsqueda y reutilización.
Dicho de otro modo: el desbloqueo no fue un modelo más potente, fue una estructura externa de estado compartido. La intervención humana se limitó a instrucciones ocasionales de alto nivel del tipo «el jacobiano como esquema suena de alta prioridad».
¿Qué se puede hacer sin presupuesto de laboratorio?
Anthropic reporta un experimento paralelo relevante para equipos pequeños en Chile y Latinoamérica: usando tres planes personales de Claude Max y colaborando enteramente a través de Prove2Me, un grupo de agentes completó la formalización del Teorema de los Tres Primos de Vinogradov en tres días. La conclusión que Anthropic saca es que, con el andamiaje correcto, la formalización colaborativa de resultados mayores es alcanzable con suscripciones de consumo.
La prueba completa está disponible en GitHub. Fue verificada por Lean usando solo sus tres axiomas estándar, y un comparador confirmó que el enunciado del teorema coincide con el de Mathlib.
Análisis de Revenue Hub
La noticia se lee como matemática, pero el hallazgo operativo es de gestión de agentes y aplica directo a cualquier operación comercial en Chile y Latinoamérica que esté evaluando IA agéntica. El fracaso inicial no fue de capacidad del modelo: fue de coordinación. Decenas de agentes competentes perdieron el hilo del estado del trabajo y empezaron a duplicarse y contradecirse. Lo que arregló el problema fue un artefacto externo que mantenía la verdad del proyecto: qué está probado, qué falta, qué depende de qué.
Ese es exactamente el patrón que se repite en los pilotos de agentes comerciales que fallan. Un agente de prospección, uno de enriquecimiento y uno de seguimiento pueden funcionar bien por separado y degradarse cuando operan sobre el mismo pipeline sin una fuente de verdad compartida. El CRM debería cumplir ese rol de grafo de estado, y en la práctica muchas veces no lo cumple porque los agentes escriben en campos libres, sin dependencias explícitas y sin registro de qué tarea quedó cerrada. La pregunta a hacerse antes de sumar el próximo agente no es qué modelo usar, sino si el sistema de registro puede decir, en cualquier momento, qué está hecho y qué falta.
La segunda lectura es sobre horizonte de trabajo. Un agente sostuvo una tarea de 11 días con supervisión humana mínima y de alto nivel. Eso corre el límite de lo que vale la pena delegar: hasta ahora la delegación razonable eran tareas de minutos u horas. Si el horizonte se mide en días, procesos como la construcción de una lista de cuentas objetivo, la limpieza de una base de datos histórica o la preparación de un ciclo de renovación completo entran en zona delegable. El costo también se mueve: 6.000 millones de tokens no es un experimento barato, y conviene modelar el gasto por tarea antes de prometer ahorro. Seguimos el tema en IA en ventas y en el blog de Revenue Hub.
Fuente y criterio editorial
Revenue Hub resume, contextualiza y analiza esta información para equipos B2B de Chile y Latinoamérica. La publicación original pertenece a Anthropic.
Leer la fuente originalPara profundizar
Preguntas frecuentes
¿Qué hizo Claude con el Último Teorema de Fermat?
Claude produjo la primera prueba del Último Teorema de Fermat verificada por computador de punta a punta, escrita en el lenguaje Lean. Trabajó de forma mayormente autónoma durante 11 días.
¿Cuánto código escribió Claude para la prueba?
13 millones de líneas de código Lean. Probó 30.300 teoremas intermedios, de los cuales 29.500 quedaron en la prueba final. La prueba resultante es más de cinco veces el tamaño de Mathlib.
¿Cuántos tokens consumió el proyecto?
Cerca de 6.000 millones de tokens de salida, de un modelo interno de investigación de propósito general que Anthropic describe como aproximadamente comparable a Claude Fable 5.1.
¿Qué es Prove2Me y por qué fue clave?
Prove2Me es una plataforma colaborativa abierta para formalización matemática creada por Tianyi Peng y colaboradores en la Universidad de Columbia. Mantiene un grafo dirigido acíclico de teoremas que permite a múltiples agentes trabajar en paralelo sin perder el estado del proyecto.
¿Cuánto tiempo tomó la prueba original de Wiles?
Andrew Wiles publicó la primera prueba correcta en 1995. Ocupaba 129 páginas y su verificación tomó meses. En la presentación de 1993 un revisor detectó una brecha crítica que Wiles tardó un año en cerrar con Richard Taylor.
¿Claude descubrió matemática nueva o solo la verificó?
Lo novedoso aquí es la verificación, no la matemática. Claude formalizó una versión simplificada de la prueba de Wiles para que un computador pudiera comprobarla automáticamente, siguiendo la exposición de Darmon, Diamond y Taylor.
¿Se puede replicar esto sin presupuesto de laboratorio?
Anthropic reporta que, usando tres planes personales de Claude Max y colaborando a través de Prove2Me, un grupo de agentes formalizó el Teorema de los Tres Primos de Vinogradov en tres días.
¿Qué implica esto para empresas B2B en Chile y Latinoamérica?
Dos cosas prácticas: el cuello de botella de los agentes suele ser la coordinación y el estado compartido, no la capacidad del modelo, y el horizonte de tareas delegables se está moviendo de horas a días, lo que amplía qué procesos comerciales conviene automatizar.




¿Cómo se vive esto en tu equipo?
Participa con tu nombre o un alias. Sin crear una cuenta ni dejar tu correo.
Cargando comentarios…