La IA acaba de resolver un problema matemático de 350 años escribiendo la prueba más larga jamás realizada

By: decrypt.co|2026/09/05 13:01:03

Anthropic dice que su IA Claude acaba de escribir la prueba matemática más larga jamás realizada y la utilizó para demostrar formalmente el Último Teorema de Fermat, un problema que desconcertó a los matemáticos durante 358 años.

Claude lo hizo en 11 días, mayormente por su cuenta, produciendo 13 millones de líneas de código que una computadora puede verificar línea por línea, en lugar de simplemente aceptar la palabra de un matemático.

El último teorema de Fermat dice que no puedes tomar tres números enteros positivos, elevar cada uno a una potencia mayor que 2 y hacer que los dos primeros sumen el tercero. Él anotó esa afirmación en el margen de un libro de matemáticas en 1637, añadiendo que tenía una "prueba verdaderamente maravillosa" que el margen era demasiado pequeño para contener.

Luego murió. Los matemáticos pasaron los siguientes 358 años tratando de reconstruir lo que él pensaba que tenía.

Probar algo y verificarlo son dos trabajos diferentes

Una prueba matemática es una cadena de pasos lógicos, y si un eslabón se rompe, todo se derrumba. Encontrar ese eslabón roto, enterrado en algún lugar de cien páginas de argumentos densos, puede llevar a otros matemáticos años de sus vidas.

Formalizar una prueba significa traducirla a un lenguaje tan dolorosamente literal que una computadora puede verificar cada paso por su cuenta sin entrar en subjetividades.

Los matemáticos han sido malos en esto durante un tiempo. Un premio alemán de 1908, que vale aproximadamente entre 1 y 2 millones de dólares en el dinero de hoy, ofrecido por la primera prueba válida del teorema, recibió 621 presentaciones incorrectas solo en su primer año.

La verdadera prueba no apareció hasta 1995, del matemático británico Andrew Wiles, y vino con un giro inesperado. Wiles anunció su solución en tres conferencias en junio de 1993, solo para que un revisor encontrara un error más tarde.

Pasó casi un año arreglándolo con un exalumno, Richard Taylor, casi se rindió y finalmente publicó una prueba corregida de 129 páginas en mayo de 1995. Se basó en matemáticas que no existían en la época de Fermat, que es una de las grandes razones por las que los matemáticos ahora dudan de que la propia "prueba maravillosa" de Fermat realmente funcionara.

El matemático Kevin Buzzard del Imperial College London inició un proyecto en 2024 para hacer exactamente lo que Claude acaba de hacer: traducir la prueba de Wiles a Lean, un lenguaje que las computadoras pueden verificar. Es el tipo de trabajo que necesita un ejército de matemáticos voluntarios; el propio esquema del proyecto abarca 86 páginas, y su financiación está asegurada hasta 2029.

Claude terminó todo en 11 días.

Cómo Claude lo logró

Anthropic explica en una publicación más detallada que Tianyi Peng, quien construye herramientas de formalización de IA con un equipo en Columbia, decidió ver hasta dónde podía llegar Claude por su cuenta. Docenas de agentes de Claude trabajaron en paralelo, escribiendo definiciones, probando pequeños resultados y apilándolos en resultados más grandes, con casi ninguna entrada humana más allá de un empujón ocasional como "prioriza este teorema a continuación".

No fue fácil al principio. Al principio, los agentes seguían perdiendo la pista de lo que ya habían probado y dejaron de colaborar, y esos falsos comienzos aún constituyen alrededor del 7% de las líneas en la prueba final.

Lo que lo solucionó fue una herramienta llamada Prove2Me, también construida por el equipo de Peng, que dio a cada agente la misma lista de tareas en vivo sobre qué pruebas más pequeñas aún necesitaban hacerse, para que nadie duplicara trabajo o se desviara. También organizó archivos para que Lean pudiera verificar todo más rápido y mantuvo notas en inglés sencillo sobre cada resultado para que los agentes pudieran reutilizar el trabajo de los demás en lugar de reinventarlo.

Para cuando terminó, Claude había probado más de 30,000 teoremas de apoyo y consumido miles de millones de tokens, funcionando en un modelo de investigación que Anthropic dice que es aproximadamente comparable a Claude Fable 5.1, la versión que luego lanzó al público. La prueba terminada tiene 13 millones de líneas, más de cinco veces el tamaño de Mathlib, la biblioteca compartida que los matemáticos ya utilizan para este tipo de trabajo.

Una novela típica tiene 80,000 palabras. La prueba de Claude equivale a 160 novelas de puro argumento lógico.

¿Importa esto realmente?

Buzzard, cuya propia versión de este proyecto sigue financiada hasta 2029, revisó la prueba de Claude y le dio su bendición, diciendo que demuestra el teorema "sin suposiciones más allá de los axiomas de las matemáticas".

Esto no es lo mismo que Claude descubriendo matemáticas completamente nuevas, que Anthropic también afirmó con su investigación en criptografía a principios de este año. Wiles ya demostró el teorema de Fermat hace tres décadas; Claude solo construyó un recibo verificable por máquina para ello. Eso importa porque los matemáticos están cada vez más abrumados con pruebas no verificadas, incluidas las escritas por IA, más rápido de lo que los humanos pueden verificarlas a mano.

Además, este tipo de pruebas son deterministas y no propensas a errores humanos, lo cual es muy importante en matemáticas.

Ese no es un problema nuevo. Una prueba asistida por computadora de la conjetura de Kepler tardó cuatro años antes de que un panel de revisión solo se comprometiera a estar "99% seguro", y la prueba de Grigori Perelman de la conjetura de Poincaré tardó casi tanto en ser completamente asimilada.

Si no quieres tomar la palabra de Anthropic por ninguna de estas afirmaciones, no tienes que hacerlo. La prueba completa de 13 millones de líneas está disponible en GitHub en este momento, gratuita para cualquier matemático con suficiente tiempo libre para desmenuzarla, línea por línea.

Precio de --

--
--
--

Este contenido se ofrece únicamente con fines informativos generales y no constituye un asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, operar o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.

Te puede gustar

Contenido

Artículos recientes

Más

Últimos listados de monedas en WEEX

iconiconiconiconiconiconicon
Atención al cliente:@weikecs
Cooperación empresarial:@weikecs
Trading cuantitativo y CM:[email protected]
Programa VIP:[email protected]