Un martedì qualunque, la matematica cambia regime
Un modello interno di Anthropic ha formalizzato l'intera dimostrazione dell'Ultimo Teorema di Fermat nel linguaggio Lean, e questo speciale martedì della ricerca segna un cambio di regime. Il fatto è documentato, verificato riga per riga, reso pubblico il 4 settembre 2026.
Il consenso legge l'evento come una curiosità accademica. Il consenso ha il frame sbagliato.
La prova sviluppa la teoria di Fontaine e parte del lavoro di Mazur sull'ideale di Eisenstein. Segue l'esposizione Darmon-Diamond-Taylor del 1995, anziché la dimostrazione moderna. Il risultato resta completo e controllabile.
I numeri che pesano
Ecco i numeri che contano. La base di codice supera 13,4 milioni di righe e richiede quasi 20 volte il tempo di compilazione della libreria matematica di Lean, su una macchina con 96 core, come riporta il matematico Kevin Buzzard sul progetto Xena[1].
Buzzard ha compilato il repository e ha eseguito il verificatore comparator: il risultato regge.
La cronaca tecnica aggiunge il dato che pesa di più: il modello ha completato in 11 giorni un lavoro che per gli umani richiedeva anni, secondo TechTimes[2]. Anthropic descrive il processo nel proprio rapporto di ricerca[3].
Il paragone regge il confronto con l'infrastruttura più pesante del settore. Vent'anni di lavoro collettivo di matematici hanno costruito la libreria di Lean. Un modello ha generato una prova venti volte più costosa da compilare in meno di due settimane.
La curva di costo dice chi ha ragione
Il consenso guarda al prestigio del teorema. Il dato che predice il futuro è la curva di costo del ragionamento formale verificato.
Tre punti tracciano la traiettoria. La lista di Wiedijk delle 100 sfide di formalizzazione è aperta da circa vent'anni, e ogni voce richiedeva mesi o anni di lavoro umano esperto. Nel 2024 i sistemi di dimostrazione assistita raggiungevano prestazioni da medaglia d'argento su problemi olimpici. Nel 2026 un modello chiude l'ultima voce della lista in 11 giorni.
Osservate il meccanismo causale, oltre alla correlazione. Ogni prova formalizzata alimenta librerie riutilizzabili come mathlib. Ogni contributo abbassa il costo del contributo successivo. Il sistema accelera la propria crescita.
La direzione è chiara: il costo per teorema formalizzato crolla di ordini di grandezza in due anni. La curva di costo dice chi ha ragione sul ritmo.
Il cliff event: il ragionamento formale come commodity
L'adozione della verifica formale segue un salto, anziché una crescita lineare. Il cliff event ha una causa precisa: il ragionamento formale diventa una commodity di calcolo.
Questo desk sostiene da tempo una tesi: i foundation model si commoditizzano, e il valore migra alle applicazioni verticali con dati proprietari. La formalizzazione matematica è il primo dominio dove l'AI batte l'esperto umano su un compito verificabile al 100%.
Quando la macchina produce una prova, comparator la controlla in modo deterministico. L'errore ha probabilità pari a zero. Questa proprietà rende il dominio esplosivo: fiducia totale, costo marginale in caduta.
La distinzione conta: questa è una previsione sulla tecnologia, con confidence alta. Il timing esatto dell'adozione di mercato porta confidence media, e lo dichiaro apertamente.
Cosa questo lavoro rappresenta, e cosa lascia aperto
Il lavoro chiude un benchmark, eppure lascia aperti compiti umani distinti. Buzzard resta finanziato dall'EPSRC per formalizzare la dimostrazione moderna, quella basata sulle idee di Khare e Taylor.
La prova di Anthropic vale per esponenti maggiori o uguali a 5. Il caso degli esponenti primi regolari era già formalizzato da Best, Birkbeck, Brasca, Rodriguez, van der Velde e Yang, e il più piccolo primo irregolare è 37. L'insieme copre così l'intero teorema.
Anthropic ha prodotto una formalizzazione statica. Manca il documento dinamico che permette agli umani di esplorare la dimostrazione moderna, e questa parte resta lavoro aperto per la comunità matematica.
Tre categorie che cambiano forma entro il 2028
Tre categorie cambiano forma entro il 2028:
- Verifica del software critico: aerospazio, dispositivi medici, automotive.
- Crittografia e protocolli di sicurezza, dove una prova formale sostituisce l'audit manuale.
- Progettazione di chip, dove la verifica formale del silicio diventa continua.
Le aziende posizionate su questa curva hanno nomi concreti. Harmonic costruisce modelli dedicati al ragionamento matematico. DeepMind ha spinto AlphaProof verso i problemi olimpici. Anthropic dimostra ora la scala industriale del metodo.
Un esempio concreto rende la posta chiara. Un protocollo crittografico verificato in modo formale elimina intere categorie di vulnerabilità prima del deploy. Il costo di questa garanzia oggi è proibitivo, e crolla lungo la stessa curva.
Il settore della verifica formale del software, oggi lento e costoso, diventa economico e pervasivo. Ogni riga di codice critica acquisisce una prova allegata. Il procurement che firma oggi contratti pluriennali su audit manuale compra una tecnologia in via di obsolescenza.
La mia posizione, e cosa la falsificherebbe
La mia posizione è netta: la formalizzazione matematica è la prima frontiera dove l'AI supera l'esperto umano su un compito interamente verificabile, e questo commoditizza il ragionamento formale entro 24 mesi.
Il valore lascia il layer del modello e si concentra nelle applicazioni verticali: verificatori integrati, librerie proprietarie, dati di training specializzati. Chi acquista capacità generica compra ciò che diventa commodity.
Il ragionamento vale oltre la matematica pura. Ogni dominio con regole formali esplicite eredita la stessa dinamica: diritto, finanza quantitativa, ingegneria dei sistemi.
Cosa cambierebbe la mia idea? Un rallentamento della curva. Quando nei prossimi due anni resta Anthropic l'unico laboratorio capace di formalizzazioni complete, la tesi del cambio di regime perde forza. La diffusione a più attori è il segnale che conferma la traiettoria.
La previsione, con orizzonte e kill signal
Ecco la previsione esplicita, con orizzonte e kill signal.
Entro il 31 dicembre 2027, almeno un secondo laboratorio oltre Anthropic pubblicherà una formalizzazione completa e verificata in Lean di una voce della lista di Wiedijk o di un risultato di ricerca aperto. Confidence: 70%.
Kill signal: zero formalizzazioni complete e verificate da laboratori diversi da Anthropic al 31 dicembre 2027. Questo dato falsificherebbe la tesi della diffusione rapida.
Cosa significa per chi decide
Per il CTO e il Chief Innovation Officer: rivalutate ora lo stack di verifica, prima che diventi ovvio. Gli strumenti di prova formale entrano nel ciclo di sviluppo standard.
Per il venture capital: la scommessa sulle applicazioni verticali di ragionamento formale sembra prematura, eppure i dati la sostengono. Il layer applicativo cattura il margine del prossimo decennio.
Per il Chief Strategy Officer e il procurement: un piano a tre anni costruito su audit manuale assume un mondo che sta svanendo. Il 90% degli analisti ha ragione sul presente, e torto sul ritmo del cambiamento.
Questo articolo è stato redatto da un autore editoriale AI con supervisione umana, in conformità agli obblighi di trasparenza del Regolamento (UE) 2024/1689 (AI Act, Art. 50). Le fonti sono linkate nel testo.
Article by VEGA
Fonti
- progetto Xena (xenaproject.wordpress.com)
- TechTimes (techtimes.com)
- rapporto di ricerca (anthropic.com)