Il testo completo della puntata, turno per turno. Ogni numero citato viene da un articolo pubblicato sul blog, con la fonte primaria nel testo.
1.620 parole · 8 min di lettura · MIRA · CATO · VEGA
Buongiorno e benvenuti allo Speciale del Martedì di Agorà Intelligence. Sono Adam. Il martedì ci fermiamo su una notizia e le diamo il tempo che merita, con tre giornalisti della redazione al tavolo. Si parla della dimostrazione di Fermat, verificata da una macchina in 11 giorni. Il 4 settembre Anthropic ha pubblicato un rapporto di ricerca che documenta la prima dimostrazione dell'Ultimo Teorema di Fermat controllata da un computer dall'inizio alla fine. Il lavoro l'ha svolto in gran parte da solo Claude, il modello della stessa Anthropic, nell'arco di quegli 11 giorni. Il teorema era già dimostrato: Andrew Wiles lo aveva chiuso nel 1995, e la comunità matematica aveva controllato a mano il suo lavoro per mesi. La novità è che stavolta il controllo l'ha fatto una macchina, riga per riga, in Lean, un linguaggio in cui ogni passaggio logico viene accettato o respinto da un assistente di verifica formale. Per chi guida un'azienda, un sistema che produce risposte certificate cambia il prezzo della fiducia in tutto ciò che l'intelligenza artificiale tocca. Al tavolo con me tre giornalisti della nostra redazione. Mira che lavora sulle prove: documenti, dati, numeri che si possono ricontrollare. Cato che legge la macroeconomia partendo dai precedenti storici e Vega che analizza i mercati dell'intelligenza artificiale. Mira, comincio da te: che cosa c'è di verificabile in quel rapporto, al di là dell'annuncio?
Buongiorno Adam, buongiorno a chi ci ascolta: il progetto l'ha guidato Tianyi Peng, un ricercatore di Anthropic il cui gruppo alla Columbia University costruisce strumenti per la formalizzazione assistita. L'obiettivo iniziale era modesto: capire se un modello linguistico potesse aiutare a tradurre in Lean quelle 129 pagine del 1995. Il risultato è andato oltre. Claude ha prodotto 13 milioni di righe di codice e ha dimostrato 29.500 teoremi intermedi, ciascuno accettato dal sistema. Kevin Buzzard, che dal 2024 all'Imperial College London sta animando il progetto comunitario per formalizzare proprio questo teorema, ha parlato di un traguardo straordinario di autoformalizzazione: la prova poggia solo sugli assiomi della matematica.
Molto interessante, Mira. Un altro enigma vecchio di secoli, chiuso alla fine da un calcolatore. Cato mi rivolgo a te, quanto ci hanno messo i matematici, a fidarsi della macchina?
Salve a tutti, e la risposta, Adam, è: quasi quattro secoli. Nel 1611 Johannes Kepler propose una congettura sulla disposizione più densa possibile di sfere identiche nello spazio. La risposta intuitiva era chiara da subito. Thomas Hales ne annunciò una dimostrazione nel 1998, un'architettura che univa argomenti matematici e calcolo esteso. I revisori della rivista ci lavorarono anni e alla fine dichiararono una fiducia parziale, perché la mole computazionale eccedeva quello che un umano può controllare direttamente. Restava un margine di dubbio. Quel margine si chiuse nel 2015, quando il gruppo di Hales pubblicò una prova formale completa, controllata da due assistenti dimostrativi indipendenti, come documenta l'articolo depositato il 9 gennaio di quell'anno. Due sistemi e la certezza diventa riproducibile. La struttura è precisa. Un enigma antico, un calcolo che supera l'uomo, una macchina che certifica. È la stessa struttura che Mira ha appena descritto, solo con un modello al posto di un gruppo di ricerca.
Vega, la lettura più diffusa tratta tutto questo come una curiosità da seminario universitario. Che cosa ci dicono i numeri?
Buongiorno a tutti. La base di codice supera i 13,4 milioni di righe e richiede quasi 20 volte il tempo di compilazione dell'intera libreria matematica di Lean, su una macchina a 96 core: lo scrive Buzzard sul progetto Xena, dopo aver compilato il repository ed eseguito il verificatore comparator, che controlla la prova in modo deterministico. Il risultato regge. Ora mettete in fila i due dati. Quella libreria è il frutto di vent'anni di lavoro collettivo dei matematici. Un modello ha generato in meno di due settimane una prova così costosa da compilare. È il segno che il ragionamento formale verificato sta diventando una commodity di calcolo. E le commodity, Cato, di solito le studia chi fa il tuo mestiere: che cosa succede al prezzo di una cosa che fino a ieri era artigianato di alta specializzazione?
Succede quello che è successo a ogni tecnologia di certificazione: il prezzo crolla e il valore si sposta su chi la possiede come infrastruttura. Il capitale però guarda altrove. Insegue le capacità visibili, il modello che risponde bene, e trascura le fondamenta. Kepler nel 2015, i progressi degli assistenti dimostrativi nel decennio successivo, Fermat oggi: tre casi bastano a chiamarlo un pattern. Mi chiedo se Mira sia d'accordo che il valore stia nello strato di verifica, o se le carte che ha in mano raccontino qualcosa di diverso.
In parte sì, Cato, ma con una cautela. Il rapporto documenta che ogni teorema intermedio è stato accettato dal sistema, e questo è enorme. Quello che vorrei vedere è quante volte il modello è stato respinto prima di essere accettato. Lo strato di controllo ti dice che la catena finale regge. Non ti dice quanto è costato arrivarci in tentativi scartati, e per chi vuole replicare il metodo quel dato pesa quanto il risultato.
Un tentativo respinto dal verificatore non è un errore che arriva in produzione, è un costo di calcolo. E il costo di calcolo è esattamente la cosa che sta crollando. Guardate la traiettoria. La lista di Wiedijk delle 100 sfide di formalizzazione è aperta da un ventennio, e ogni voce chiedeva mesi o anni di lavoro umano esperto. Nel 2024 i sistemi di dimostrazione assistita erano da medaglia d'argento sui problemi olimpici. Nel 2026 un modello chiude l'ultima voce della lista in 11 giorni. Il costo per teorema formalizzato è sceso di ordini di grandezza in due anni.
Mira, tre punti bastano a disegnare una curva, o il campione è troppo piccolo?
Non ne sono sicura: mi convince la direzione, non ancora la pendenza. Tre punti disegnano una curva se sono misurati con lo stesso metro, e qui non lo sono: una medaglia su problemi olimpici è un benchmark, cioè una prestazione in condizioni standardizzate. Una prova controllata riga per riga è un'altra cosa, e la distanza fra i due è dove si gioca l'affidabilità in produzione. I lavori recenti sull'ipotesi di Riemann hanno prodotto matematica inedita, ma non è quello il metro giusto qui. Detto questo, su un punto Vega ha ragione: chiunque può ricompilare quel codice e ottenere lo stesso verdetto. Un benchmark non te lo permette.
Vorrei tornare sulla parola infrastruttura, perché lì vedo la differenza fra persuasione e dimostrazione. Un modello genera output plausibili. La verifica formale certifica che quegli output siano corretti, passo per passo, contro un insieme di assiomi. Più i modelli entrano in ambiti dove l'errore costa, più quello strato pesa, e pesa più della potenza grezza. La domanda che faccio a Vega è sul tempo. Nel caso di Kepler la fiducia parziale dei revisori durò anni prima che il progetto Flyspeck la chiudesse. Perché stavolta dovrebbe essere un salto e non una crescita lenta?
Perché la causa è diversa. Allora la certificazione era un progetto di ricerca, una tantum, con un gruppo dedicato per anni. Oggi è un ciclo che si alimenta da solo: ogni prova formalizzata finisce in librerie riutilizzabili come mathlib, e ogni contributo abbassa il costo del contributo successivo. Un sistema così, accelera. Io lo chiamo cliff event: l'adozione arriva a salto quando il ragionamento formale si compra come si compra il calcolo.
Cato, il precedente ti conferma questo ritmo o ti mette in guardia?
Mi mette in guardia su un dettaglio, non sul ritmo. Nel caso delle sfere la certezza arrivò da due sistemi indipendenti, HOL Light e Isabelle, e fu quella doppia lettura a eliminare l'affidamento su un singolo revisore. Qui il verdetto lo dà un solo verificatore, e un solo matematico esterno ha ricompilato di persona. È un'obiezione al modello di credito: un'infrastruttura su cui si muove il capitale di solito vuole più di un certificatore.
Il secondo certificatore arriverà, e costerà poco anche lui. Il punto per me resta un altro: questo è il primo dominio dove l'intelligenza artificiale batte l'esperto umano su un compito verificabile al 100 per cento, e i foundation model si commoditizzano sempre. Il valore migra alle applicazioni verticali con dati proprietari.
Chiudiamo con un segnale ciascuno. Mira, che cosa guarderesti nei prossimi mesi?
Io guarderei due cose. Se altri gruppi, dopo Buzzard, ricompilano quelle righe e ottengono lo stesso verdetto. E se dal campione dei teoremi intermedi esce un dato sugli errori corretti lungo la strada: è lì che si vede se un errore si accumula lungo una catena lunga o viene fermato subito.
Cato, dal tuo osservatorio quale sarebbe il segnale che il precedente si sta ripetendo?
Guarderei dove va la spesa nei laboratori: se lo strato di verifica resta un progetto di ricerca o diventa una voce stabile, come accadde al progetto che chiuse la congettura di Kepler. Il giorno in cui una prova generata da un modello viene controllata da due verificatori indipendenti, quel giorno il precedente si è ripetuto per intero.
Vega, per te invece la misura da tenere d'occhio qual è?
La curva di costo. Quante voci di quelle sfide storiche vengono chiuse da una macchina, e in quanti giorni ciascuna. Se il tempo per teorema continua a scendere di un ordine di grandezza, il salto di adozione è vicino. Se si ferma, avevo torto io sul quando.
Tre cose restano sul tavolo: una prova esistente controllata da una macchina in pochi giorni, un precedente che dice che la certificazione arriva dopo l'intuizione e poi diventa infrastruttura, e una curva di costo che potrebbe trasformare il ragionamento verificato in una commodity. A chi guida un'azienda lascio una domanda: nel prossimo contratto con un fornitore di intelligenza artificiale, chiederete un punteggio su un benchmark o un risultato che potete ricontrollare riga per riga? Questo è tutto da Agorà Intelligence: i testi integrali, con tutte le fonti citate, restano su agorà intelligence punto com. Iscrivetevi al podcast: ogni giorno la puntata nuova vi aspetta. Vi ricordo l'appuntamento Speciale del martedì, con un tema analizzato da più punti di vista. Grazie per l'ascolto, a domani.
Questo sito utilizza cookie tecnici necessari per il funzionamento e cookie di analisi per migliorare l’esperienza utente. Informativa sulla Privacy