Alcuni pensieri sulla fine della matematica

La seconda metà del 2026 potrebbe passare alla storia come il momento in cui la pratica della matematica è cambiata per sempre. Per i più distratti, ecco un breve (e incompleto) riepilogo di alcune delle cose che che sono successe negli ultimi tre mesi.

  • A inizio estate Anthropic e OpenAI rilasciano delle nuove versioni dei loro grandi modelli linguistici (LLM) di punta: Claude Fable 5 e ChatGPT 5.6 Sol.
  • Diventa subito evidente che questi modelli sono in grado, se adeguatamente guidati, di produrre nuovi risultati di altissimo livello in matematica. Uno dei più pronti a sfruttare questa possibilità è Levent Alpöge, che in breve tempo annuncia una serie di teoremi sorprendenti: il 19 luglio un controesempio alla congettura dello jacobiano, un mese dopo un controesempio alla congettura di Caratheodory, e pochi giorni dopo la costruzione di una struttura complessa sulla sfera di dimensione 6. Non mi dilungo su questi argomenti (chi è interessato troverà tutti i dettagli su wikipedia); basti dire che erano tre problemi aperti di grande rilievo nelle rispettive aree.
  • Nel frattempo Alpöge (che lavora in Anthropic) ha anche in piedi una collaborazione di lungo corso con Tristan Buckmaster (che lavora invece al Courant Institute di New York) mirante a dimostrare che le equazioni di Navier-Stokes con forzante esterna possono sviluppare una singolarità nel campo di velocità in tempo finito (risolvendo con ciò uno dei celebri problemi del millennio). Come primo passo, i due hanno deciso di affrontare lo stesso problema per delle equazioni più semplici di quelle di Navier-Stokes (Eulero, Boussinesq). Anche in questo caso fanno ampio uso dei modelli linguistici di punta, sia di Anthropic che di OpenAI.
  • Il 15 agosto Alpöge e Buckmeister si convincono di essere arrivati al risultato cercato per queste equazioni più semplici e iniziano a preparare tre articoli con le relative dimostrazioni spiegate come si deve.
  • Verso fine mese inizia a circolare la voce che i due abbiano trovato, o siano prossimi a trovare, un risultato importante sul problema di Navier-Stokes. La divisione matematica di OpenAI, venuta a conoscenza di queste voci, inzia ad attaccare il problema (per l’equazione vera, non una di quelle semplificate) usando modelli interni, più potenti di quelli a disposizione del pubblico, forse affinati specificamente per il ragionamento matematico, e forse addestrati anche sulle chat di argomento matematico condotte dai modelli di OpenAI negli ultimi anni (comprese, eventualmente, quelle di Alpöge e Buckmeister).
  • Lunedì 7 settembre Alpöge e Buckmeister pubblicano in gran fretta gli articoli a cui stavano lavorando, in una versione ancora preliminare. Il motivo di questa fretta è spiegato in un documento allegato, dove Buckmeister racconta le pressioni che aveva dovuto subire nei giorni precedenti da parte di OpenAI, che aveva nel frattempo ottenuto (con un dispendio di risorse enorme) una dimostrazione di singolarità per le equazioni Navier-Stokes, risolvendo così il problema del millennio vero e proprio. Anche qui, non mi dilungo ulteriormente su questi avvenimenti ormai ben noti; questo articolo di Maddmaths li racconta diffusamente (su wikipedia c’è una ricostruzione ancora più dettagliata).
  • La dimostrazione di OpenAI viene pubblicata il giorno dopo, in due forme distinte: una formalizzazione del risultato in Lean, e un PDF di 166 pagine che dovrebbe presentare la stessa dimostrazione in maniera “informale”. Come autore del PDF è indicato semplicemente “OPENAI”, e (anche se nessuno l’ha detto esplicitamente) sembra chiaro da subito che il PDF è stato prodotto senza alcun tipo di intervento umano, come semplice output di un LLM.
  • Nel frattempo il flusso di risultati “assistiti dall’AI” continua ad aumentare, tanto che ormai buona parte degli articoli che appaiono su arxiv e altri repository contengono un esplicito riconoscimento dell’uso di qualche modello linguistico, e arxiv ha dovuto introdurre dei limiti al numero di pubblicazioni che è possibile caricare mensilmente.
  • Il 21 settembre OpenAI comunica che il loro nuovo modello privato “ha già risolto più di 100 problemi aperti che coprono la gran parte delle discipline matematiche”, e sta pensando a come comunicare questi risultati in maniera “responsabile”. Questo parziale cambio di atteggiamento potrebbe essere dovuto in parte a una lettera aperta pubblicata l’11 settembre e sottoscritta da 25 medaglie Fields (!) in cui si obietta all’uso strumentale della soluzione di problemi aperti come benchmark per le abilità dei modelli linguistici.
  • Mentre stavo preparando questo articolo (7 ottobre) OpenAI ha pubblicato l’anticipata messe di risultati (Peter Woit l’ha chiamata slopocalypse, l’apocalisse della sbobba). A una prima rapida analisi, sembra una replica dello schema già visto per Navier-Stokes: una marea di PDF generati dall’IA, presumibilmente senza alcuna revisione umana, a volte (ma non sempre) accompagnati da una dimostrazione formalizzata dello stesso risultato.

Cosa pensare di questi sviluppi? In questo post cercherò di mettere in fila qualche riflessione che ho avuto modo di compiere sull’argomento negli ultimi tempi, stimolato dai vari pareri che ho letto in giro per la rete.

Far finta di niente non è possibile

Anzitutto è chiaro che questi sviluppi non possono essere semplicemente ignorati. I modelli linguistici di ultima generazione esistono, e chi li usa ha (attualmente) un vantaggio competitivo enorme rispetto a chi non li usa. Mi lasciano perplesse le posizioni di chi, come Vladimir Lazić e altri, pensa di poter far finta di niente e tirare avanti come se nulla fosse. Questa posizione è doppiamente perdente: perché è fuori dal tempo, e perché con la struttura attuale degli incentivi accademici porta a una inesorabile marginalizzazione. Non è detto che gli incentivi non cambieranno (vedi più avanti), ma occorrerà combattere perché ciò accada e la naturale conservatività delle istituzioni umane (università compresa) non lascia pensare che ciò avvenga in tempi rapidi.

Come siamo arrivati a questo punto

A cosa è dovuto il progresso spaventoso che abbiamo osservato negli ultimi mesi? Premesso che ormai da un paio di anni nessuno sa davvero come funzionano i modelli linguistici di punta delle aziende statunitensi (che di fatto non pubblicano più le loro attività di ricerca), il consenso attuale è che l’enorme successo degli LLM sia dovuto essenzialmente a tre fattori, strettamente correlati tra loro: la capacità dell’hardware di esecuzione (GPU, memoria, ecc.), le dimensioni del modello (numero di parametri), e la quantità di dati usati per l’addestramento. Più potente è l’hardware e più testi si hanno, più grande puoi fare il modello, e migliori saranno le performance finali. Su tutti e tre questi versanti c’è stato un progresso enorme nell’arco dell’ultimo anno.

Anzitutto la disponibilità di hardware delle compagnie di IA è aumentata a dismisura: non è un mistero come ormai l’intera produzione di GPU di punta da parte di Nvidia e simili venga interamente assorbita dalle aziende di IA, come pure la stragrande maggioranza della produzione dei chip di memoria (tanto da creare enormi problemi per il mercato consumer). È stato stimato che solo quest’anno negli USA saranno investiti tra i 600 e gli 800 miliardi di dollari nella costruzione di nuovi data center.

In secondo luogo, c’è stato sicuramente un progresso enorme nella pulizia dei dati: i primi modelli venivano addestrati usando dei corpus ottenuti sostanzialmente scaricando la totalità delle pagine Internet pubblicamente accessibili (es. CommonCrawl), e se avete presente la qualità media del contenuto di un sito web capirete bene come in questi dataset finisse di tutto e di più. Addirittura fino a qualche anno fa era un problema persino l’estrazione del testo dai PDF (ad es. nel caso di PDF su due colonne, come accade per molti articoli scientifici, il testo veniva spesso estratto riga per riga, mischiando quindi il contenuto delle due colonne). Possiamo tranquillamente assumere che i modelli odierni siano addestrati su documenti di qualità ben più elevata, ottenuti o direttamente dagli editori (riviste scientifiche, ecc.) o per scansione diretta di libri (anche se molti se ne sono accorti solo qualche mese fa).

Ci sono infine tutta una serie di innovazioni tecniche che non cambiano l’architettura di base dei modelli (che dovrebbe essere sempre quella del transformer; bisogna usare il condizionale perché, come detto, né OpenAI né Anthropic pubblicano più i dettagli tecnici dei loro modelli da anni) ma rendono più efficaci alcune fasi del processo. Una delle innovazioni più rilevanti sembra essere il cosiddetto Reinforcement Learning with Verifiable Rewards (RLVR), che consente di guidare la fase di addestramento verso un obiettivo misurabile quantitativamente; nel caso delle applicazioni alla matematica, l’obiettivo è presumibilmente quello di produrre ragionamenti corretti (cosa su cui i modelli linguistici hanno sempre lasciato un po’ a desiderare, nonostante l’introduzione delle cosiddette chain of thought). Per questo step è essenziale avere a disposizione un meccanismo per valutare la bontà delle risposte prodotte dal modello; è per questo che il RLVR sembra ottenere risultati particolarmente buoni nel campo delle scienze formali come l’informatica e la matematica, in cui è possibile controllare la correttezza di un programma (o di una dimostrazione formalizzata) in maniera relativamente rapida e poco onerosa.

L’analogia con i calcolatori è sbagliata

Un’analogia che si vede circolare parecchio è quella con l’avvento dei calcolatori elettronici nella seconda metà del secolo scorso, che ha completamente obliterato la necessità per gli esseri umani di fare calcoli (non guasta ricordare che fino agli anni ’60 il termine computer designava primariamente i “calcolatori umani”). Questa analogia è fuorviante per più ragioni. In primo luogo, fare matematica non significa fare calcoli, o meglio: l’aspetto calcolistico è l’aspetto più noioso del fare matematica. Per questo nessuno si è lamentato quando sono stati introdotti i calcolatori elettronici, che anzi sono stati subito riconosciuti come uno strumento importante, in grado di facilitare il lavoro e favorire l’esplorazione di nuove strade. Togliendo i calcoli alla matematica restano le parti divertenti: la scoperta di nuove regolarità, la messa a punto di nuovi strumenti o teorie e la dimostrazione della loro correttezza. Ma se automatizzi anche queste parti con gli LLM, cosa resta?

La seconda grossa differenza è che la meccanizzazione dei calcoli li rende enormemente più affidabili: gli esseri umani hanno noti limiti nella capacità di seguire procedure per lungo tempo e oltre una certa soglia di complessità senza introdurre errori, mentre un calcolatore correttamente programmato è essenzialmente infallibile (salvo errori hardware, che comunque si possono anch’essi tenere sotto controllo). Com’è noto, questo non è affatto vero per gli LLM, che sono proni ad allucinazioni ed estrapolazioni indebite nei testi che generano (trattandosi in fondo di semplici modelli statistici, privi di aggancio col contenuto semantico dei testi che generano). Allo stato attuale dell’arte, non è semplicemente possibile fidarsi dell’output di un LLM nella stessa maniera in cui ci fidiamo, ad esempio, del risultato dell’integrazione numerica di un sistema di equazioni differenziali che ci assicura che un ponte non crolli. L’unica garanzia affidabile è la produzione di una dimostrazione formalizzata, quando c’è; e anche in tal caso occorre sempre verificare che il modello non abbia “barato” in qualche modo (come sono già stati notati fare in altri ambiti, ad es. nella programmazione).

I problemi che la situazione attuale risolve

Detto tutto ciò, è innegabile che siamo di fronte a un passo avanti epocale. Lasciamo pure perdere la questione se questi modelli siano davvero in grado di “comprendere” o di “pensare”; in fondo è sempre la solita discussione dai tempi di Turing. Focalizziamoci invece su quello che questi modelli fanno, e su come usarli al meglio.

Come osservato da Kevin Buzzard (in un articolo che, detto per inciso, non condivido al 100%), il punto su cui dobbiamo concentrarci è che abbiamo creato uno strumento in grado di memorizzare l’intero corpus di conoscenze matematiche creato dall’umanità e di manipolarlo in maniera coerente rispondendo a richieste espresse in linguaggio naturale. Anche solo cinque anni fa un risultato del genere sarebbe sembrato fantascienza. Sono tanti i modi in cui questi modelli possono aiutarci; ne elenco tre, ma si potrebbe andare avanti a lungo.

  1. Gestione della letteratura. Un problema enorme, e che si è andato aggravando negli ultimi anni, è dato dalle dimensioni ormai sovrumane della letteratura matematica. Si dice spesso che l’epoca in cui una singola persona poteva tenere dietro a tutti gli sviluppi della disciplina è finita con Eulero e Gauss; ma l’esplosione della ricerca degli ultimi decenni, unita al progressivo aumento nella sofisticazione dei metodi, ha fatto sì che ormai sia impossibile restare aggiornati persino nei singoli campi. Strumenti che vengono sviluppati in un ramo potrebbero essere utilissimi in altri, se solo i ricercatori li conoscessero. Gli LLM attuali sono addestrati (quasi) sull’intero scibile umano, e possono quindi fornire un aiuto essenziale in questo senso.
  2. Verifica dei risultati noti. Non è un mistero il fatto che una frazione non insignificante di articoli pubblicati contiene errori più o meno gravi. Grazie agli LLM di ultima generazione sembra per la prima volta fattibile l’idea di prendere gli articoli più importanti di un dato ramo della matematica e tradurre le relative argomentazioni informali in dimostrazioni formali la cui correttezza è garantita oltre ogni ragionevole dubbio (le aziende di IA chiamano questo processo autoformalizzazione). Una simile impresa, se condotta su grande scala, aumenterebbe immensamente la fiducia nella correttezza dei risultati noti in letteratura (specialmente per i più complessi e/o controversi).
  3. Automazione delle dimostrazioni di routine. Ovviamente non tutte le dimostrazioni sono divertenti da fare, anzi; molte sono una semplice applicazione di tecniche già note a situazioni leggermente diverse. Automatizzare questo lavoro “di routine” lascerebbe più tempo per lavorare alle fasi genuinamente inventive della ricerca.

Più in generale, anche solo avere a disposizione in ogni momento un “partner virtuale” con cui fare brainstorming su un problema che ci sta bloccando sembra essere qualcosa di molto utile.

I problemi che la situazione attuale crea

Ma se la situazione è questa, perché la gran parte dei matematici di tutto il mondo è sconvolta e/o sul piede di guerra da settimane? C’è sicuramente in tutto ciò un minimo di effetto “caduta dall’Olimpo”: l’idea che un software, per quanto complesso, sia in grado di produrre catene di ragionamenti che fino ad ora erano esclusivo dominio della mente umana è senza dubbio fonte di riflessione. Ma a parte le tematiche esistenziali, c’è anche una serie di problemi più seri che hanno a che fare in parte con le circostanze attuali e in parte con problemi di fondo.

  • Accessibilità dei modelli. Il primo elefante nella stanza è senz’altro questo: i modelli che OpenAI ha usato e sta usando non sono pubblici, e non è chiaro se e quando lo diventeranno. Questa situazione crea, di fatto, uno squilibrio enorme: un numero ridotto di persone che lavora ad OpenAI (e in misura minore ad Anthropic) dispone in questo momento di una “potenza di fuoco” argomentativa vastamente superiore a quella di ogni altra persona al mondo. Questo, unitamente a un “culto della competizione” che, piaccia o non piaccia (a me non piace), ha sempre fatto in qualche misura parte della mentalità dei matematici, ha creato grande scontento e una diffusa ostilità verso OpenAI (anche al di là di quanto accaduto in dettaglio nel caso Navier-Stokes). Naturalmente questa problematica si riallaccia al discorso ben più generale sul controllo globale dell’intelligenza artificiale.
  • Scarsa qualità dell’output. Un altro problema è che, come già emerso tra le righe in questo post, se si vanno a vedere i documenti finali che vengono effettivamente prodotti da questi modelli (anche i più avanzati, come quello “segreto” di OpenAI) si trova che essi lasciano alquanto a desiderare. Gli enunciati dei teoremi usano spesso notazioni confuse, o non-standard, o sottilmente imprecise; gli argomenti sono difficili da seguire anche per gli specialisti, e talvolta sembrano più complicati del necessario. C’è un motivo, insomma, se Alpöge e Buckmeister hanno passato settimane a lavorare sulle loro dimostrazioni prima di renderle pubbliche obtorto collo. Vedremo come saranno ricevuti i nuovi PDF di OpenAI appena diffusi, ma nulla fa pensare che siano migliori di quanto visto finora.
  • Occultamento delle fonti. È ormai noto che gli LLM non eccellono nel tenere traccia e segnalare le fonti che usano nel loro ragionamento. Non è chiaro in che misura questo sia un problema strutturale oppure indotto dalle procedure di addestramento attualmente utilizzate; ma come già ampiamente osservato in ambito software, l’IA generativa non si fa problemi a riprodurre interi pezzi del suo materiale di addestramento senza alcuna attribuzione della fonte originale. Il paper di OpenAI sul problema di Navier-Stokes è emblematico: è lungo 166 pagine e ha un totale di 22 citazioni (compresa quella al sito del Clay Institute per l’enunciato del problema).
  • Lo spettro dell’inutilità. Ma supponiamo che tutti questi problemi siano solo temporanei. Supponiamo che tra sei mesi, o un anno, siano generalmente disponibili modelli specializzati nel ragionamento matematico, in grado di produrre prosa di buona qualità, inserendo le corrette citazioni alle fonti, e una parallela formalizzazione che passa il vaglio di un proof checker. Si può presumere che a questo punto in molti inizino a chiedersi che senso abbia continuare a mantenere dei dipartimenti di matematica pieni di ricercatori la cui attività può essere sostituita da un abbonamento a OpenAI che costa una frazione del loro stipendio mensile. A poco varrebbe obiettare che i modelli non “capiscono” ciò che producono; in una visione puramente utilitaristica della matematica, l’unica cosa che conta è essere in grado di rispondere a una domanda in un senso o nell’altro, e conoscere il perché di quella risposta è un optional del tutto superfluo.

Serve un nuovo approccio alla ricerca

Che morale trarre da tutto questo? Un primo punto, che è stato evidenziato da diversi commentatori, è che gli attuali standard di valutazione della ricerca accademica sembrano superati. In un mondo in cui una conoscenza anche superficiale di un argomento, accoppiata all’uso di un modello linguistico di ultima generazione, permette di produrre nel giro di qualche giorno (o ora) di lavoro un articolo dignitoso su quell’argomento, le valutazioni basate sul numero di pubblicazioni prodotte sembrano perdere di senso. (Non che ne avessero molto anche prima, visto che anteponendo la quantità alla qualità portavano a tutti quegli incentivi perversi che ben conosciamo.)

Quello a cui occorre dare priorità, secondo me, è proprio quello che gli LLM non ci possono dare (almeno al momento), cioè la comprensione di questa marea di nuovi risultati (e una migliore comprensione dei risultati già noti). Questa consapevolezza sta già percolando in vari ambiti: ad esempio la Mathathon, un evento che era stato ideato come una sorta di gara a chi risolve più problemi con l’aiuto degli LLM, è stata rimodulata proprio in questa direzione. Per il problema dell’accesso ai modelli, una proposta interessante che è stata avanzata è la creazione di modelli di IA pubblici, sviluppati direttamente da una comunità scientifica e a disposizione di chiunque ne accetti le regole.

Quella dell’inutilità è una questione complessa. Alcuni sostengono che, a patto di tenere al centro l’obiettivo della comprensione umana, la rivoluzione dell’IA porterà a più posti di lavoro, non a meno; ma per come la vedo io, il problema sta esattamente nella premessa. La comprensione, o in generale la fioritura umana, non è un obiettivo del capitalismo; e possiamo quindi aspettarci che, in tutti gli ambiti dove il capitalismo domina, l’automazione prenderà inesorabilmente il sopravvento. Almeno nel campo dell’educazione saremo in grado di evitare questo destino?

Lascia un commento

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *