Immagine AI

OpenAI ha comunicato che un proprio modello interno è riuscito a risolvere o a compiere progressi sostanziali su oltre 100 problemi matematici di livello avanzato, un risultato che ha sorpreso anche i matematici dell’azienda per la quantità, la varietà e la profondità delle soluzioni prodotte. Il sistema non è stato presentato come un modello specializzato esclusivamente nella matematica, ma come una versione interna di una nuova generazione di modelli di ragionamento utilizzata per testare fino a che punto sistemi general purpose possano contribuire alla ricerca scientifica di frontiera. Il lavoro ha riguardato problemi aperti o particolarmente difficili in diverse aree della matematica e dell’informatica teorica, con esempi che comprendono geometria ad alta dimensione, teoria dei codici, complessità dei circuiti aritmetici, teoria dei gruppi, algebre di operatori, complessità quantistica, crittografia basata su reticoli e combinatoria estremale. OpenAI aveva già reso pubblici durante il 2026 alcuni risultati ottenuti da modelli interni, tra cui una confutazione della congettura sulle distanze unitarie di Erdős e una serie di dieci progressi matematici selezionati, ma il nuovo bilancio indica che il numero complessivo dei problemi affrontati con successo è molto più ampio rispetto ai singoli casi pubblicati fino a questo momento.

Uno degli aspetti più rilevanti riguarda il fatto che diversi risultati non consistono nella semplice riproduzione di tecniche già note, ma nell’individuazione di argomentazioni nuove o combinazioni non evidenti di strumenti matematici esistenti. Nel caso della congettura di Erdős sulle distanze unitarie, per esempio, il modello interno di OpenAI ha prodotto una costruzione che smentisce l’ipotesi secondo cui le configurazioni basate sulla griglia quadrata fossero essenzialmente ottimali, introducendo un miglioramento polinomiale e utilizzando strumenti sofisticati della teoria algebrica dei numeri in un problema di geometria combinatoria. OpenAI ha sottoposto quella dimostrazione alla verifica di matematici esterni, che hanno controllato l’argomento e preparato anche un documento di accompagnamento per contestualizzarne la rilevanza. L’azienda ha inoltre pubblicato nell’agosto 2026 dieci risultati ottenuti da una versione interna di Astra, ciascuno dei quali risolveva oppure faceva avanzare in modo sostanziale un problema aperto di lunga data; il costo complessivo in token necessario per trovare quelle soluzioni sarebbe stato equivalente a circa 2.000 dollari utilizzando i prezzi API di Sol, mentre la successiva trasformazione delle argomentazioni in manoscritti e la formalizzazione in Lean sono state effettuate con il supporto dello stesso sistema.

La componente di verifica ha un ruolo centrale nell’intero processo. Le soluzioni prodotte dai modelli non vengono considerate automaticamente corrette per il solo fatto di essere formalmente articolate, ma vengono sottoposte a controllo umano e, quando possibile, anche a formalizzazione matematica. OpenAI utilizza Lean per trasformare le dimostrazioni in certificati verificabili automaticamente, riducendo il rischio che passaggi apparentemente plausibili nascondano errori logici. Questo approccio era già stato utilizzato nei test denominati First Proof, nei quali un modello interno era stato eseguito su dieci problemi matematici di livello di ricerca progettati per richiedere dimostrazioni complete e verificabili, non semplici risposte numeriche o soluzioni da competizione. Alcuni di questi problemi erano rimasti aperti per anni prima di essere risolti dagli stessi autori, e OpenAI aveva scelto di pubblicare i tentativi del modello proprio per permettere alla comunità matematica di analizzarne la correttezza e i limiti. La stessa metodologia è stata mantenuta anche nelle ricerche successive, combinando generazione delle idee, revisione umana e strumenti formali di verifica.

I risultati ottenuti nel 2026 comprendono anche problemi di difficoltà molto diversa, un aspetto che OpenAI e gli stessi matematici coinvolti invitano a considerare con attenzione quando si interpreta il numero complessivo delle soluzioni. Non tutti i problemi aperti hanno lo stesso peso o richiedono lo stesso livello di innovazione, e il fatto che un modello riesca a risolverne un numero elevato non significa automaticamente che ciascuno rappresenti una scoperta paragonabile alle questioni più importanti della matematica contemporanea. Allo stesso tempo, alcuni esempi pubblicati riguardano problemi rimasti irrisolti per decenni e hanno prodotto risultati giudicati rilevanti da specialisti esterni. All’inizio del 2026 GPT-5.2 aveva inoltre contribuito, insieme a strumenti come Aristotle e Lean e con la validazione di Terence Tao, alla soluzione o confutazione di diversi problemi di Erdős, mentre nel 2025 GPT-5 aveva aiutato il matematico Ernest Ryu a individuare un percorso per risolvere una questione aperta da circa quarant’anni nella teoria dell’ottimizzazione. Questi episodi hanno progressivamente spostato l’uso dei modelli dalla semplice assistenza nel calcolo o nella ricerca bibliografica verso un ruolo più diretto nell’esplorazione delle strategie di dimostrazione.

Il livello raggiunto dai sistemi interni è emerso in modo ancora più evidente nel settembre 2026, quando OpenAI ha pubblicato una soluzione al problema dell’esistenza e regolarità delle equazioni di Navier-Stokes, uno dei Millennium Prize Problems. In quel caso l’azienda ha precisato di aver utilizzato un modello interno significativamente più capace di GPT-6 Astra, sviluppato attraverso reinforcement learning su larga scala a partire da un modello preaddestrato. Il sistema ha prodotto una dimostrazione secondo cui le equazioni tridimensionali di Navier-Stokes possono sviluppare una singolarità in tempo finito, e OpenAI ha pubblicato sia il manoscritto sia una formalizzazione in Lean. L’azienda ha tuttavia specificato di non voler rivendicare il Millennium Prize e ha presentato il risultato come una dimostrazione dello stato attuale delle capacità dei propri sistemi piuttosto che come un punto di arrivo definitivo. Questo episodio mostra anche quanto rapidamente siano cambiati i livelli di prestazione interni nel corso dello stesso anno: Astra aveva già prodotto risultati considerati notevoli durante l’estate, mentre pochi mesi dopo OpenAI dichiarava di avere a disposizione un sistema ancora sensibilmente più avanzato.

La stessa OpenAI sta ora cercando di strutturare in modo più formale il rapporto tra questi sistemi e la comunità scientifica. Oltre ad aver annunciato ChatGPT for Academic Researchers, iniziativa che prevede l’accesso gratuito ai propri modelli più avanzati per 100.000 scienziati e matematici, l’azienda sta costituendo un Advisory Group on Mathematics and Artificial Intelligence indipendente, ospitato presso l’Institute for Advanced Study. L’obiettivo è creare un meccanismo esterno di confronto sulle modalità con cui i risultati prodotti dall’AI dovrebbero essere valutati, verificati, attribuiti e comunicati alla comunità matematica, soprattutto nel momento in cui i modelli iniziano a generare un volume di nuove dimostrazioni superiore a quello che i singoli ricercatori possono controllare rapidamente. Il dato delle oltre 100 soluzioni assume quindi importanza non soltanto per la capacità del modello di trovare dimostrazioni, ma anche perché introduce un problema operativo nuovo: sviluppare procedure di revisione e validazione sufficientemente rigorose e scalabili da distinguere in tempi ragionevoli i risultati realmente nuovi e corretti da quelli incompleti, già noti o apparentemente convincenti ma matematicamente errati.

Di Fantasy