Immagine AI

OpenAI ha dichiarato di aver individuato e interrotto una campagna coordinata finalizzata a estrarre su larga scala il cosiddetto protected reasoning dei propri modelli, cioè le informazioni interne utilizzate dal sistema durante il processo di ragionamento e normalmente non mostrate nella risposta finale. L’attività è stata rilevata per la prima volta il 1° luglio 2026 e, dopo una fase iniziale a basso volume, ha registrato un forte aumento il 24 e 25 luglio, quando oltre 4.000 account hanno generato circa 16.000 richieste riconducibili allo stesso schema di estrazione. L’indagine successiva ha individuato pattern correlati in un cluster di oltre 15.000 utenti e OpenAI afferma di aver bloccato completamente l’attività entro il 28 luglio. Secondo l’azienda, una parte centrale della campagna è riconducibile a soggetti associati a Moonshot AI, sviluppatore dei modelli Kimi, anche se non è stato possibile stabilire che tutti gli operatori coinvolti appartenessero alla stessa organizzazione. OpenAI precisa inoltre che i numeri comunicati descrivono tentativi di estrazione e non necessariamente casi nei quali il recupero delle informazioni sia effettivamente riuscito.

La tecnica viene classificata come adversarial distillation, una forma di distillazione non autorizzata nella quale output o informazioni di ragionamento di un modello avanzato vengono raccolti sistematicamente per addestrare, riprodurre o migliorare un altro modello. La distillazione in sé è una tecnica comune nel machine learning, ma in questo caso gli operatori avrebbero cercato di recuperare informazioni esplicitamente protette attraverso modalità progettate per aggirare i normali meccanismi di isolamento. Tra le tecniche osservate, OpenAI cita il trasferimento del reasoning cifrato ottenuto in una conversazione verso una seconda sessione, nella quale veniva chiesto al modello di decodificarlo e trascriverlo in forma leggibile. Gli schemi di attacco sono stati modificati più volte in risposta alle contromisure introdotte, indicando un processo iterativo di adattamento. L’azienda sottolinea però che non sono stati violati i sistemi crittografici, non è stato compromesso alcun database e non è avvenuto accesso diretto alle conversazioni archiviate degli utenti: l’attacco sfruttava invece il comportamento del modello per trasformare informazioni che avrebbero dovuto restare nascoste in contenuti visibili al richiedente.

OpenAI considera particolarmente rilevante questo tipo di attacco perché il reasoning interno può contenere passaggi e strategie che non compaiono nell’output finale ma che possono contribuire a riprodurre capacità avanzate del modello. L’estrazione sistematica di queste informazioni permetterebbe quindi di trasferire conoscenze e comportamenti verso altri sistemi senza sostenere integralmente i costi di ricerca, addestramento e sviluppo delle relative salvaguardie. Il rischio aumenta nei domini dual use, nei quali capacità avanzate possono essere riutilizzate anche in contesti sensibili. Per contrastare la campagna, OpenAI ha bannato o limitato gli account coinvolti, rafforzato i controlli sulle registrazioni e sull’infrastruttura, ampliato il monitoraggio delle reti collegate e introdotto verifiche aggiuntive sugli output in streaming per intercettare eventuali esposizioni del reasoning. È stato inoltre chiuso uno specifico percorso che permetteva a chi possedeva reasoning cifrato appartenente a un altro utente di riprodurlo e recuperarne il contenuto attraverso un’altra sessione.

L’azienda ha condiviso le informazioni raccolte con il Frontier Model Forum e attraverso canali governativi dedicati allo scambio di intelligence sulle minacce, segnalando che il problema non riguarda esclusivamente i propri modelli ma può interessare più in generale sistemi che utilizzano artefatti di reasoning trasportabili o riutilizzabili. OpenAI prevede che i tentativi di distillazione avversaria diventino progressivamente più sofisticati e sta quindi lavorando su tre livelli: rafforzamento delle protezioni tecniche contro l’estrazione, miglioramento dei sistemi di rilevamento e sanzione delle campagne coordinate e maggiore condivisione delle informazioni tra aziende e istituzioni. L’episodio arriva inoltre dopo accuse analoghe formulate da Anthropic nei confronti di Moonshot AI, accusata di aver utilizzato grandi volumi di richieste a Claude per contribuire all’addestramento di Kimi; OpenAI precisa però che dimensioni delle campagne, metodologia di rilevamento e durata delle indagini sono differenti e non consentono confronti diretti tra i numeri riportati nei diversi casi.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy