Immagine AI

OpenAI introdurrà nelle prossime settimane un watermark invisibile nei testi generati da ChatGPT e Codex per gli utenti dell’Unione Europea, applicandolo a tutti i piani compatibili ma senza estenderlo, almeno nella fase iniziale, come impostazione predefinita al resto del mondo. La misura nasce per adeguare i sistemi di generazione testuale ai requisiti di trasparenza previsti dall’AI Act europeo, che richiede ai fornitori di intelligenza artificiale generativa di rendere i contenuti prodotti dai propri sistemi identificabili in forma leggibile dalle macchine. Per gli utenti delle API il meccanismo segue invece una logica differente: dal 5 ottobre 2026 i clienti di tutto il mondo possono scegliere di attivare il watermark su alcuni modelli compatibili, ma la funzione rimane disabilitata per impostazione predefinita. OpenAI sta inoltre collaborando con i provider cloud che distribuiscono i suoi modelli affinché il watermark possa essere utilizzato anche attraverso questi canali nelle settimane successive. La scelta di limitare inizialmente l’applicazione automatica ai testi generati nell’UE consente alla società di osservare il comportamento della tecnologia in condizioni reali prima di decidere eventuali estensioni geografiche. Anthropic aveva già adottato nell’agosto 2026 un sistema di watermarking per gli output di Claude su scala globale, decisione che aveva provocato critiche da parte di una parte degli utenti, mentre OpenAI ha scelto un’introduzione regionale e progressiva, distinguendo chiaramente tra l’attivazione automatica prevista per ChatGPT e Codex nell’Unione Europea e l’utilizzo opzionale disponibile nelle API.

La tecnologia utilizzata da OpenAI si chiama textGrain e non inserisce caratteri nascosti, spazi invisibili, metadati testuali o segni riconoscibili dall’utente. Il watermark viene incorporato direttamente nel processo con cui il modello seleziona le parole o, più precisamente, i token successivi durante la generazione: il sistema modifica in maniera controllata la distribuzione statistica delle possibili scelte, producendo nel corso di un testo un pattern che può essere successivamente individuato da un rilevatore dedicato. Poiché il segnale è incorporato nelle scelte linguistiche stesse, il semplice copia e incolla non lo elimina, mentre trasformazioni più profonde del testo possono ridurne significativamente la rilevabilità. OpenAI riferisce che nelle proprie valutazioni textGrain ha raggiunto risultati comparabili o superiori rispetto agli altri approcci analizzati, compreso SynthID per il testo, e che l’introduzione del watermark non ha prodotto differenze significative nella qualità misurata sui benchmark utilizzati per valutare il modello Astra; anche la velocità di generazione risulterebbe interessata solo in misura trascurabile. Il principio è quindi differente dai normali classificatori utilizzati da molti rilevatori di testi generati da AI: questi ultimi cercano, a posteriori, caratteristiche statistiche compatibili con una scrittura artificiale, mentre textGrain inserisce intenzionalmente un segnale durante la generazione, rendendo possibile verificare non semplicemente se un testo “sembra” prodotto da un modello, ma se presenta il pattern specifico previsto dal sistema di watermarking OpenAI.

Il sistema presenta tuttavia limiti rilevanti e OpenAI sottolinea che il risultato del detector non può essere considerato una prova assoluta dell’origine di un testo. Nei test descritti dalla società, su contenuti lunghi circa 200 token e impostando il tasso di falsi positivi all’1%, il watermark veniva rilevato approssimativamente nell’80% dei casi, mentre con testi di circa 400 token il valore saliva intorno al 95%. La rilevabilità diminuisce nei contenuti in cui il modello dispone di poche alternative linguistiche, come alcune risposte matematiche o estremamente vincolate, e soprattutto quando il testo viene modificato. In una prova condotta su testi da 400 token, la sostituzione del 10% delle parole con sinonimi ha fatto scendere il tasso di rilevamento da circa il 92% al 66%, mentre modificando il 25% delle parole il valore si è ridotto fino a circa il 17%. Anche i testi brevi e quelli sottoposti a traduzione risultano quindi più difficili da riconoscere, tanto che le regole europee sulla trasparenza non richiedono il watermark per alcuni output particolarmente corti, inferiori a 200 token, o per frammenti di codice. La qualità del rilevamento varia inoltre tra le lingue: nei test sulle 24 lingue ufficiali dell’Unione Europea, con un tasso di falsi positivi dell’1%, lo spagnolo ha ottenuto il risultato più elevato con circa il 69%, mentre il rumeno si è fermato intorno al 42,2%; OpenAI può modificare l’intensità statistica del watermark per migliorare il comportamento nei domini o nelle lingue dove il segnale è più difficile da individuare. Per questi motivi il detector non verrà reso immediatamente disponibile a tutti: nella fase iniziale potranno richiederne l’accesso soltanto ricercatori approvati e organizzazioni specializzate, così da raccogliere dati sul comportamento del sistema e ridurre il rischio che falsi positivi o falsi negativi vengano interpretati in maniera impropria.

Il watermark fornisce inoltre informazioni molto più limitate rispetto a quanto potrebbe suggerire un semplice risultato positivo. La presenza di textGrain indica che un sistema OpenAI ha probabilmente generato o elaborato almeno parte del contenuto, ma non permette di identificare l’utente o l’account che lo ha prodotto, non rivela il prompt utilizzato né il contenuto della conversazione e non consente di stabilire quanta parte del testo sia stata scritta o modificata successivamente da una persona. Il segnale non certifica inoltre la correttezza delle informazioni, non attribuisce la paternità dell’opera, non determina la proprietà intellettuale e non stabilisce alcuna responsabilità giuridica. Allo stesso modo, l’assenza di un watermark rilevabile non dimostra che un testo sia stato scritto da una persona, perché il contenuto potrebbe essere troppo corto, essere stato ampiamente riscritto o tradotto, provenire da un modello OpenAI non supportato, essere stato generato prima dell’introduzione della tecnologia oppure derivare da un altro sistema di intelligenza artificiale. textGrain entra quindi in una strategia più ampia di provenienza dei contenuti: OpenAI utilizza già Content Credentials basate sullo standard C2PA e watermark SynthID per le immagini compatibili, SynthID per l’audio e strumenti di verifica dedicati, sostenendo che nessuna singola tecnologia sia sufficiente a ricostruire da sola l’origine e la storia di un contenuto digitale. Per il testo, la società prevede inoltre di rendere textGrain open source, così da consentire a ricercatori e sviluppatori di studiarne il funzionamento e contribuire allo sviluppo di sistemi di watermarking più affidabili.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy