Immagine AI

Google DeepMind ha presentato SynthID Bio, una famiglia di metodi di watermarking progettata per inserire una firma impercettibile e verificabile direttamente nelle sequenze proteiche generate dall’intelligenza artificiale e nelle strutture tridimensionali previste dai modelli. Il sistema adatta il watermark al tipo di dato: nelle sequenze orienta in modo controllato la scelta degli amminoacidi, mentre nelle strutture 3D modifica leggermente le coordinate atomiche, mantenendo però un segnale rilevabile. L’obiettivo è consentire di verificare l’origine artificiale non soltanto del modello digitale, ma anche della proteina fisicamente sintetizzata. Nei test di laboratorio condotti su binder proteici diretti contro VEGF-A, il dominio RBD della proteina spike di SARS-CoV-2 e PD-L1, i progetti marcati hanno mantenuto valori comparabili alle versioni prive di watermark per tasso di successo, affinità di legame e diversità naturale delle sequenze. Per questi esperimenti DeepMind ha combinato AlphaProteo con una versione di ProteinMPNN modificata per supportare SynthID Bio, ottenendo quelli che descrive come i primi binder proteici biologicamente funzionali dotati di watermark verificabile.

Il watermarking è stato integrato anche nel processo di previsione strutturale di AlphaFold 3 attraverso il fine-tuning di una piccola parte della rete di diffusione, così da incorporare la firma direttamente nei pesi del modello. Le coordinate tridimensionali prodotte contengono quindi automaticamente un segnale rilevabile indipendentemente da chi esegue il modello. Secondo DeepMind, questa modifica conserva l’accuratezza predittiva di AlphaFold 3 e le principali distribuzioni delle caratteristiche strutturali, raggiungendo al tempo stesso una rilevabilità prossima al 100% e mantenendo il watermark anche in presenza di rumore digitale o piccole alterazioni delle coordinate. La tecnologia nasce anche per affrontare un problema crescente nella biosicurezza: i sistemi generativi possono produrre sequenze biologiche completamente nuove, con scarsa somiglianza rispetto a minacce già note, rendendo più difficile per i fornitori di sintesi del DNA stabilire se una richiesta insolita rappresenti una variante naturale sconosciuta o un progetto artificiale potenzialmente problematico. In questo contesto SynthID Bio può fornire un segnale automatico che attesti la provenienza della sequenza da un modello affidabile dotato di salvaguardie integrate, riducendo il numero di casi che richiedono una revisione manuale approfondita.

Lo stesso meccanismo potrebbe essere utilizzato per migliorare l’integrità di database scientifici aperti come Protein Data Bank, UniProt e GenBank, dove l’inserimento di strutture sintetiche non correttamente identificate potrebbe contaminare i dataset utilizzati per ricerca e valutazioni di biosicurezza. Il watermark permetterebbe di segnalare automaticamente i contenuti biologici generati artificialmente o di sottoporli a verifiche aggiuntive durante il processo di caricamento. DeepMind sta inoltre estendendo il sistema oltre le singole proteine: in collaborazione con il laboratorio di Brian Hie alla Stanford University e con Arc Institute, SynthID Bio è stato integrato in Evo 2 per inserire un watermark nel genoma di un batteriofago progettato dal modello. I primi test su colture batteriche indicano che i fagi marcati mantengono la propria funzionalità biologica, mentre ulteriori risultati saranno pubblicati in un lavoro tecnico dedicato.

Restano tuttavia aperti alcuni problemi, soprattutto la necessità di rendere il watermark più resistente a manipolazioni intenzionali. DeepMind prevede che SynthID Bio possa essere affiancato da sistemi di provenienza basati su metadati, analoghi agli standard C2PA utilizzati per i contenuti digitali, oppure da repository centrali contenenti informazioni sui progetti biologici generati dall’AI. La nuova tecnologia estende al campo della biologia sintetica la famiglia SynthID, già utilizzata da Google per inserire watermark invisibili in immagini, audio, testo e video generati artificialmente. Insieme al progetto DeepMind ha pubblicato un paper metodologico, rilasciato come open source il codice e i dati in vitro e reso disponibili alla comunità di ricerca anche i pesi dei modelli, con l’obiettivo di consentire ulteriori verifiche e sviluppi della tecnica.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy