Immagine AI

Illumina ha introdotto SpliceAI2, un nuovo modello di intelligenza artificiale genomica sviluppato dal BioInsight AI Lab per prevedere gli effetti delle varianti genetiche sui processi di splicing dell’RNA e migliorare l’identificazione delle alterazioni potenzialmente associate a patologie. Il sistema rappresenta l’evoluzione di SpliceAI, presentato nel 2019 e successivamente citato in oltre 3.400 pubblicazioni scientifiche, le cui capacità di previsione sono state integrate anche nelle raccomandazioni di ClinGen per l’interpretazione delle varianti genetiche. SpliceAI2 è stato addestrato su un insieme di dati oltre cento volte più grande rispetto a quello utilizzato dal predecessore e amplia considerevolmente il tipo di informazioni ricavabili da una sequenza genomica. Mentre il modello originale era progettato soprattutto per prevedere se una determinata posizione potesse essere utilizzata come sito di splicing, la nuova architettura cerca di stabilire quali siti vengono effettivamente impiegati e con quale frequenza, quali connessioni si formano tra i siti attraverso le giunzioni di splicing e quali isoforme complete di trascritto RNA vengono prodotte. Il modello richiede soltanto una sequenza di DNA come input, rendendo possibile eseguire analisi a livello di trascritto anche quando non sono disponibili campioni di RNA provenienti da tessuti difficili da ottenere. Questa caratteristica è particolarmente importante nella ricerca sulle malattie rare, sui tumori ereditari e sulle varianti di significato clinico incerto.

L’architettura di SpliceAI2 elabora finestre di sequenza genomica lunghe 196.608 coppie di basi e comprende circa 13 milioni di parametri addestrabili. Le previsioni relative ai siti di splicing e alle loro connessioni vengono integrate in uno splice graph, una rappresentazione strutturata delle possibili combinazioni attraverso le quali un gene può produrre trascritti differenti. A partire da questa struttura, il modello ricostruisce le isoforme complete e stima la frequenza relativa con cui vengono utilizzate. L’addestramento end-to-end ha impiegato 314.745 campioni di sequenziamento RNA provenienti dall’essere umano e da altre nove specie di mammiferi, comprendenti oltre 46 milioni di giunzioni di splicing osservate dopo le procedure di filtraggio. Sono stati inoltre integrati 330 campioni di sequenziamento RNA a lettura lunga provenienti dal progetto pubblico ENCODE, utili per apprendere l’organizzazione dei trascritti completi anziché soltanto le loro singole giunzioni. Nei test sui geni esclusi dall’addestramento, il modello ha ricostruito esattamente il trascritto più abbondante nell’82% dei casi, rispetto al 78% raggiunto da una versione addestrata senza i dati long-read. Questa differenza evidenzia il contributo delle letture lunghe nella ricostruzione delle isoforme e nella comprensione delle relazioni tra siti di splicing distanti lungo lo stesso gene.

Illumina ha sviluppato anche un sistema di fine-tuning che utilizza i livelli di espressione di 147 proteine leganti l’RNA per adattare le previsioni alle caratteristiche dei diversi tessuti. La procedura sfrutta quasi 15 milioni di misurazioni relative alle differenze nell’utilizzo dei siti di splicing, ottenute da 48 tessuti inclusi nel progetto Genotype-Tissue Expression, o GTEx. Questo approccio permette di considerare come la regolazione dello splicing cambi a seconda del contesto biologico, anziché assumere un comportamento identico in ogni tessuto. Durante l’addestramento il modello ha inoltre appreso autonomamente motivi ricorrenti nelle sequenze riconosciute da regolatori biologici dello splicing, senza che tali relazioni fossero codificate esplicitamente. La stessa architettura è stata adattata allo studio di condizioni patologiche caratterizzate da alterazioni dello splicing, comprese neoplasie con mutazioni del gene SF3B1 e distrofia miotonica. L’insieme delle funzionalità consente quindi di collegare una modificazione della sequenza del DNA non soltanto alla possibile comparsa o scomparsa di una giunzione, ma anche alle conseguenze sulla composizione complessiva dei trascritti prodotti.

I risultati sperimentali mostrano miglioramenti rispetto a SpliceAI, Pangolin e AlphaGenome di Google DeepMind in diversi benchmark indipendenti, con confronti rispetto ad AlphaGenome condotti anche da collaboratori dell’Università di Oxford. Nell’identificazione delle varianti che attivano siti di splicing criptici nei dati GTEx, SpliceAI2 ha ottenuto un’area sotto la curva precision-recall pari a 0,77, contro 0,66 del migliore modello concorrente. Nella quantificazione dell’utilizzo dei siti di splicing, la correlazione di Spearman è risultata pari a 0,63 rispetto a 0,47, corrispondente a un miglioramento dichiarato del 34%. Per la classificazione delle varianti associate a differenze quantitative dello splicing, l’area sotto la curva ROC ha raggiunto 0,76 contro 0,73, mentre nel benchmark OpenSplice basato su saggi reporter paralleli la correlazione di Spearman è stata pari a 0,59 contro 0,55. Queste misure valutano aspetti differenti del comportamento del modello e non devono essere considerate direttamente intercambiabili: nel loro insieme documentano un miglioramento sia nel riconoscimento delle alterazioni sia nella stima quantitativa dei loro effetti.

Una delle verifiche più significative ha riguardato 7.504 soggetti indice del progetto Genomics England 100,000 Genomes Project. L’analisi ha mostrato che le varianti prioritarizzate da SpliceAI2 risultavano maggiormente concentrate in geni associati ai fenotipi patologici osservati, consentendo di identificare il 17% in più di varianti associate a malattie rispetto agli altri modelli di splicing esaminati, a parità di soglie di confidenza. A un odds ratio fissato a 2, il modello ha recuperato 133 varianti aggiuntive rispetto alle 114 del migliore concorrente. Nel confronto diretto con SpliceAI, Illumina ha comunicato un incremento del 33% nell’identificazione di varianti rilevanti a un livello di confidenza 2X e del 66% a un livello 4X. Circa metà delle varianti associate all’attivazione di siti criptici si trovava in regioni introniche profonde, e quelle collocate oltre 50 coppie di basi all’interno degli introni sarebbero normalmente difficili da rilevare mediante il solo sequenziamento dell’esoma. Le varianti con effetti previsti sullo splicing rappresentavano il 15% dell’eccesso di carico genetico associato alla malattia nella coorte analizzata. La validazione su scala di popolazione ha utilizzato oltre 627.000 genomi provenienti da gnomAD, TOPMed e UK Biobank, mostrando una forte deplezione delle varianti con punteggi SpliceAI2 elevati, compatibile con l’azione della selezione naturale contro alterazioni biologicamente dannose. Nei dati proteomici di 36.764 partecipanti alla UK Biobank, i portatori delle varianti con punteggi più elevati presentavano concentrazioni plasmatiche inferiori delle proteine corrispondenti, con una correlazione di Pearson pari a -0,50, la più marcata tra quelle ottenute dai modelli confrontati.

Ulteriori verifiche condotte sui dati di sequenziamento RNA di 5.435 partecipanti a Genomics England hanno permesso di confermare specifiche previsioni individuali, comprese una variante che compromette un sito donatore di PEX1 associata a distrofia dei coni e dei bastoncelli e una variante che genera un sito donatore criptico in PKD1 associata a malattia renale cistica. SpliceAI2 entra così a far parte della famiglia di modelli Illumina destinati alla previsione degli effetti delle varianti, insieme a PromoterAI e PrimateAI-3D, dedicati rispettivamente alle alterazioni delle regioni regolatorie e alle varianti missenso. Secondo Illumina, l’impiego combinato dei tre modelli consente di individuare fino al doppio delle varianti con un impatto biologico previsto rispetto agli approcci di riferimento. Il sistema è accessibile attraverso le applicazioni della BioInsight Platform, fra cui DRAGEN Annotation, Emedgene e Illumina Connected Insights. Codice sorgente, pesi del modello e predizioni precalcolate per circa quattro miliardi di possibili varianti a singolo nucleotide nei geni umani e 150 milioni di piccole inserzioni e delezioni osservate nelle popolazioni sono distribuiti su GitHub e Hugging Face per la ricerca accademica e non commerciale, mentre l’impiego commerciale richiede una licenza distinta. Il software è installabile tramite PyPI e necessita di una GPU compatibile con CUDA. Il punteggio riassuntivo varia tra zero e uno, con soglie raccomandate di 0,1 per massimizzare il richiamo, 0,25 per bilanciare precisione e richiamo e 0,5 per privilegiare la precisione. Lo sviluppo è stato guidato da Kishore Jaganathan e Kyle Farh, con collaborazioni che comprendono l’Università di Oxford, UCSF e il New York Genome Center.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy