Immagine AI

Biohub ha annunciato il 7 ottobre 2026 l’ampliamento della propria Virtual Biology Initiative attraverso un programma internazionale del valore complessivo di 1,8 miliardi di dollari, destinato alla produzione, standardizzazione e distribuzione di grandi quantità di dati biologici utilizzabili per addestrare modelli di intelligenza artificiale predittiva. L’iniziativa coinvolge il Dipartimento dell’Energia degli Stati Uniti, i National Institutes of Health, Google DeepMind, Isomorphic Labs e Meta, riunendo infrastrutture di ricerca biomedica, capacità computazionali e tecnologie di misurazione cellulare all’interno di un progetto coordinato. L’obiettivo scientifico consiste nel costruire le basi informative necessarie allo sviluppo di modelli capaci di prevedere il comportamento delle cellule quando vengono esposte a modificazioni genetiche, farmaci, stimoli ambientali oppure alterazioni delle condizioni biologiche. L’organizzazione, fondata nel 2016 da Mark Zuckerberg e Priscilla Chan, aveva già presentato nell’aprile 2026 la Virtual Biology Initiative come programma dedicato alla realizzazione di una rappresentazione computazionale della biologia. La nuova fase amplia considerevolmente le risorse disponibili e introduce una collaborazione tra istituzioni pubbliche e imprese tecnologiche per produrre dati sperimentali con caratteristiche adatte all’addestramento dei sistemi AI. Biohub considera infatti la disponibilità di informazioni biologiche sufficientemente estese, omogenee e confrontabili uno dei principali ostacoli alla costruzione di modelli predittivi affidabili, anche in presenza di architetture neurali avanzate e di notevoli capacità di calcolo.

L’impegno economico complessivo comprende contributi finanziari diretti, infrastrutture computazionali, tecnologie sperimentali e valorizzazione di dataset già prodotti attraverso investimenti precedenti. Biohub ha destinato al progetto un impegno iniziale di 500 milioni di dollari, dei quali 400 milioni sono rivolti allo sviluppo di nuove tecnologie capaci di ampliare la quantità e la qualità delle misurazioni effettuabili sui sistemi biologici. Il Dipartimento dell’Energia statunitense contribuirà con oltre 500 milioni di dollari distribuiti nell’arco di cinque anni, destinati alle attività di misurazione in laboratorio, modellazione e calcolo scientifico. I National Institutes of Health coordineranno invece il contributo di dataset, repository e basi di conoscenza realizzati attraverso più di 500 milioni di dollari di precedenti investimenti federali, lavorando insieme a Biohub per renderli più uniformi e direttamente utilizzabili nell’addestramento dei modelli. Google DeepMind, Isomorphic Labs e Meta hanno inoltre annunciato un investimento congiunto di 300 milioni di dollari nella Virtual Biology Initiative, destinato allo sviluppo delle tecnologie e dei dataset multimodali necessari alla realizzazione di modelli predittivi della vita. Il valore complessivo di 1,8 miliardi di dollari non rappresenta quindi una singola erogazione in denaro immediatamente disponibile, ma comprende impegni di natura differente, inclusi dati e risorse sviluppati in precedenza. Questa distinzione è particolarmente importante per comprendere l’organizzazione finanziaria del programma e la distribuzione delle attività tra i soggetti partecipanti.

La finalità tecnologica principale è la costruzione di modelli definiti virtual cells, rappresentazioni computazionali progettate per prevedere come una cellula si comporti in determinate condizioni e come possa reagire a un intervento specifico. L’idea si distingue dalla semplice classificazione automatica di immagini microscopiche o dalla previsione statistica di una singola proprietà biologica. Un modello cellulare predittivo dovrebbe infatti integrare informazioni relative all’espressione genica, alla composizione molecolare, alla struttura interna, alle interazioni con altre cellule e alle modificazioni che si verificano durante differenti condizioni sperimentali. Attraverso una rappresentazione sufficientemente accurata, un ricercatore potrebbe formulare ipotesi su ciò che accadrebbe dopo l’attivazione o la disattivazione di un gene, l’introduzione di una molecola oppure l’alterazione di uno stimolo ambientale, ottenendo una previsione prima di realizzare l’esperimento fisico. Biohub intende utilizzare questo approccio per consentire agli scienziati di selezionare in maniera più efficace le prove da eseguire in laboratorio, concentrando le risorse sulle ipotesi considerate maggiormente promettenti. La creazione di modelli capaci di simulare affidabilmente il comportamento cellulare rimane tuttavia un obiettivo di ricerca: l’iniziativa non annuncia la disponibilità di una cellula virtuale universale già validata, né la possibilità attuale di sostituire integralmente gli esperimenti biologici reali attraverso simulazioni digitali.

Uno degli ostacoli affrontati dal programma riguarda la frammentazione delle informazioni biologiche disponibili. I dati prodotti dai laboratori possono differire per strumenti utilizzati, protocolli sperimentali, condizioni di preparazione dei campioni, tecnologie di sequenziamento, nomenclature e modalità di registrazione. Anche quando due esperimenti analizzano un medesimo fenomeno, differenze nelle procedure possono rendere difficoltoso il confronto diretto dei risultati. Per addestrare un modello capace di individuare regolarità biologiche generali, non è sufficiente accumulare grandi quantità di misurazioni: occorre anche ricostruire il contesto nel quale esse sono state ottenute e definire rappresentazioni che permettano di utilizzare congiuntamente informazioni provenienti da sorgenti differenti. La Virtual Biology Initiative prevede quindi un’attività sistematica di standardizzazione e organizzazione dei dataset, attraverso la collaborazione tra Biohub e NIH e il coordinamento delle nuove campagne sperimentali. Le informazioni dovranno comprendere risposte cellulari a interventi differenti, distribuite su un numero di tipi cellulari e condizioni sperimentali molto più ampio rispetto a quello attualmente studiato. Questa impostazione intende produrre dati che descrivano non soltanto lo stato delle cellule, ma anche il modo in cui tale stato cambia quando il sistema biologico viene perturbato. La disponibilità di misurazioni prima e dopo un intervento costituisce un elemento fondamentale per sviluppare modelli capaci di prevedere le conseguenze delle modificazioni, anziché riconoscere esclusivamente correlazioni statiche.

La raccolta delle informazioni sfrutterà anche tecnologie sperimentali sviluppate da Biohub negli anni precedenti. Tra queste figura la tomografia crioelettronica, o cryo-electron tomography, che consente di osservare strutture cellulari e componenti molecolari conservati in condizioni criogeniche, ottenendo informazioni tridimensionali dettagliate sull’organizzazione interna delle cellule. Il programma comprende inoltre sistemi di microscopia progettati per acquisire immagini di quantità molto elevate di cellule all’interno dei tessuti viventi, con obiettivi di scala che raggiungono milioni o miliardi di elementi osservati. Altre tecnologie riguardano la possibilità di modificare sperimentalmente sistemi biologici a livello molecolare, cellulare, tissutale e dell’organismo completo, così da misurare le risposte prodotte da differenti interventi. La combinazione tra osservazione strutturale, misurazioni molecolari e perturbazioni controllate permette di costruire dataset multimodali che rappresentano proprietà differenti dello stesso sistema biologico. L’intelligenza artificiale potrà utilizzare queste informazioni per collegare caratteristiche della struttura cellulare, espressione dei geni e comportamento osservato, ma la qualità delle previsioni dipenderà dall’accuratezza delle misurazioni e dalla possibilità di integrare informazioni prodotte con strumenti differenti.

L’iniziativa si basa anche sulle infrastrutture pubbliche già sviluppate da Biohub, tra cui CELLxGENE e CryoET Data Portal. CELLxGENE è un ambiente dedicato alla raccolta, organizzazione ed esplorazione di informazioni di genomica a singola cellula, progettato per permettere ai ricercatori di accedere a dataset provenienti da differenti progetti sperimentali. CryoET Data Portal è invece un’infrastruttura destinata alla condivisione di dati ottenuti mediante tomografia crioelettronica, compresi materiali utilizzabili per analisi tridimensionali delle strutture biologiche. L’esperienza acquisita attraverso questi sistemi costituisce una base per il nuovo programma di costruzione dei dataset, che richiederà infrastrutture capaci di conservare informazioni particolarmente eterogenee e di renderle accessibili agli strumenti computazionali. Il progetto prevede la creazione di risorse aperte destinate alla comunità scientifica internazionale, anche se le modalità e i tempi di accesso ai singoli dataset potranno dipendere dagli accordi con i soggetti finanziatori e dalle condizioni previste per le diverse fasi di sviluppo. Secondo le informazioni diffuse in occasione dell’annuncio, alcuni partner commerciali potranno beneficiare di una finestra iniziale di accesso privilegiato prima della pubblicazione generale dei dati. Il principio dichiarato rimane comunque la realizzazione di una base informativa condivisa, utilizzabile da istituzioni di ricerca e sviluppatori di modelli biologici.

Il ruolo del Dipartimento dell’Energia statunitense riguarda soprattutto la combinazione tra infrastrutture di calcolo scientifico, laboratori avanzati e tecnologie di misurazione ad alta capacità. La modellazione biologica richiede infatti non soltanto grandi quantità di dati, ma anche risorse per l’addestramento e la valutazione di modelli in grado di rappresentare fenomeni complessi su scale differenti. I sistemi cellulari comprendono interazioni tra molecole, organelli, cellule e tessuti, con relazioni che possono svilupparsi su intervalli temporali e dimensionali molto diversi. I supercomputer e le infrastrutture di ricerca del DOE possono contribuire alla costruzione di processi nei quali misurazione sperimentale e modellazione computazionale vengono progressivamente integrate. Il contributo dei NIH riguarda invece la disponibilità di patrimoni informativi biomedici accumulati attraverso programmi federali e la possibilità di coordinarne la standardizzazione in funzione degli obiettivi della ricerca predittiva. Google DeepMind e Isomorphic Labs apportano competenze nello sviluppo di modelli di intelligenza artificiale applicati alla scienza e alla scoperta di farmaci, mentre Meta partecipa attraverso l’impegno finanziario e le capacità tecnologiche previste dall’accordo. La collaborazione è stata concepita per affrontare un’attività che richiede competenze e investimenti difficilmente concentrabili all’interno di un singolo laboratorio.

Un elemento distintivo della Virtual Biology Initiative consiste nella volontà di costruire dataset specificamente progettati per l’apprendimento automatico, invece di limitarsi a riutilizzare informazioni raccolte originariamente per rispondere a domande scientifiche differenti. Nel primo caso le procedure sperimentali possono essere organizzate in modo da coprire sistematicamente tipi cellulari, condizioni ambientali e interventi selezionati, producendo informazioni sufficientemente regolari da supportare l’addestramento di modelli predittivi. Nel secondo caso i ricercatori devono invece adattarsi alle differenze presenti nei dati storici, che possono offrire una copertura incompleta di determinati fenomeni. Biohub intende combinare i due approcci, recuperando e standardizzando le informazioni già disponibili e producendo nuove misurazioni attraverso campagne sperimentali coordinate. I modelli derivanti da questi dataset dovranno essere sottoposti a verifiche mediante esperimenti indipendenti, confrontando le previsioni generate dal software con il comportamento effettivamente osservato delle cellule. La capacità di prevedere correttamente condizioni non rappresentate durante l’addestramento costituirà uno degli aspetti fondamentali per stabilire se le rappresentazioni sviluppate possano essere utilizzate nella ricerca su nuove malattie, farmaci e meccanismi biologici.

Le prospettive applicative comprendono la ricerca farmacologica, lo studio delle patologie e l’identificazione di interventi capaci di modificare il comportamento cellulare. Un modello sufficientemente accurato potrebbe essere utilizzato per simulare gli effetti di molecole candidate, individuare relazioni tra processi biologici e selezionare esperimenti con maggiore probabilità di fornire informazioni utili. In ambito oncologico, per esempio, la modellazione delle risposte cellulari potrebbe contribuire allo studio di percorsi molecolari coinvolti nella proliferazione o nella resistenza ai trattamenti, mentre nelle malattie genetiche potrebbe supportare l’analisi delle conseguenze funzionali di specifiche alterazioni. Queste applicazioni rimangono obiettivi scientifici e non costituiscono risultati clinici già dimostrati dal programma. Anche un sistema capace di prevedere accuratamente determinati fenomeni cellulari richiederebbe ulteriori verifiche prima di poter essere utilizzato per formulare decisioni terapeutiche, poiché il comportamento di un organismo umano dipende da interazioni biologiche che superano il livello della singola cellula. La disponibilità di grandi modelli predittivi potrebbe comunque permettere ai laboratori di esaminare digitalmente un numero molto più elevato di ipotesi rispetto a quello realisticamente verificabile attraverso esperimenti fisici, utilizzando successivamente le prove sperimentali per validare e correggere le previsioni.

Il programma prevede un percorso pluriennale di costruzione dei dati e di sviluppo dei modelli. Secondo le indicazioni comunicate in occasione dell’espansione, Biohub punta a rendere disponibile un primo dataset entro circa un anno e a realizzare modelli predittivi funzionali nell’arco di cinque anni. L’obiettivo dichiarato è accelerare attività di ricerca biologica che, seguendo esclusivamente le procedure tradizionali, potrebbero richiedere tempi molto più lunghi. La realizzazione di una cellula virtuale sufficientemente generale costituisce tuttavia una sfida aperta, che richiede ulteriori progressi nelle tecnologie di misurazione, nella comprensione delle interazioni biologiche e nelle architetture computazionali. La quantità di risorse economiche impegnate non permette di prevedere automaticamente il raggiungimento di un determinato livello di accuratezza, né garantisce la possibilità di rappresentare tutti i meccanismi cellulari attraverso un unico modello. La Virtual Biology Initiative introduce invece un’infrastruttura coordinata per produrre informazioni sperimentali su scala molto più ampia, organizzarle in forme accessibili all’intelligenza artificiale e utilizzarle per sviluppare sistemi capaci di formulare previsioni verificabili. Il progetto da 1,8 miliardi di dollari rappresenta quindi un investimento nella costruzione delle basi informative e tecnologiche necessarie alla biologia predittiva, con l’obiettivo di rendere progressivamente più stretta l’integrazione tra osservazione sperimentale, modellazione computazionale e ricerca sulle malattie.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy