Anthropic ha presentato un nuovo gruppo di ricerca e un laboratorio dedicati alle scienze della vita, creati nella primavera del 2026 per verificare se modelli di intelligenza artificiale generalisti possano contribuire in modo sistematico alla scoperta biologica attraverso l’analisi di grandi quantità di sequenze di DNA, la generazione di ipotesi e la successiva verifica sperimentale. Uno dei primi risultati ottenuti dal gruppo riguarda l’identificazione, da parte di Claude, di un sistema enzimatico precedentemente non caratterizzato associato a una struttura di ripetizioni del DNA che presenta analogie con gli array CRISPR. L’obiettivo del nuovo laboratorio è integrare agenti AI e ricercatori umani lungo l’intero processo scientifico: Claude analizza database genomici, individua famiglie di proteine non caratterizzate, formula ipotesi e seleziona candidati potenzialmente interessanti, mentre gli esperimenti fisici vengono eseguiti da scienziati umani. Il team riunisce ricercatori con esperienza nell’analisi computazionale del DNA, nell’evoluzione e regolazione dei sistemi CRISPR, nella scoperta di nuovi enzimi per terapie cellulari e geniche e nello sviluppo di strumenti per individuare anomalie genomiche, comprese varianti umane patogene. Il laboratorio opera nella Bay Area esclusivamente ai livelli di biosicurezza BSL-1 e BSL-2 e non utilizza patogeni capaci di infettare l’uomo; tutte le attività sperimentali di laboratorio restano affidate a persone, mentre Claude viene impiegato principalmente nelle fasi di analisi, generazione delle ipotesi e interpretazione dei dati.
La scoperta è iniziata con un’istruzione relativamente generale: cercare all’interno di un enorme database di sequenze di DNA esempi interessanti di trascrittasi inverse, o RT, enzimi in grado di copiare RNA in DNA. Il lavoro computazionale è stato affidato a circa 950 agenti Claude che hanno operato per 21 ore consumando complessivamente circa 210 milioni di token. Durante la campagna gli agenti hanno raccolto più di 200.000 trascrittasi inverse, identificato circa 3.500 sistemi candidati precedentemente non caratterizzati e ridotto progressivamente il numero fino a selezionare i 20 casi ritenuti più interessanti, per i quali sono stati prodotti rapporti leggibili dai ricercatori. Anthropic stima che un’analisi di questo tipo possa richiedere a uno scienziato esperto da diverse settimane a diversi mesi. Uno degli agenti ha individuato una famiglia insolita di RT e, analizzando direttamente la sequenza di DNA circostante, ha rilevato una lunga struttura di ripetizioni in tandem collocata accanto al gene della trascrittasi inversa. L’agente ha quindi contato le ripetizioni, misurato la loro distanza reciproca, confrontato l’architettura genomica con i sistemi RT già conosciuti e verificato nella letteratura scientifica se una configurazione simile fosse già stata descritta. Dopo questa fase ha prodotto un rapporto per la revisione umana, e le successive analisi computazionali ed esperimentali hanno portato il gruppo a identificare un sistema biologico non ancora caratterizzato, localizzato principalmente nei batteriofagi, i virus che infettano i batteri. Il sistema è stato denominato ART, acronimo di array-associated reverse transcriptases.
ART è formato da tre componenti principali: una trascrittasi inversa, un gene partner adiacente e un lungo array costituito da sequenze di DNA ripetute e regolarmente spaziate. È proprio questa struttura a ricordare un array CRISPR, nel quale le sequenze ripetute e gli elementi intermedi vengono trascritti in RNA e consentono ai sistemi CRISPR-Cas di riconoscere bersagli differenti. La trascrittasi inversa alla base del sistema ART, localizzata in un jumbo phage, era già stata identificata in studi precedenti, ma Claude sembra essere stato il primo a collegarla alle altre caratteristiche distintive presenti nello stesso locus genomico: l’array di sequenze di DNA non codificante e una proteina accessoria aggiuntiva la cui funzione rimane sconosciuta. Anthropic sottolinea che combinazioni di caratteristiche analoghe sono state osservate finora soltanto in un numero ristretto di altri sistemi biologici, tutti accomunati dalla possibilità di essere programmabili e di svolgere operazioni sul DNA come taglio, copia o inserimento di sequenze. Questo non significa tuttavia che ART sia già stato dimostrato come nuovo sistema di gene editing: la sua funzione biologica primaria rimane sconosciuta e sono ancora in corso esperimenti per comprenderne il meccanismo. I primi risultati sperimentali mostrano però che l’array ART viene effettivamente espresso come una serie di piccoli RNA distinti, elemento che rafforza l’interesse verso una possibile organizzazione funzionale analoga, almeno a livello strutturale, a quella osservata nei sistemi CRISPR. Feng Zhang, professore al MIT e al Broad Institute e tra i pionieri dell’editing genomico CRISPR, dopo aver esaminato il preprint ha definito particolarmente interessante l’identificazione di array di RNA ripetuti associati alle trascrittasi inverse e ha indicato il sistema come meritevole di ulteriori studi.
Il metodo adottato dal nuovo gruppo di ricerca prevede generalmente che Claude inizi analizzando una determinata famiglia proteica, consulti la letteratura scientifica disponibile e provi innanzitutto a riprodurre risultati già noti utilizzando dati pubblici, così da verificare la correttezza delle procedure impiegate. Successivamente il modello ricerca proteine appartenenti alla stessa famiglia o geni collocati nelle loro vicinanze che non corrispondono ad alcun sistema biologico descritto, producendo per ciascun candidato un breve rapporto che propone una possibile funzione e riassume le evidenze disponibili. In una fase successiva Claude rivaluta criticamente le proprie ipotesi e scarta la maggior parte dei candidati; alcune campagne possono concludersi senza alcun risultato da testare, mentre altre producono uno o pochi sistemi sufficientemente interessanti da passare alla sperimentazione. Quando un candidato supera la revisione dei ricercatori, la relativa proteina viene espressa in ceppi standard di laboratorio e caratterizzata attraverso analisi biochimiche e strutturali, con Claude utilizzato nuovamente per aiutare nell’interpretazione dei risultati. Il team lavora principalmente tramite Claude Science e Claude Code, gli stessi strumenti messi a disposizione degli altri ricercatori, affiancandoli in alcuni casi a un proprio sistema di orchestrazione capace di coordinare numerose sessioni Claude eseguite parallelamente. La quantità di ipotesi generate è diventata a sua volta oggetto di studio: una singola campagna può produrre centinaia o migliaia di report candidati e il gruppo analizza quali caratteristiche distinguano le proposte considerate scientificamente promettenti da quelle successivamente scartate, utilizzando queste informazioni per migliorare le istruzioni date al modello e riprodurre in modo più accurato i criteri di selezione degli scienziati.
La ricerca su ART rappresenta quindi uno dei primi casi in cui Anthropic utilizza un sistema multi-agente su larga scala per effettuare genome mining con un coinvolgimento umano relativamente limitato nelle fasi iniziali: gli scienziati hanno definito il problema generale e successivamente eseguito le verifiche di laboratorio, mentre gli agenti hanno esplorato le famiglie di trascrittasi inverse, selezionato autonomamente i candidati e deciso quali anomalie approfondire. La società ha pubblicato sia un preprint sia un rapporto tecnico per permettere alla comunità scientifica di esaminare i dati e seguire l’ulteriore caratterizzazione del sistema, precisando che le proprietà funzionali di ART devono ancora essere determinate sperimentalmente. Il nuovo laboratorio fa parte dell’organizzazione Life Sciences di Anthropic insieme ai gruppi che lavorano sulla scoperta di farmaci e sull’addestramento di Claude in biologia e chimica, e l’azienda intende estendere questo metodo di generazione automatizzata di ipotesi ad altri problemi di genomica e ad ulteriori ambiti scientifici. L’interesse del risultato non riguarda quindi soltanto il possibile ruolo biologico di ART, ancora da chiarire, ma anche il processo che ha portato alla sua individuazione: un insieme di centinaia di agenti AI ha analizzato su larga scala sequenze genomiche, filtrato centinaia di migliaia di proteine e individuato autonomamente una combinazione di caratteristiche biologiche che non era stata precedentemente descritta come un unico sistema.
Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)
