Immagine AI

Google ha annunciato l’8 ottobre 2026 la pubblicazione sulla rivista scientifica The Lancet dei risultati di uno studio clinico prospettico dedicato ad AMIE, Articulate Medical Intelligence Explorer, un sistema conversazionale di intelligenza artificiale sviluppato per raccogliere informazioni mediche, formulare ipotesi diagnostiche e supportare la preparazione delle visite. La ricerca è stata condotta in collaborazione con Beth Israel Deaconess Medical Center, o BIDMC, attraverso una sperimentazione svolta in un ambulatorio di assistenza primaria per pazienti con disturbi recenti e non emergenziali. Lo studio rappresenta una delle prime valutazioni prospettiche di un sistema conversazionale diagnostico direttamente utilizzato da pazienti reali prima di un incontro con il medico, in un contesto clinico sottoposto a supervisione. La ricerca aveva già prodotto una prima comunicazione pubblica nel marzo 2026, mentre la pubblicazione dell’8 ottobre introduce il riferimento alla versione sottoposta a revisione scientifica e accettata da The Lancet. L’obiettivo sperimentale non consisteva nel dimostrare che un sistema AI potesse sostituire autonomamente un medico, ma nel verificare se l’interazione preliminare con un agente conversazionale potesse essere svolta in condizioni controllate, raccogliendo informazioni utili all’assistenza e mantenendo livelli di sicurezza accettabili. I risultati riguardano 100 pazienti adulti che hanno completato la conversazione con AMIE, dei quali 98 si sono successivamente presentati alla visita programmata. In tutte le interazioni monitorate non si è verificata alcuna situazione che richiedesse l’interruzione della conversazione secondo i criteri di sicurezza prestabiliti, mentre la diagnosi finale è stata compresa tra le prime sette ipotesi generate dal sistema nel 90% dei casi valutati.

La sperimentazione è stata organizzata come studio prospettico monocentrico, a braccio singolo, con protocollo preregistrato su ClinicalTrials.gov e approvazione da parte del comitato etico competente. I pazienti venivano invitati a partecipare durante la prenotazione di una visita per un nuovo problema clinico episodico, che poteva essere gestito attraverso una consultazione ambulatoriale tradizionale oppure mediante telemedicina. Dopo aver ricevuto le informazioni sullo studio e aver fornito il consenso, i partecipanti potevano accedere a un’interfaccia web protetta e svolgere una conversazione testuale con AMIE prima dell’appuntamento. Il sistema chiedeva informazioni sui sintomi, sulla loro comparsa, sulla storia clinica pertinente e sugli elementi necessari a costruire una valutazione preliminare. Le domande venivano adattate progressivamente in funzione delle risposte ricevute, secondo un processo destinato a ricostruire un’anamnesi strutturata senza limitarsi alla compilazione di un questionario statico. Al termine della conversazione, AMIE produceva una trascrizione e un riepilogo che potevano essere consultati dal medico prima della visita, previo consenso del paziente. La procedura consentiva quindi di separare la raccolta iniziale delle informazioni dal momento della consultazione clinica, lasciando al professionista il compito di verificare i dati, effettuare l’esame fisico quando necessario e formulare le decisioni diagnostiche e terapeutiche.

La sicurezza dell’interazione era garantita attraverso una supervisione umana in tempo reale. Ogni conversazione veniva osservata da un medico di medicina interna abilitato, collegato mediante videochiamata e condivisione dello schermo, che poteva intervenire immediatamente qualora emergessero condizioni potenzialmente problematiche. Il protocollo prevedeva l’interruzione della sessione in presenza di un rischio immediato di danno per il paziente o per altre persone, di un disagio emotivo significativo causato dall’interazione con l’intelligenza artificiale, di una situazione clinicamente pericolosa identificata dal supervisore oppure di una richiesta esplicita del partecipante di interrompere la conversazione. Nessuno di questi criteri ha determinato uno stop durante le interazioni considerate, ma l’assenza di interruzioni non significa che il sistema abbia funzionato senza errori o che sia stato dimostrato sicuro per l’utilizzo autonomo. I supervisori hanno infatti individuato un caso di allucinazione e sono intervenuti per fornire ulteriori chiarimenti clinici in cinque occasioni. Il monitoraggio rappresentava inoltre una componente essenziale della configurazione sperimentale: le prestazioni osservate devono essere interpretate nel contesto di un sistema accompagnato da supervisione medica continua, non come risultato direttamente trasferibile a un’applicazione priva di controlli umani.

La qualità del ragionamento diagnostico è stata valutata confrontando le ipotesi generate da AMIE con le diagnosi finali stabilite attraverso una revisione delle cartelle cliniche effettuata otto settimane dopo ciascun incontro. Questa procedura permetteva di considerare anche le informazioni emerse dopo la visita, comprese eventuali verifiche diagnostiche e successivi approfondimenti. AMIE ha incluso la diagnosi finale tra le prime sette possibilità nel 90% dei casi e tra le prime tre nel 75%, mentre ha identificato la diagnosi corretta come prima ipotesi nel 56% delle valutazioni. I risultati documentano una capacità di produrre diagnosi differenziali sufficientemente ampie da comprendere frequentemente la condizione identificata successivamente dal medico, ma evidenziano anche una differenza importante tra individuare una patologia tra diverse possibilità e riconoscerla immediatamente come spiegazione più probabile. Un sistema che include la diagnosi corretta in una lista di sette ipotesi non ha necessariamente dimostrato di poter formulare autonomamente la decisione clinica appropriata. I ricercatori hanno inoltre esaminato separatamente un sottogruppo di 46 pazienti per i quali la diagnosi finale era stata confermata attraverso esami di laboratorio, test microbiologici, indagini patologiche oppure diagnostica per immagini. In questo sottogruppo l’accuratezza del sistema è rimasta elevata, un elemento utile per distinguere le prestazioni osservate nei casi con conferma oggettiva da quelle relative a diagnosi cliniche presumptive.

La ricerca ha previsto anche una valutazione in cieco delle diagnosi differenziali e dei piani di gestione prodotti da AMIE e dai medici dell’ambulatorio. Per ogni caso, un gruppo di tre valutatori clinici indipendenti esaminava i materiali senza conoscere la provenienza dei risultati e attribuiva punteggi secondo criteri precedentemente definiti. Le valutazioni sono state aggregate utilizzando la mediana dei tre giudizi. Il confronto non ha evidenziato differenze statisticamente significative nella qualità complessiva delle diagnosi differenziali, per le quali è stato riportato un valore p pari a 0,6, né nell’appropriatezza e nella sicurezza dei piani di gestione, con valori p rispettivamente di 0,1 e 1,0. I medici hanno tuttavia ottenuto risultati migliori per la praticabilità concreta dei piani proposti e per il rapporto tra interventi suggeriti e costi, con valori p pari rispettivamente a 0,003 e 0,004. Questi risultati non autorizzano a concludere che AMIE sia clinicamente equivalente ai professionisti in ogni condizione: l’assenza di una differenza statisticamente significativa in alcune misure non costituisce automaticamente una dimostrazione formale di equivalenza o non inferiorità. Le differenze emerse nella praticabilità dei piani di gestione sono particolarmente rilevanti perché riguardano la possibilità di applicare concretamente le indicazioni in un contesto sanitario con risorse, procedure e vincoli organizzativi specifici.

Google ha collegato parte di queste differenze alle informazioni e agli strumenti disponibili durante la sperimentazione. AMIE non poteva accedere direttamente alla cartella clinica elettronica completa del paziente, non disponeva della possibilità di effettuare un esame obiettivo e non riceveva input multimodali capaci di rappresentare elementi visivi della condizione clinica, come aspetto generale, movimenti o segni osservabili. Il medico poteva invece integrare le informazioni raccolte durante il colloquio con i dati clinici già disponibili, l’esperienza maturata nell’ambulatorio e l’osservazione diretta del paziente. Queste differenze possono influenzare la scelta degli accertamenti, la priorità degli interventi e la capacità di costruire un piano proporzionato alle caratteristiche della situazione. L’assenza di accesso alle informazioni cliniche longitudinali limita inoltre la possibilità di considerare sistematicamente patologie pregresse, esami precedenti e trattamenti già eseguiti, qualora non vengano riportati spontaneamente durante la conversazione. Lo studio ha quindi valutato AMIE in una configurazione specifica e non ha misurato le prestazioni di un sistema pienamente integrato nelle cartelle cliniche e negli strumenti diagnostici dell’ambulatorio.

Un’altra componente della valutazione ha riguardato la percezione dei pazienti prima e dopo l’interazione con il sistema. I partecipanti hanno compilato la General Attitudes towards AI Scale, o GAAIS, in tre momenti differenti: prima della conversazione con AMIE, immediatamente dopo e successivamente alla consultazione con il medico. I punteggi hanno mostrato un miglioramento statisticamente significativo dell’atteggiamento nei confronti dell’intelligenza artificiale dopo l’interazione, con un valore p inferiore a 0,001, e il cambiamento si è mantenuto anche dopo la visita. Le risposte qualitative hanno evidenziato valutazioni generalmente favorevoli della capacità del sistema di ascoltare, spiegare le informazioni e mantenere un’interazione rassicurante. Sono comunque emerse perplessità relative alla riservatezza dei dati condivisi, all’onestà del sistema e all’affidabilità delle informazioni ricevute. Tali elementi distinguono la soddisfazione immediata dell’utente dalla fiducia necessaria per introdurre stabilmente tecnologie conversazionali nei percorsi sanitari. In almeno un caso, un medico ha valutato l’interazione come potenzialmente dannosa per il possibile aumento dell’ansia del paziente, dopo che AMIE aveva incluso un linfoma tra le diagnosi considerate. Questa osservazione evidenzia che la produzione di un’ipotesi clinicamente possibile può avere conseguenze emotive differenti in funzione della formulazione e del contesto, anche quando non si verifica un evento classificato come motivo di interruzione secondo i criteri di sicurezza.

I medici che hanno potuto consultare il riepilogo o la trascrizione prima dell’appuntamento hanno fornito indicazioni sull’utilità della preparazione preliminare. La documentazione generata da AMIE è stata esaminata in 44 casi e i professionisti hanno dichiarato che le informazioni li avevano aiutati a preparare la visita nel 75% di queste situazioni. Nel 57% dei casi hanno inoltre riferito che il materiale aveva potenzialmente influenzato il loro approccio clinico. Durante le interviste qualitative, alcuni medici hanno descritto una modifica del processo di consultazione: anziché dedicare una parte consistente del tempo alla raccolta iniziale di informazioni, potevano concentrarsi sulla verifica dei dettagli, sull’approfondimento delle incongruenze e sulla discussione delle decisioni con il paziente. Il risultato documenta un possibile utilizzo del sistema come strumento di preparazione dell’incontro clinico, distinto dall’attribuzione all’intelligenza artificiale della responsabilità diagnostica finale. Le percentuali riportate derivano dalle percezioni dei professionisti coinvolti e non costituiscono una misura diretta della riduzione dei tempi di visita oppure del miglioramento degli esiti clinici.

La ricerca presenta limitazioni legate soprattutto alle dimensioni del campione, all’utilizzo di un unico centro e all’assenza di un gruppo di controllo destinato a confrontare sistematicamente un percorso con AMIE con la normale assistenza senza intelligenza artificiale. La sperimentazione è stata condotta tra aprile e novembre 2025 e ha coinvolto 114 pazienti arruolati, dei quali 100 hanno completato la conversazione e 98 la successiva visita. I partecipanti risultavano mediamente più giovani rispetto alla popolazione complessiva delle 1.452 visite urgenti registrate dall’ambulatorio durante il periodo di osservazione, un elemento che potrebbe influenzare la trasferibilità dei risultati a gruppi con caratteristiche differenti. L’interfaccia esclusivamente testuale e la supervisione continua rappresentano ulteriori condizioni specifiche della sperimentazione. Lo studio è stato finanziato da Alphabet e comprende ricercatori appartenenti a Google e BIDMC, con dichiarazioni relative ai rapporti professionali dei partecipanti alla ricerca. La pubblicazione su The Lancet rappresenta un passaggio nella valutazione scientifica delle capacità di AMIE, ma i risultati non dimostrano ancora una riduzione dei costi sanitari, un miglioramento degli esiti dei pazienti o una sicurezza equivalente in assenza di supervisione. Google e i ricercatori coinvolti prevedono ulteriori studi su popolazioni più estese, con confronti controllati e valutazioni orientate a misurare il contributo reale dei sistemi conversazionali ai processi di assistenza primaria.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy