OpenAI ha presentato MentalHealthBench, un nuovo benchmark aperto progettato per misurare come i sistemi di intelligenza artificiale rispondono a conversazioni realistiche legate alla salute mentale, includendo non soltanto situazioni di emergenza ma anche problemi quotidiani, disagio emotivo, richieste di supporto, interazioni con adolescenti e conversazioni rivolte da caregiver o professionisti. Il benchmark comprende 1.215 conversazioni sintetiche costruite per riflettere modalità d’uso reali dell’AI in questo ambito ed è stato sviluppato con il contributo di oltre 80 psicologi e psichiatri abilitati provenienti da 22 Paesi, capaci complessivamente di operare in 19 lingue e rappresentativi di quasi 20 sottospecializzazioni della salute mentale. Ogni conversazione è associata a criteri di valutazione scritti dagli esperti, per un totale di 5.262 criteri, con l’obiettivo di misurare aspetti molto specifici della risposta del modello anziché limitarsi a verificare se il sistema evita comportamenti pericolosi. OpenAI ha scelto di rendere MentalHealthBench disponibile pubblicamente affinché altri gruppi di ricerca possano esaminarne la metodologia, ripetere le valutazioni e sviluppare nuovi test partendo dalla stessa base. Il progetto nasce anche dalla constatazione che gran parte dei benchmark esistenti sulla salute mentale si concentra sulle crisi più gravi e utilizza criteri generali predefiniti, mentre resta molto meno studiato il comportamento dei modelli nell’intero spettro delle conversazioni che possono riguardare benessere, stress, relazioni personali, disagio crescente e situazioni che richiedono invece un intervento urgente nel mondo reale. OpenAI ribadisce inoltre che ChatGPT, utilizzato secondo l’azienda da oltre un miliardo di persone ogni settimana, non sostituisce terapia, assistenza clinica o supporto professionale.
La struttura di MentalHealthBench è stata costruita per rappresentare differenti livelli di gravità, profili di utenti, lingue e contesti culturali. Le conversazioni non acute costituiscono il 53,5% del dataset, quelle ad alta gravità ma non immediatamente emergenziali il 18,2% e le situazioni considerate di emergenza il 28,3%. Per quanto riguarda i profili, il 68,1% degli scenari riguarda adulti, il 21,2% adolescenti, il 5,8% professionisti clinici e il 4,9% caregiver. Le conversazioni sono state generate attraverso tecniche orientate alla tutela della privacy e descritte come simili a quelle utilizzate nel sistema Clio, cercando di riprodurre pattern realistici d’impiego di ChatGPT per questioni legate alla salute mentale senza utilizzare direttamente conversazioni personali degli utenti. In 70 casi, pari al 5,8% del benchmark, viene fornito anche un contesto precedente rilevante, per esempio un lutto recente, in modo da verificare se il modello utilizza correttamente informazioni già disponibili anziché rispondere soltanto all’ultimo messaggio. Il dataset comprende inoltre 105 conversazioni in spagnolo, 54 in hindi, 34 in arabo e 29 in portoghese, oltre a esempi in tedesco, italiano, persiano, indonesiano, turco e cinese. Gli esperti hanno valutato gli scenari nella lingua e nel contesto culturale originali e sono stati remunerati per il lavoro svolto. Ogni conversazione è stata esaminata da almeno tre professionisti attraverso un processo in più fasi: due clinici hanno prodotto indipendentemente i criteri ponderati, un terzo esperto li ha successivamente revisionati e affinati e sono stati mantenuti soltanto quelli condivisi da almeno due valutatori e non contraddetti dal terzo. Per gli scenari che coinvolgono adolescenti, un sottoinsieme di 30 clinici con esperienza attuale o recente nella cura di pazienti con meno di 18 anni ha curato specificamente l’annotazione degli esempi.
Il sistema di scoring assegna a ogni criterio un peso compreso tra -10 e +10: i valori positivi premiano comportamenti considerati utili, mentre quelli negativi penalizzano comportamenti potenzialmente dannosi, con valori assoluti più elevati riservati agli elementi ritenuti clinicamente più importanti nello specifico contesto. I criteri sono molto granulari e possono riguardare, per esempio, la capacità del modello di chiedere quale tipo di aiuto sarebbe utile, raccogliere informazioni prima di formulare conclusioni, riconoscere quanto dichiarato dall’utente senza attribuirgli emozioni non espresse, preservarne l’autonomia decisionale oppure evitare di presentare come certe interpretazioni che non trovano riscontro nella conversazione. Le risposte dei modelli vengono poi valutate automaticamente da GPT-5.6 Sol utilizzato con livello di ragionamento elevato, confrontando ogni risposta con i criteri scritti dagli specialisti. Per ogni task vengono generate quattro risposte indipendenti e i risultati sono calcolati attraverso il cosiddetto task-clipped rubric score; il punteggio può inoltre essere scomposto lungo dieci dimensioni comportamentali definite dagli esperti, tra cui ricerca del contesto, empatia, calibrazione dell’urgenza e reality testing. Nei test con adolescenti l’età compresa tra 13 e 17 anni è stata comunicata al modello attraverso il system message, una soluzione scelta per rendere la prova applicabile anche a modelli di fornitori differenti, pur con la precisazione che questo approccio potrebbe non riflettere completamente le protezioni implementate nei singoli prodotti commerciali. L’obiettivo non è quindi verificare semplicemente se una risposta appare rassicurante o prudente, ma misurare se il modello comprende correttamente il tipo di situazione, raccoglie il contesto necessario, evita inferenze arbitrarie, mantiene una risposta proporzionata e indirizza verso supporto reale quando questo diventa necessario.
Nei risultati pubblicati, GPT-6 Astra ha ottenuto il punteggio complessivo più alto con il 57,3%, seguito da GPT-6 Sol con il 53,9%, Claude Opus 5.5 con il 52,4% e GPT-6 Luna con il 50,2%. Modelli precedenti hanno registrato risultati sensibilmente inferiori: GPT-4o nella versione di marzo 2025 ha raggiunto il 32,1%, mentre Gemini 2.5 Pro si è fermato al 29,5%; le misurazioni sono accompagnate da intervalli di confidenza del 95%. Analizzando separatamente alcuni sottoinsiemi, GPT-6 Astra ha raggiunto il 58,3% nelle conversazioni emergenziali, mentre Claude Opus 5.5 ha ottenuto il 57% negli scenari con adolescenti. I risultati vengono interpretati dai ricercatori come indicazione di un miglioramento progressivo tra le generazioni di modelli, ma mostrano ancora margini consistenti soprattutto nella capacità di cercare il contesto appropriato e nel calibrare correttamente il livello di urgenza. È emerso in particolare un compromesso tra comportamento prudenziale nelle emergenze e risposta proporzionata nelle situazioni non acute: aumentare la sensibilità verso possibili condizioni critiche può infatti portare il modello a reagire con un livello di allarme eccessivo in conversazioni meno gravi, mentre ridurre questa tendenza rischia di penalizzare le situazioni realmente urgenti. Per fornire due riferimenti interpretativi ai punteggi, risposte prodotte disponendo direttamente delle rubriche di valutazione hanno ottenuto il 99%, risultato utilizzato come controllo del limite superiore del sistema di scoring, mentre risposte scritte direttamente da clinici hanno raggiunto il 38,5%. Quest’ultimo dato non viene presentato come indicatore della qualità professionale dei clinici, ma viene spiegato soprattutto con il fatto che gli specialisti tendevano a rispondere come durante una conversazione reale in presenza, utilizzando interventi molto brevi, spesso limitati a una singola domanda o osservazione, mentre il benchmark premia la presenza esplicita di numerosi comportamenti desiderabili all’interno della stessa risposta.
Accanto alla valutazione clinica, è stata condotta anche un’analisi separata con 44 adulti provenienti da 16 Paesi e parlanti complessivamente 14 lingue, tutti con esperienza precedente nell’utilizzo di sistemi AI per supporto emotivo o questioni di salute mentale. Questi partecipanti hanno valutato le risposte dei modelli e formulato propri criteri su ciò che consideravano utile, ma sono stati esposti soltanto a conversazioni non acute per evitare di sottoporli a contenuti potenzialmente disturbanti; le loro valutazioni non sono inoltre confluite nel punteggio ufficiale di MentalHealthBench, che rimane basato sul consenso degli esperti. Confrontando le due prospettive, le rubriche degli utenti e quelle dei clinici coincidevano per il 25,7% del peso complessivo dei criteri e risultavano direttamente in contrasto soltanto per l’1%. Gli utenti attribuivano maggiore importanza soprattutto al tono della risposta e alla presenza di indicazioni pratiche immediatamente utilizzabili, mentre gli specialisti sottolineavano maggiormente la necessità di raccogliere informazioni, comprendere il contesto e interpretare con cautela situazioni ambigue. MentalHealthBench viene per questo presentato come strumento diagnostico e verificabile per studiare punti di forza e debolezza dei modelli e non come classifica definitiva della loro capacità di affrontare conversazioni personali. Anche i confronti tra lingue vengono considerati descrittivi, perché le differenze osservate non consentono di separare completamente gli effetti linguistici da fattori come tipo di problema, gravità, cultura o profilo dell’utente. Il dataset può essere scaricato e ogni esempio contiene identificativo, conversazione, rubriche, livello di gravità, profilo dell’utente, lingua e presenza di eventuale contesto precedente; tutti gli esempi includono inoltre una specifica canary string e OpenAI chiede che le conversazioni non vengano ripubblicate integralmente online sotto forma di testo o immagini, così da ridurre il rischio che finiscano nei dataset di addestramento dei modelli futuri e compromettano l’affidabilità del benchmark. L’iniziativa si inserisce infine in un programma più ampio che comprende finanziamenti per nuove ricerche sull’AI applicata alla salute mentale, attività con Partnership on AI, supporto a valutazioni indipendenti come quella sviluppata da Transluce, risorse di crisi localizzate in ChatGPT, Trusted Contact e protezioni specifiche previste per ChatGPT for Teens.
Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)
