La presenza automatica della data corrente nei prompt di sistema dei modelli linguistici può modificare significativamente i risultati dei test utilizzati per valutarne le prestazioni, anche quando le domande, i parametri di esecuzione e le configurazioni rimangono identici. È quanto emerge dalla ricerca “Dating the Model: Hidden Dates in System Prompts Affect LLM Evaluation”, condotta da Mario Sanz-Guerrero, Minh Duc Bui, Manuel Mager e Katharina von der Wense, ricercatori affiliati alla Johannes Gutenberg University Mainz, all’Universidad Iberoamericana in Messico e alla University of Colorado Boulder. Lo studio ha analizzato nove modelli linguistici attraverso sei dataset di valutazione e quattro categorie di attività, individuando variazioni delle prestazioni riconducibili esclusivamente alla modifica della data inserita nelle istruzioni di sistema. Le differenze raggiungono circa il 6% nei test a risposta multipla, il 14% nei problemi di ragionamento matematico e il 7% nella generazione di codice, mentre nelle attività di traduzione automatica sono state rilevate oscillazioni fino a 2,84 punti BLEU. L’effetto risulta sufficientemente ampio da modificare la posizione relativa dei modelli nelle classifiche comparative, rendendo possibile che un sistema ottenga risultati migliori o peggiori semplicemente perché è stato valutato in una giornata differente, senza che siano intervenuti aggiornamenti ai pesi del modello o modifiche alle sue effettive capacità.
Il problema riguarda una componente dell’architettura operativa dei sistemi di intelligenza artificiale generalmente invisibile agli utenti: il system prompt, ossia l’insieme delle istruzioni che definiscono il comportamento generale del modello, le priorità operative e il contesto nel quale deve elaborare le richieste. Molti servizi commerciali inseriscono automaticamente informazioni temporali in questo livello di istruzioni, permettendo al sistema di conoscere la data corrente anche quando l’utente non la comunica esplicitamente. Tale informazione può essere aggiunta direttamente dall’infrastruttura del fornitore, senza comparire nel prompt accessibile attraverso l’interfaccia o le API. La data diventa quindi una variabile dinamica che cambia quotidianamente e che può condizionare l’elaborazione delle risposte. Il fenomeno si aggiunge ad altre cause di variabilità già documentate nelle valutazioni dei modelli linguistici, comprese le differenze nell’hardware utilizzato, nella precisione numerica delle operazioni, nella dimensione dei batch di inferenza, nell’ordine delle opzioni nelle domande a scelta multipla e nella formulazione delle istruzioni. A differenza di molti di questi parametri, che possono essere registrati o controllati durante un esperimento, la data introdotta automaticamente dal fornitore può rimanere sconosciuta a chi esegue il benchmark, compromettendo la possibilità di riprodurre esattamente le condizioni della valutazione.
Per isolare questa variabile, i ricercatori hanno costruito un protocollo sperimentale nel quale il contenuto delle domande e la configurazione dei modelli rimanevano invariati, modificando esclusivamente la data riportata nel prompt di sistema. Sono state considerate tutte le date comprese tra il 1° gennaio e il 31 dicembre 2024, ripetendo le valutazioni per osservare l’andamento dei risultati durante l’intero anno. I nove modelli selezionati appartengono a famiglie differenti e coprono un ampio intervallo di dimensioni: Llama 3.1 Instruct nelle versioni da 8 e 70 miliardi di parametri, Gemma 3 Instruct da 4 e 27 miliardi, Qwen3 da 4 miliardi, Qwen3-Next da 80 miliardi, Phi-4 da 14 miliardi e GPT-OSS nelle configurazioni da 20 e 120 miliardi di parametri. L’inclusione di architetture e dimensioni differenti ha consentito di verificare se la sensibilità alla data fosse una caratteristica limitata ai modelli più piccoli oppure una proprietà riscontrabile anche nei sistemi con maggiore capacità computazionale. I risultati hanno confermato la presenza del fenomeno in tutte le famiglie esaminate, senza individuare una relazione generale secondo cui l’aumento del numero di parametri garantisca una maggiore stabilità.
La valutazione è stata articolata utilizzando i benchmark MMLU, GPQA e ARC-Challenge per le domande a scelta multipla, GSM8K per il ragionamento matematico, HumanEval per la generazione di programmi Python e i dataset WMT per la traduzione dall’inglese verso tedesco, finlandese e ceco. I ricercatori hanno escluso le domande il cui contenuto dipendesse effettivamente dal periodo temporale, evitando che una variazione della data potesse rappresentare un’informazione legittimamente necessaria per formulare la risposta. Nei test a scelta multipla la valutazione è stata effettuata attraverso le probabilità attribuite ai token corrispondenti alle risposte, mentre per i problemi matematici è stata verificata la correttezza del risultato numerico finale. HumanEval ha consentito di sottoporre il codice generato a test eseguibili, misurando attraverso la metrica pass@1 la quota di soluzioni corrette al primo tentativo. Le traduzioni sono state invece valutate utilizzando BLEU e chrF, metriche che confrontano il testo prodotto con traduzioni di riferimento. Questa combinazione di metodi ha permesso di verificare l’influenza della data non soltanto nelle risposte brevi, ma anche nella generazione di sequenze articolate, nei programmi informatici e nei testi linguistici completi.
Le differenze più contenute, pur rimanendo significative, sono state rilevate nei benchmark a scelta multipla. Considerando la distanza fra il risultato peggiore e quello migliore ottenuto modificando la data, le oscillazioni medie sono state pari a 2,30 punti percentuali su MMLU, 3,80 su GPQA e 1,46 su ARC-Challenge, con una media complessiva di 2,52 punti percentuali. GPT-OSS da 120 miliardi di parametri ha mostrato una variazione di 6,06 punti percentuali su GPQA, mentre la versione da 20 miliardi ha registrato una differenza di 4,55 punti sul medesimo benchmark. Anche Llama 3.1 da 8 miliardi ha raggiunto una variazione di 4,53 punti su GPQA. La ricerca ha inoltre misurato la calibrazione dei modelli mediante l’Expected Calibration Error, o ECE, che quantifica la distanza tra il livello di confidenza espresso dal sistema e la frequenza effettiva delle risposte corrette. Le variazioni hanno interessato entrambe le dimensioni, dimostrando che la data può modificare non soltanto l’accuratezza delle risposte, ma anche la corrispondenza tra la sicurezza attribuita dal modello alle proprie previsioni e la loro effettiva correttezza.
Le conseguenze diventano particolarmente evidenti nel ragionamento matematico, dove il modello deve generare una sequenza di passaggi prima di arrivare al risultato numerico. Sul benchmark GSM8K la distanza media tra le prestazioni migliori e peggiori rilevate per le diverse date è stata di 7,75 punti percentuali. GPT-OSS da 120 miliardi di parametri ha registrato una variazione di 14,42 punti, mentre la versione da 20 miliardi ha raggiunto 12,88 punti. Llama 3.1 da 8 miliardi ha mostrato una differenza di 9,85 punti, Gemma 3 da 4 miliardi di 8,33 punti e Llama 3.1 da 70 miliardi di 7,58 punti. Questi risultati indicano che la sensibilità alle informazioni temporali tende ad aumentare nelle attività che richiedono una generazione autoregressiva più estesa, nella quale ogni nuovo token viene prodotto considerando anche quelli precedentemente generati. Una variazione iniziale nella distribuzione delle probabilità può quindi influenzare la scelta dei primi passaggi, propagandosi lungo l’intera sequenza e conducendo a un risultato conclusivo differente, benché il problema matematico e tutte le altre condizioni sperimentali siano rimasti invariati.
Un comportamento analogo è stato osservato nella generazione di codice attraverso HumanEval, dove la variabilità non può essere attribuita esclusivamente a differenze stilistiche nelle risposte. In questo caso il programma Python generato deve superare specifici test funzionali e la correttezza viene quindi stabilita attraverso l’esecuzione del codice. La variazione media della metrica pass@1 è risultata pari a 4,81 punti percentuali, con oscillazioni massime di 7,32 punti per Llama 3.1 da 8 miliardi e GPT-OSS da 20 miliardi. Gemma 3 da 4 miliardi ha raggiunto 6,71 punti, valore registrato anche da GPT-OSS da 120 miliardi. Il cambiamento della sola data può pertanto determinare se una funzione generata automaticamente superi oppure non superi i test previsti, senza che siano state modificate le specifiche del problema. Nelle attività di traduzione automatica il fenomeno è stato confermato attraverso differenze nelle metriche BLEU e chrF. Le oscillazioni medie hanno raggiunto 1,59 punti BLEU per l’inglese-tedesco, 1,53 per l’inglese-finlandese e 1,88 per l’inglese-ceco, con una variazione massima di 2,84 punti BLEU per GPT-OSS da 120 miliardi nella traduzione verso il ceco. Si tratta di differenze rilevanti per una categoria di valutazioni nella quale miglioramenti anche inferiori a un punto BLEU possono essere utilizzati per confrontare sistemi differenti.
La modifica della data ha prodotto inoltre cambiamenti nell’ordine dei modelli nelle classifiche. Una simulazione sul benchmark MMLU ha mostrato che, utilizzando come data il 26 giugno 2024, Qwen3-Next da 80 miliardi occupava la prima posizione tra i cinque sistemi considerati, seguito da GPT-OSS da 120 miliardi, GPT-OSS da 20 miliardi, Phi-4 da 14 miliardi e Llama 3.1 da 70 miliardi. Spostando la data al 27 giugno, senza modificare le domande o la configurazione sperimentale, GPT-OSS da 120 miliardi è passato al primo posto, seguito da Qwen3-Next, mentre Llama 3.1 da 70 miliardi è salito in terza posizione. La variazione delle classifiche rappresenta una conseguenza diretta della diversa sensibilità dei modelli alle informazioni temporali, perché la stessa data non produce necessariamente un miglioramento o un peggioramento uniforme per tutti i sistemi. Le prove statistiche condotte sulle combinazioni tra modelli e dataset non hanno infatti individuato una tendenza generale che associ il progresso del calendario a un aumento o a una diminuzione dell’accuratezza. La correlazione mediana tra data e prestazioni è risultata prossima allo zero, pari a 0,02, mentre la probabilità che due valutazioni si muovessero nella medesima direzione è stata vicina al 51%, sostanzialmente compatibile con un comportamento casuale.
La sensibilità alle date non è limitata ai modelli con pesi aperti. Un’ulteriore verifica ha coinvolto GPT-5.1, nella versione identificata dal checkpoint gpt-5.1-2025-11-13, attraverso test effettuati tra il 3 e il 9 dicembre 2025. In questo esperimento i ricercatori hanno lasciato vuoto il prompt di sistema controllabile dall’utente, impostato la temperatura a zero e disabilitato il ragionamento, evitando inoltre l’utilizzo di strumenti esterni e dell’accesso al web. Il modello era comunque in grado di riconoscere la data corrente, confermando che l’informazione veniva inserita nell’ambiente operativo dal fornitore. Nei tre benchmark a scelta multipla MMLU, GPQA e ARC-Challenge sono state riscontrate oscillazioni giornaliere dell’accuratezza, con una differenza massima di circa quattro punti percentuali su GPQA. Ogni combinazione tra data e dataset è stata eseguita due volte, ottenendo risultati identici nelle 42 esecuzioni complessive. La ripetibilità dei risultati a data fissa e la loro variazione al cambiamento del giorno rafforzano l’interpretazione secondo cui la componente temporale costituisca una variabile effettiva del contesto di inferenza, indipendentemente dalla temperatura impostata e dalla stabilità delle altre condizioni.
I ricercatori hanno verificato anche se alcune tecniche comunemente utilizzate nella progettazione dei prompt potessero ridurre il fenomeno. La prima prova ha riguardato il chain-of-thought prompting, una modalità che induce il modello a sviluppare esplicitamente passaggi intermedi di ragionamento prima di produrre la risposta. L’esperimento, effettuato su Llama 3.1 da 8 miliardi di parametri utilizzando MMLU e tutte le date del 2024, ha prodotto un risultato opposto rispetto a quello ipotizzato: anziché attenuare la sensibilità al contesto temporale, il ragionamento articolato l’ha amplificata. La data ha influenzato la selezione dei token iniziali della sequenza e queste variazioni si sono propagate nei passaggi successivi, conducendo a percorsi di elaborazione e risposte finali differenti. È stata sperimentata anche una configurazione few-shot, nella quale il modello riceve cinque esempi prima di affrontare il compito richiesto. Questa tecnica ha ridotto soltanto marginalmente la variabilità media nei test a scelta multipla, portandola da 2,52 a 2,27 punti percentuali, senza eliminare il problema. La disponibilità di esempi aggiuntivi, quindi, non è risultata sufficiente a neutralizzare l’influenza delle informazioni temporali presenti nelle istruzioni di sistema.
Un’ulteriore parte della sperimentazione ha confrontato l’impatto della data con altre condizioni tecniche che possono influenzare la riproducibilità dei benchmark. Utilizzando Llama 3.1 da 8 miliardi su MMLU, sono state esaminate configurazioni con batch di inferenza compresi tra 1 e 128, precisioni numeriche BF16, FP16 e FP32, acceleratori NVIDIA A100, A40 e RTX 4090, differenti ordinamenti delle risposte e sei formulazioni alternative delle istruzioni di sistema. Per rendere confrontabili le varie condizioni è stato impiegato il coefficiente di variazione dell’accuratezza, calcolato rapportando la deviazione standard alla media. Il cambiamento della data ha prodotto un coefficiente dello 0,78%, superiore ai valori riscontrati modificando la dimensione del batch, pari allo 0,61%, la precisione numerica, pari allo 0,52%, e il modello di GPU, pari allo 0,48%. L’ordine delle risposte ha generato una variabilità dello 0,75%, mentre la modifica intenzionale della formulazione del system prompt ha raggiunto lo 0,78%, esattamente il valore osservato per la data. Quest’ultima si comporta quindi, in termini di influenza sulle prestazioni, in maniera paragonabile a una modifica deliberata delle istruzioni attraverso tecniche di prompt engineering, con la differenza che il cambiamento avviene automaticamente e può non essere documentato.
Una possibile spiegazione riguarda il modo in cui i modelli apprendono a interpretare le istruzioni di sistema durante le fasi di addestramento e successivo allineamento. Le procedure di supervised fine-tuning e reinforcement learning from human feedback possono abituare il modello a specifiche strutture e formulazioni dei prompt, rendendone il comportamento sensibile anche a modifiche apparentemente secondarie. La data inserita automaticamente rappresenterebbe quindi una variazione del contesto testuale capace di alterare la distribuzione delle probabilità sui token successivi, con effetti che possono amplificarsi soprattutto nei compiti di generazione più lunghi. Questa interpretazione rimane un’ipotesi sul meccanismo alla base del fenomeno, ma è coerente con i risultati ottenuti modificando deliberatamente le istruzioni di sistema. La ricerca non identifica inoltre una data universalmente favorevole o sfavorevole: l’effetto dipende dal modello, dal dataset e dall’attività, rendendo impraticabile l’individuazione di un singolo giorno che garantisca prestazioni superiori o risultati automaticamente confrontabili.
Le indicazioni operative riguardano soprattutto la costruzione dei protocolli di valutazione. Quando possibile, i ricercatori propongono di eliminare la data corrente dal template delle istruzioni di sistema, mantenendo inalterate le altre componenti. Nei casi in cui la data non possa essere rimossa, suggeriscono di utilizzare un valore temporale fisso e di documentarlo insieme ai risultati, in modo che valutazioni successive possano essere riprodotte nelle medesime condizioni. Questa procedura richiede particolare attenzione per i modelli commerciali accessibili esclusivamente attraverso API, dove una parte delle istruzioni può essere gestita dal fornitore e sottratta al controllo dell’utilizzatore. La ricerca presenta comunque alcuni limiti: i test riguardano un insieme selezionato di modelli e benchmark, la verifica sul modello proprietario GPT-5.1 copre soltanto una settimana e l’inserimento delle date è stato sperimentato prevalentemente utilizzando un formato e una posizione prestabiliti nel prompt. Restano da approfondire gli effetti di differenti formati temporali, altre collocazioni delle informazioni nel contesto e ulteriori categorie di attività, come la conversazione libera e la sintesi documentale. I risultati dimostrano tuttavia che una variabile apparentemente marginale, introdotta automaticamente nell’infrastruttura di inferenza, può modificare in misura rilevante le valutazioni dei modelli linguistici, fino ad alterare confronti e graduatorie costruiti su benchmark comunemente utilizzati nella ricerca sull’intelligenza artificiale.
Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)
