IBM ha rilasciato Granite Time Series PatchTST-FM-r2, un foundation model da circa 385 milioni di parametri progettato per effettuare previsioni zero-shot su serie temporali, cioè generare forecast su nuovi dataset senza richiedere fine-tuning o addestramento specifico per ciascuna attività. Il modello rappresenta l’evoluzione di PatchTST-FM-r1 all’interno della famiglia Granite Time Series e introduce una nuova architettura, un corpus di pretraining più ampio, forecasting probabilistico e supporto per l’imputazione dei valori mancanti. IBM ha pubblicato insieme al modello i pesi, l’architettura, la pipeline di inferenza e il codice necessario per riprodurre i risultati dei benchmark.
PatchTST-FM-r2 è destinato a serie temporali regolarmente campionate e può essere applicato a scenari come previsione della domanda, prezzi, consumi energetici, traffico e telemetria. La caratteristica zero-shot permette di utilizzare un unico modello preaddestrato su serie che non facevano parte del training senza costruire e mantenere un modello dedicato per ogni dataset. Il sistema supporta una lunghezza di contesto fino a 8.192 step temporali e lunghezze di previsione flessibili, mentre una testa di previsione basata su 99 quantili consente di produrre sia stime puntuali sia intervalli probabilistici che rappresentano l’incertezza della previsione.
Una delle modifiche principali rispetto a PatchTST-FM-r1 riguarda il backbone. IBM ha sostituito i normali blocchi Transformer con blocchi Conformer, un’architettura originariamente diventata popolare nel riconoscimento vocale. Ogni blocco comprende due livelli feed-forward “half-step” che racchiudono un modulo di multi-head self-attention e uno strato di convoluzione temporale. La parte convoluzionale è utilizzata per catturare le relazioni a breve termine tra le porzioni della serie, lasciando al meccanismo di self-attention il compito di modellare le dipendenze temporali a più lungo raggio.
I Conformer utilizzano kernel convoluzionali di dimensione 3 e 5 secondo uno schema ripetuto {5, 5, 3, 3}. Il modello comprende complessivamente 30 blocchi, rispetto ai 20 della generazione r1, scelta effettuata per aumentare la capacità della rete in relazione all’espansione dei dati di pretraining. La dimensione nascosta è pari a 1.024 e prima della testa di previsione viene applicata una layer normalization aggiuntiva, introdotta per migliorare la stabilità durante l’addestramento.
Come suggerisce il nome PatchTST, l’input non viene elaborato esclusivamente punto per punto ma suddiviso in patch temporali. PatchTST-FM-r2 utilizza patch lunghe 16 step con stride pari a 8, producendo quindi una sovrapposizione del 50% tra segmenti consecutivi. Durante il training viene applicata una ponderazione della loss tramite finestra di Hamming, mentre in fase di inferenza le previsioni sovrapposte vengono ricombinate attraverso un metodo overlap-and-add. Questa impostazione permette di ridurre le discontinuità tra patch adiacenti e di mantenere l’informazione condivisa nelle regioni sovrapposte.
Anche il corpus utilizzato per il pretraining è stato ampliato. La documentazione del modello indica quattro principali sorgenti di dati: dataset selezionati da GiftEvalPretrain, dati sintetici personalizzati derivati da KernelSynth con kernel periodici modificati e un livello limitato di data augmentation, un corpus TSMixup generato secondo l’approccio descritto nel lavoro Chronos ma limitato a dataset esterni al set di valutazione GIFT-Eval, e circa 500.000 sequenze sintetiche CauKer lunghe 4.096 step ciascuna. Quest’ultimo dataset è stato prodotto dal team IBM FlowState ed era già stato utilizzato nello sviluppo di Granite-FlowState.
IBM ha valutato PatchTST-FM-r2 sul benchmark GIFT-Eval, progettato per confrontare modelli di forecasting su serie temporali e scenari differenti. Considerando esclusivamente i modelli replicabili, zero-shot e valutati senza contaminazione dei dati di test, al 8 settembre 2026 PatchTST-FM-r2 occupava la seconda posizione sia per CRPS sia per MASE. Il modello raggiunge un geometric mean CRPS di 0,467, immediatamente dietro TimesFM-3, e un geometric mean MASE di 0,6846. Poiché valori inferiori indicano risultati migliori per entrambe le metriche, IBM lo indica come il modello con le migliori prestazioni all’interno dello stesso gruppo tra quelli distribuiti con una licenza permissiva adatta anche all’impiego commerciale.
Il confronto cambia includendo anche i modelli classificati nel benchmark come pretrained anziché strettamente zero-shot. Questi sistemi possono avere incluso nel proprio pretraining le porzioni di training dei dataset successivamente utilizzati da GIFT-Eval per la valutazione. Anche aggiungendoli alla graduatoria, PatchTST-FM-r2 si colloca al terzo posto per CRPS e al quarto per MASE tra i modelli replicabili e supera varianti pretrained di Chronos-2, Timer-S1 e Toto, nonostante alcuni di questi sistemi abbiano dimensioni sensibilmente maggiori.
La model card indica che la seconda posizione tra i modelli replicabili zero-shot era stata rilevata già il 31 agosto 2026 e precisa che i risultati erano associati a una pull request ancora in attesa di integrazione nel benchmark GIFT-Eval. L’annuncio IBM del 9 settembre aggiorna il riferimento temporale all’8 settembre, mantenendo la stessa posizione nella classifica zero-shot replicabile.
PatchTST-FM-r2 viene distribuito con doppia licenza Apache 2.0 e OpenMDW 1.0, lasciando agli utilizzatori la possibilità di scegliere quella preferita. OpenMDW 1.0 è una licenza della Linux Foundation pensata per modelli di intelligenza artificiale e relativi materiali, mentre entrambe le opzioni prevedono condizioni permissive per utilizzo, modifica e distribuzione. IBM specifica inoltre nella model card che il codice è stato prodotto dai propri sviluppatori come progetto open source e non come prodotto IBM e che l’azienda non assume l’obbligo di fornire aggiornamenti, miglioramenti o supporto.
I pesi del modello sono disponibili su Hugging Face e PatchTST-FM-r2 può essere caricato tramite il pacchetto granite-tsfm dalla versione 0.3.9 in poi utilizzando una pipeline API. L’esempio pubblicato da IBM utilizza gli ultimi 512 campioni di una serie ETTh1 per produrre una previsione insieme ai quantili richiesti. L’implementazione della nuova architettura è disponibile nel repository open source IBM TSFM ed è mantenuta compatibile con i checkpoint di PatchTST-FM-r1.
IBM sta inoltre lavorando sull’utilizzo dei modelli Granite Time Series in scenari di elaborazione streaming. Attraverso un programma Early Access con Confluent Cloud sono già disponibili PatchTST-FM-r1, FlowState-r1.1, TTM-r3 e TSPulse, che possono eseguire inferenze su flussi di serie temporali in tempo reale tramite Apache Flink. PatchTST-FM-r2 si inserisce quindi in una linea di modelli IBM dedicata alle serie temporali che comprende TST, sviluppato nel 2021 tra i primi approcci Transformer applicati a questi dati, PatchTST del 2023 con rappresentazione a patch e channel independence, Tiny Time Mixer del 2024 e FlowState del 2025.
Secondo IBM, i modelli sviluppati dalla propria divisione dedicata ai time-series foundation model sono stati complessivamente addestrati su oltre 100 miliardi di data point, mentre la famiglia Tiny Time Mixer ha superato 37 milioni di download su Hugging Face. PatchTST-FM-r1, predecessore diretto della nuova versione, era stato sviluppato insieme al Rensselaer Polytechnic Institute. Con PatchTST-FM-r2 IBM mantiene l’impostazione patch-based della famiglia, ma combina convoluzioni temporali e self-attention all’interno dei nuovi blocchi Conformer e amplia sia la capacità del modello sia la base di pretraining, mantenendo al tempo stesso il funzionamento zero-shot e la disponibilità aperta dei componenti necessari per eseguire e riprodurre il sistema.
Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)
