Google ha introdotto Nano Banana 2.1, nuova versione del proprio modello dedicato alla generazione e alla modifica di immagini, costruita su Gemini 3.6 Flash e resa disponibile dal 6 ottobre 2026 attraverso un numero particolarmente ampio di prodotti e ambienti dell’ecosistema Google. Il modello è accessibile nell’app Gemini, in Google AI Studio, tramite Gemini API e nella Gemini Enterprise Agent Platform, ma viene distribuito anche in AI Mode di Google Search, Google Ads, Google Flow e Google Stitch. Nano Banana 2.1 appartiene alla famiglia Gemini 3 di modelli multimodali dotati di capacità di reasoning e accetta come input sia testo sia immagini, generando a sua volta immagini e testo. La model card di Google indica una finestra di contesto che può arrivare fino a un milione di token e output rispettivamente nell’ordine di 4K token per le immagini e 64K per il testo, mentre l’implementazione attraverso Gemini Enterprise utilizza una configurazione specifica con una context window di 131.072 token e un massimo di 32.768 token di output. Nella piattaforma enterprise il modello è identificato come gemini-nano-banana-2.1 ed è stato lanciato direttamente in disponibilità generale, con Google che lo posiziona come soluzione ottimizzata per mantenere un equilibrio fra prestazioni, qualità multimodale e costo delle operazioni di image generation ed editing.
La configurazione enterprise chiarisce anche quali modalità di input e output siano effettivamente utilizzabili. Testo e immagini sono supportati sia in ingresso sia in uscita, il video può essere utilizzato come input ma non generato come output, mentre l’audio non è disponibile. Il sistema supporta reasoning, system instruction, implicit context caching, token counting, grounding con Google Search e Google Image Search, provisioned throughput, batch inference e normale elaborazione pay-as-you-go, con disponibilità globale. Sul fronte visivo sono comprese generazione di immagini anche a partire da input video, editing delle immagini, editing multi-turn all’interno di una conversazione, produzione interlacciata di testo e immagini, Content Credentials basate sullo standard C2PA e virtual try-on. Non è invece disponibile la generazione di persone. Alcuni parametri normalmente utilizzati per controllare il comportamento di un modello generativo non sono supportati: seed, topK, logprobs, temperature e topP non possono essere specificati e la loro presenza nella richiesta restituisce direttamente un errore API.
Sono stati definiti anche limiti abbastanza precisi per il trattamento dei contenuti visivi. Una singola richiesta può contenere fino a 14 immagini e ogni file può avere una dimensione massima di 7 MB quando viene inviato inline oppure attraverso la console, limite che sale a 30 MB utilizzando Cloud Storage; la dimensione totale dell’input non può comunque superare i 500 MB. Sono disponibili risoluzioni 1K, 2K e 4K e rapporti d’aspetto 1:1, 3:2, 4:3, 16:9, 9:16 e 21:9, con supporto ai formati PNG, JPEG, WebP, HEIC e HEIF. Dal punto di vista della contabilizzazione, ogni immagine fornita in input equivale a 1.120 token; un’immagine generata a risoluzione 1K utilizza a sua volta 1.120 token, mentre a 2K ne consuma 1.680. Google descrive Nano Banana 2.1 come un aggiornamento di Nano Banana 2, cioè Gemini 3.1 Flash Image, sviluppato in particolare per aumentare l’efficienza della generazione, migliorare la qualità visiva, mantenere con maggiore stabilità l’identità dei personaggi durante sessioni di editing multi-turn, rendere il testo all’interno delle immagini con maggiore accuratezza e utilizzare il grounding della ricerca per produrre contenuti visivi basati su informazioni recuperate.
Il cambiamento più evidente riguarda però il pricing. Nel tier API standard a pagamento, Nano Banana 2.1 costa 1,50 dollari per milione di token in input per testo, immagini e video, 7,50 dollari per milione di token generati come testo o thinking e 30 dollari per milione di token di output immagine. Tradotto sul singolo file, Google calcola un costo di circa 0,0336 dollari per un’immagine 1K, 0,0504 dollari per un’immagine 2K e 0,0756 dollari per una 4K. Utilizzando la modalità batch i prezzi vengono dimezzati: 0,75 dollari per milione di token in input, 3,75 dollari per milione di token testuali o di reasoning e 15 dollari per milione di token immagine, equivalenti rispettivamente a circa 0,0168, 0,0252 e 0,0378 dollari per una generazione 1K, 2K o 4K. Il grounding tramite Google Search e Image Search comprende 5.000 richieste gratuite mensili condivise fra i modelli Gemini 3.x, superate le quali il prezzo passa a 14 dollari per 1.000 richieste. Per Nano Banana 2.1 non viene invece indicato un livello API gratuito.
Il confronto con Nano Banana 2 rende evidente la riduzione dei costi dell’output visivo. Gemini 3.1 Flash Image utilizzava un prezzo di 0,50 dollari per milione di token in input, 3 dollari per milione di token testuali e di thinking e soprattutto 60 dollari per milione di token immagine. Un’immagine costava quindi circa 0,067 dollari a 1K, 0,101 dollari a 2K e 0,151 dollari a 4K. Nano Banana 2.1 dimezza di fatto il prezzo dell’immagine pur aumentando il costo dei token testuali e di input, una differenza importante soprattutto negli scenari caratterizzati da elevati volumi di produzione visiva. Il batch processing porta ulteriormente il costo effettivo al 25% circa di quello associato all’output visivo standard della generazione precedente.
Google ha accompagnato il lancio con una serie articolata di valutazioni che combinano confronti umani side-by-side, dai quali vengono ricavati punteggi Elo, un AutoRater utilizzato per misurare la factuality e regression set derivati da casi d’uso di Gemini 2.5 Flash Image e Gemini 3 Pro Image. Nel text-to-image Nano Banana 2.1 raggiunge un Overall Preference Elo di 1050 ±14 nella configurazione con Thinking e 1015 ±13 senza Thinking, rispetto a 990 ±7 ottenuto da Nano Banana 2 con Thinking e 935 ±8 da Gemini 3 Pro Image, commercializzato come Nano Banana Pro. Nel design delle infografiche Nano Banana 2.1 con Thinking raggiunge 1048 ±17, contro 961 ±12 della generazione precedente e 912 ±12 di Nano Banana Pro. Ancora più marcato è il divario nella factuality delle infografiche, dove il nuovo modello arriva a 0,521, mentre Nano Banana 2 si ferma a 0,179 e Nano Banana Pro a 0,265.
I risultati pubblicati sull’editing mostrano un andamento analogo. Nella configurazione Thinking Nano Banana 2.1 raggiunge un Elo di 1026 nel General Editing, 1028 nella consistenza di un singolo personaggio, 1106 nella consistenza fra più personaggi, 1049 nelle modifiche basate su maschere o tratti di inchiostro, 1024 nella consistenza dei prodotti, 1062 nelle operazioni di stilizzazione e 1066 nel multi-reference editing. In tutte queste categorie Google riporta risultati superiori rispetto sia a Nano Banana 2 sia a Nano Banana Pro. Il miglioramento più pronunciato riguarda proprio la gestione simultanea di più personaggi e di più immagini di riferimento, due aree particolarmente critiche per workflow di editing complessi nei quali il sistema deve mantenere coerenza visiva durante più passaggi consecutivi.
La documentazione mantiene comunque un elenco esplicito delle limitazioni. Nano Banana 2.1 può generare hallucination, rallentare o andare occasionalmente in timeout, rendere male testi molto piccoli o paragrafi lunghi, perdere parte della consistenza di un personaggio tra l’immagine originale e quella generata e seguire solo parzialmente alcune istruzioni di editing. Nelle modifiche basate su maschere può inoltre lasciare tracce dei segni utilizzati per indicare l’area da modificare; in alcuni casi la posa del soggetto tende a rimanere eccessivamente simile a quella originale e possono emergere errori nella localizzazione spaziale degli elementi. Restano inoltre limitazioni nella conoscenza del mondo, nel reasoning tridimensionale e nella factuality. Gemini 3.6 Flash ha un knowledge cutoff generale fissato a marzo 2026, anche se Google specifica che in alcuni domini la conoscenza può fermarsi a gennaio 2025.
Sul fronte della sicurezza, il modello è stato sottoposto a red teaming manuale da gruppi specialistici separati dal team responsabile dello sviluppo. Google dichiara che Nano Banana 2.1 ha superato le soglie richieste per la child safety e che il profilo complessivo risulta simile o migliore di Gemini 3 Flash, senza che siano state individuate criticità eccezionali rispetto a Gemini 3.1 Pro. Per le valutazioni di frontier safety, Google richiama i test condotti su Gemini 3.1 Pro e Gemini 3.7 Flash, che non hanno raggiunto alcun Tracked o Critical Capability Level, e sostiene che Nano Banana 2.1 non introduca incrementi di capacità sufficientemente significativi da modificare quella valutazione.
Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)
