Suno ha lanciato Speech in versione beta, un nuovo modello per la generazione di audio parlato progettato per creare nello stesso passaggio sia la voce sia la musica di accompagnamento, producendo quindi una traccia unica nella quale i due elementi vengono generati in modo coordinato. La funzione è disponibile dal 1° ottobre 2026 su web e dispositivi mobili, dopo circa un mese di test con un gruppo ristretto di utenti, ed è integrata direttamente nella piattaforma Suno. Per utilizzarla è sufficiente inserire un’idea, una poesia o un testo scritto e descrivere il tipo di voce e lo stile musicale desiderati: il modello genera quindi il parlato insieme alla relativa colonna sonora, senza richiedere la creazione separata dei due componenti e il successivo montaggio.
Tra gli utilizzi indicati figurano racconti della buonanotte accompagnati dal pianoforte, discorsi motivazionali con percussioni da stadio, meditazioni, poesie, messaggi vocali trasformati in letture cinematografiche e perfino contenuti ASMR. Durante lo sviluppo il team ha sperimentato anche con messaggi di amici convertiti in interpretazioni drammatiche, normali note vocali accompagnate da colonne sonore e contenuti destinati ai bambini. Suno presenta Speech come un’estensione del tipo di creazioni personali già prodotte dagli utenti della piattaforma, che comprendono musica per compleanni e matrimoni, contenuti dedicati ad amici e familiari, riferimenti privati e produzioni legate alla fede o al culto. La società inserisce questa evoluzione nel concetto di “creative entertainment”, mantenendo la musica al centro della propria piattaforma ma ampliando il sistema verso altre forme di espressione audio.
La versione attuale rimane esplicitamente una beta e presenta ancora alcuni limiti nella stabilità delle interpretazioni vocali. Un accento britannico, ad esempio, può occasionalmente trasformarsi in australiano e poi tornare indietro, mentre alcune pause richieste come drammatiche possono risultare particolarmente accentuate. Suno prevede inoltre che gli utenti possano individuare applicazioni non considerate durante lo sviluppo e intende utilizzare il feedback raccolto per migliorare progressivamente il modello. Speech arriva poche settimane dopo Suno v6, introdotto il 9 settembre 2026 e sviluppato con il coinvolgimento di Warner Music Group, BMG e Believe. La famiglia comprende v6 e v6-wild per gli abbonati Pro e Premier e il più rapido v6-mini disponibile per tutti; tra le capacità introdotte figurano la modifica in linguaggio naturale di singole parti di un brano, la creazione di mashup da più sorgenti, il campionamento e l’isolamento dell’audio, la generazione musicale a partire da testo, immagini, audio e video e la possibilità di modificare anche una sola parte del testo senza rigenerare l’intera canzone.
Nel corso del 2026 Suno ha inoltre ampliato progressivamente gli strumenti dedicati alla personalizzazione e alla produzione musicale. La versione 5.5, rilasciata a marzo, ha introdotto Voices, che permette di registrare o caricare la propria voce e utilizzarla nelle creazioni, Custom Models, che consente di addestrare un modello personalizzato utilizzando almeno sei brani del proprio catalogo, e My Taste, pensato per apprendere nel tempo generi, atmosfere e riferimenti preferiti dall’utente. Voices è arrivato su iOS e Android ad agosto, mentre Studio 2.0 ha trasformato l’ambiente di produzione audio nel browser aggiungendo editing MIDI, effetti, sintetizzatori integrati e una barra di chat. Con Speech, la stessa infrastruttura generativa viene ora estesa dal canto e dalla produzione musicale al parlato accompagnato, mantenendo voce e musica all’interno dello stesso processo di generazione.
Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)
