Alibaba ha avviato la beta di HappyShrimp 1.0, un modello di intelligenza artificiale progettato per generare un brano musicale completo a partire da una descrizione in linguaggio naturale. Il sistema permette di partire da indicazioni molto diverse, come un’emozione, una storia, un genere musicale o una determinata atmosfera, e utilizza queste informazioni per produrre composizione, arrangiamento, testo e voce all’interno dello stesso processo generativo. È il primo modello sviluppato da Alibaba specificamente per automatizzare l’intero processo di produzione musicale, ampliando così le attività dell’azienda nel settore audio oltre le tecnologie già dedicate a voce e riconoscimento del parlato.
L’utente non deve necessariamente conoscere teoria musicale o tecniche di composizione. È possibile chiedere direttamente la creazione di una canzone con voce oppure di un brano strumentale, lasciando al modello il compito di costruirne tutti gli elementi. HappyShrimp consente anche di fornire un testo scritto dall’utente e affidare all’AI la composizione della musica, l’arrangiamento e l’interpretazione vocale, mantenendo quindi la possibilità di intervenire direttamente su una delle componenti creative senza dover gestire manualmente le altre.
La caratteristica tecnica principale di HappyShrimp 1.0 è l’architettura end-to-end utilizzata per la generazione della musica. Il modello non produce separatamente testo, melodia, arrangiamento e voce per combinarli soltanto in una fase successiva, ma considera il brano come una struttura unica e genera contemporaneamente le diverse componenti. Alibaba descrive la musica come una forma particolare di linguaggio dotata di grammatica, significato e contesto, sulla quale il modello può quindi costruire la struttura complessiva della composizione mantenendo relazioni coerenti tra le varie parti.
L’approccio cerca di risolvere alcuni problemi tipici dei sistemi di generazione musicale costituiti da moduli indipendenti. Quando testo, composizione, arrangiamento e voce vengono prodotti separatamente e assemblati in seguito, possono emergere discrepanze tra la metrica delle parole e la melodia, transizioni poco naturali, una struttura complessiva debole oppure una scarsa integrazione tra voce e accompagnamento. HappyShrimp pianifica invece questi elementi all’interno dello stesso processo, con particolare attenzione alla coerenza strutturale del brano anche su intervalli temporali più lunghi.
La comprensione del linguaggio naturale costituisce un’altra componente centrale del modello. L’utente non è limitato a indicazioni semplici come pop, rock o jazz, ma può descrivere una scena, un periodo storico, un’emozione o una vera e propria situazione narrativa. Una richiesta costruita, per esempio, intorno al monologo di un fantasma abbandonato può essere interpretata dal sistema come indicazione per determinare atmosfera, stile vocale, progressione musicale e sviluppo emotivo fino al punto culminante della composizione. Il prompt diventa quindi una descrizione dell’intenzione creativa complessiva, non soltanto una selezione di parametri musicali.
HappyShrimp supporta comunque anche istruzioni tecniche più precise. È possibile specificare il genere della voce, il tipo di interpretazione, l’estensione vocale, il BPM, gli strumenti da utilizzare e l’evoluzione emotiva del brano. Le richieste possono combinare indicazioni tecniche con descrizioni più narrative, includendo espressioni di genere come Lo-Fi R&B insieme a informazioni sull’atmosfera o sulla scena che la musica deve rappresentare. Secondo Alibaba, il sistema non tratta queste condizioni semplicemente come elementi indipendenti da sommare, ma tenta di comprendere l’intenzione complessiva e di integrarle in maniera musicalmente coerente.
Il modello è stato sviluppato per lavorare su un insieme ampio di generi. Tra quelli indicati figurano musica di stile cinese, pop, rock, elettronica e jazz, con la possibilità di modificare strumenti, caratteristiche della voce e andamento emotivo della composizione. L’obiettivo è permettere all’utente di controllare il risultato attraverso il linguaggio naturale senza trasformare necessariamente l’interazione con il modello in una sequenza di impostazioni tecniche separate.
Alibaba intende inoltre portare HappyShrimp oltre l’utilizzo sperimentale da parte del pubblico e inserirlo nei processi professionali di produzione musicale. Per questo ha avviato una collaborazione con Taihe Music Group, uno dei principali operatori cinesi del settore musicale. Le due società intendono combinare le capacità dell’intelligenza artificiale con le competenze dell’industria musicale per sperimentare modalità di co-creazione tra musicisti e AI e sviluppare contenuti destinati a livelli qualitativi più vicini alla produzione professionale.
Il nome del modello richiama inoltre un marchio storico di Alibaba. HappyShrimp recupera infatti l’identità di Xiami Music, la piattaforma di streaming musicale dell’azienda che aveva terminato il servizio nel 2021. “Xiami” significa gamberetto in cinese e il nuovo modello riporta quindi quel riferimento nel mercato musicale sotto forma di tecnologia generativa, invece che come servizio di streaming.
HappyShrimp 1.0 è attualmente disponibile in versione open beta attraverso il sito ufficiale del servizio. Alibaba starebbe preparando anche un’applicazione mobile dedicata, che porterebbe la generazione musicale direttamente su smartphone. Con questa prima versione l’azienda entra quindi nel settore dei modelli capaci di produrre canzoni complete da prompt, puntando soprattutto sull’integrazione end-to-end di testo, melodia, arrangiamento e voce e sulla possibilità di trasformare una descrizione narrativa o tecnica in una composizione strutturata.
Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)
