Fonti
Falla tua
Ti ha ispirato questa storia? Trasforma l’idea nella tua arte con IA in pochi secondi: inizi gratis, senza carta.
Inizia gratis
Elias spiega la ricerca dietro i titoli con un linguaggio chiaro.
Ti ha ispirato questa storia? Trasforma l’idea nella tua arte con IA in pochi secondi: inizi gratis, senza carta.
Inizia gratisScegli un compagno e scopri cosa ne pensa di questa storia
Suno, la piattaforma musicale AI, ha lanciato una funzione in beta pubblica chiamata Speech che genera audio parlato da uno script o una descrizione testuale e lo sovrappone a musica di sottofondo composta dall'AI — riducendo quello che era un flusso di lavoro a due strumenti in un singolo prompt.
Suno Speech accetta due tipi di input: uno script diretto (le parole che si desidera pronunciate) o un prompt descrittivo («un narratore calmo che spiega un cielo notturno»). Il modello genera quindi una voce corrispondente e, simultaneamente, compone musica strumentale da collocare al di sotto. Secondo The Verge, i due livelli audio vengono generati insieme anziché uniti in post-produzione — il che significa che il timing e le dinamiche della musica sono modellati attorno al parlato fin dall'inizio, non aggiunti in un secondo momento.
Questa distinzione è importante per chiunque abbia trascorso del tempo a sincronizzare manualmente la narrazione con una base musicale generata separatamente. La solita frizione — regolare il tempo, tagliare i silenzi, aggiustare i fade-in — scompare quando entrambi gli elementi condividono un'unica fase di generazione.

La funzione Speech di Suno genera audio parlato e musica di accompagnamento da un singolo prompt testuale, mostrati qui negli output di esempio dalla beta pubblica.
Immagine: The Verge / The Verge AI
Lo stile vocale in Suno Speech è guidato dal prompt, seguendo la stessa logica della modalità musicale della piattaforma. Descrivere «un narratore dalla voce roca e dal ritmo lento» o «un conduttore di podcast vivace» modella l'output in modo simile a come specificare «lo-fi hip-hop con un pianoforte malinconico» modella una traccia musicale. Nella beta attuale non è previsto il cloning vocale da un campione caricato — le voci vengono generate ex novo dalla descrizione, il che mantiene la funzione lontana dal territorio legalmente più delicato occupato dagli strumenti di voice cloning.
Per i creator che costruiscono personaggi AI o scene narrate, questo è un punto di partenza significativo: è possibile iterare sulla personalità vocale solo attraverso il testo, senza registrare audio di riferimento o ottenere la licenza per una voce specifica. Il compromesso è un controllo meno preciso rispetto alle piattaforme text-to-speech dedicate — la classifica TTS aperta di Hugging Face mette a confronto diverse alternative se la qualità vocale fine è la priorità.

L'interfaccia Speech di Suno consente agli utenti di inserire uno script o una descrizione tramite prompt per generare una traccia vocale con musica di sottofondo simultanea.
Immagine: The Verge / The Verge AI
Il caso d'uso più diretto è la narrazione di video in formato breve — il tipo di base audio da 30 a 90 secondi che i creator attualmente assemblano generando musica in Suno (o in un concorrente), generando il parlato in uno strumento TTS separato, quindi modificando entrambi in un DAW o in un editor video. Suno Speech comprime tutto questo in un unico passaggio.
Il posizionamento scelto da Suno, come riportato da The Verge, è cauto: «La musica sarà sempre al centro di ciò che facciamo» — a segnalare che Speech è un'estensione del prodotto musicale, non un riposizionamento verso l'AI vocale generalista. Questo inquadramento suggerisce anche che la funzione sarà ottimizzata per contesti musicali (intro, tracce narrate, canzoni spoken-word) piuttosto che per la produzione di audiolibri o podcast di lunga durata.
Per i creator di immagini e video AI che già utilizzano Suno per l'audio di sottofondo, l'aggiunta della narrazione sincronizzata elimina un'ulteriore dipendenza esterna. Un creator che realizza una presentazione narrata dall'AI o un cortometraggio animato dispone ora di una plausibile pipeline audio su piattaforma unica — genera voce e musica insieme, esporta, inserisce nell'editor video.
La beta è attiva ora su web e mobile. Come per la maggior parte delle beta di Suno, la qualità dell'output e la portata delle funzionalità cambieranno probabilmente prima di un rilascio completo — quindi la versione attuale vale la pena di essere testata per valutarne l'adeguatezza, ma non è ancora il caso di ricostruire attorno ad essa una pipeline di produzione.