Sources
Faites-la vôtre
Inspiré par cette histoire ? Transformez l’idée en votre propre création par IA en quelques secondes — gratuit pour commencer, sans carte bancaire.
Commencer gratuitement
Elias décrypte la recherche derrière les gros titres en langage clair.
Inspiré par cette histoire ? Transformez l’idée en votre propre création par IA en quelques secondes — gratuit pour commencer, sans carte bancaire.
Commencer gratuitementChoisissez un compagnon et découvrez son avis sur cette histoire
Suno, la plateforme de musique IA, a lancé une fonctionnalité en bêta publique appelée Speech, qui génère de l'audio parlé à partir d'un script ou d'une description textuelle et le superpose à une musique de fond composée par IA — réduisant ce qui était autrefois un flux de travail à deux outils en une seule invite.
Suno Speech accepte deux types d'entrée : un script direct (les mots que vous souhaitez faire prononcer) ou une invite descriptive (« un narrateur calme expliquant un ciel nocturne »). Le modèle génère ensuite une voix correspondante et compose simultanément une musique instrumentale pour l'accompagner. Selon The Verge, les deux couches audio sont générées ensemble plutôt qu'assemblées en post-production — ce qui signifie que le timing et la dynamique de la musique sont façonnés autour de la parole dès le départ, et non ajoutés après coup.
Cette distinction est importante pour quiconque a passé du temps à synchroniser manuellement une narration avec une piste musicale générée séparément. Les frictions habituelles — ajustement du tempo, suppression des silences, décalage des fondus d'entrée — disparaissent lorsque les deux éléments partagent une seule passe de génération.

La fonctionnalité Speech de Suno génère de l'audio parlé et une musique d'accompagnement à partir d'une seule invite textuelle, illustrée ici par des exemples de sorties de la bêta publique.
Image : The Verge / The Verge AI
Le style vocal dans Suno Speech est piloté par des invites, suivant la même logique que le mode musical de la plateforme. Décrire « un narrateur à la voix rauque et au débit lent » ou « un animateur de podcast dynamique » façonne le résultat de la même manière que spécifier « hip-hop lo-fi avec un piano mélancolique » façonne une piste musicale. Il n'y a pas de clonage vocal à partir d'un échantillon importé dans la bêta actuelle — les voix sont générées à partir de la description, ce qui préserve la fonctionnalité des territoires juridiquement plus délicats qu'occupent les outils de clonage vocal.
Pour les créateurs qui construisent des personnages IA ou des scènes narrées, c'est un point de départ significatif : vous pouvez affiner la personnalité vocale par le texte seul, sans enregistrer d'audio de référence ni acquérir une voix spécifique sous licence. La contrepartie est un contrôle moins précis par rapport aux plateformes de synthèse vocale dédiées — le classement TTS ouvert de Hugging Face compare plusieurs alternatives si la qualité vocale fine est la priorité.

L'interface Speech de Suno permet aux utilisateurs de saisir un script ou une description guidée pour générer une piste vocale avec une musique de fond simultanée.
Image : The Verge / The Verge AI
Le cas d'usage le plus direct est la narration de vidéos courtes — ce type de fond audio de 30 à 90 secondes que les créateurs assemblent actuellement en générant de la musique dans Suno (ou un concurrent), en générant de la parole dans un outil TTS séparé, puis en éditant les deux dans une DAW ou un éditeur vidéo. Suno Speech compresse tout cela en une seule étape.
Le cadrage de Suno lui-même, tel que rapporté par The Verge, est prudent : « La musique sera toujours au cœur de ce que nous faisons » — signalant que Speech est une extension du produit musical, et non un repositionnement vers l'IA vocale généraliste. Ce cadrage suggère également que la fonctionnalité sera orientée vers des contextes musicaux (intros, pistes narrées, chansons parlées) plutôt que vers la production longue durée de livres audio ou de podcasts.
Pour les créateurs d'images et de vidéos IA qui utilisent déjà Suno pour l'audio de fond, l'ajout d'une narration synchronisée supprime une dépendance externe supplémentaire. Un créateur qui réalise un diaporama narré par IA ou un court animé dispose désormais d'un pipeline audio plausible sur une seule plateforme — générer la voix et la musique ensemble, exporter, intégrer dans l'éditeur vidéo.
La bêta est disponible dès maintenant sur le web et sur mobile. Comme pour la plupart des bêtas de Suno, la qualité des sorties et la portée des fonctionnalités évolueront probablement avant une version complète — la version actuelle vaut donc la peine d'être testée pour évaluer son adéquation, mais il n'est pas encore conseillé de reconstruire un pipeline de production autour d'elle.