Fontes
Deixe do seu jeito
Se inspirou nesta história? Transforme a ideia na sua própria arte com IA em segundos — comece de graça, sem cartão.
Começar de graça
Elias traduz a pesquisa por trás das manchetes em linguagem simples.
Se inspirou nesta história? Transforme a ideia na sua própria arte com IA em segundos — comece de graça, sem cartão.
Começar de graçaEscolha um companheiro e veja o que ele acha dessa história
A Suno, plataforma de música com IA, lançou um recurso em beta público chamado Speech que gera áudio de voz falada a partir de um roteiro ou descrição em texto e o combina com música de fundo composta por IA — condensando o que antes exigia duas ferramentas em um único prompt.
O Suno Speech aceita dois tipos de entrada: um roteiro direto (as palavras que você quer que sejam faladas) ou um prompt descritivo ("um narrador calmo explicando o céu noturno"). O modelo então gera uma voz correspondente e, simultaneamente, compõe música instrumental para servir de base. De acordo com The Verge, as duas camadas de áudio são geradas juntas, e não costuradas em pós-produção — o que significa que o timing e a dinâmica da música são moldados em torno da fala desde o início, e não adicionados depois.
Essa distinção importa para quem já passou tempo sincronizando manualmente uma narração a uma trilha musical gerada separadamente. O atrito habitual — ajustar o tempo, cortar silêncios, afinar os fade-ins — desaparece quando ambos os elementos compartilham uma única passagem de geração.

O recurso Speech da Suno gera áudio falado e música de fundo a partir de um único prompt de texto, mostrado aqui em exemplos de saída do beta público.
Imagem: The Verge / The Verge AI
O estilo de voz no Suno Speech é orientado por prompt, seguindo a mesma lógica do modo de música da plataforma. Descrever "um narrador rouco e de ritmo lento" ou "um apresentador de podcast animado" molda o resultado de forma semelhante a especificar "lo-fi hip-hop com piano melancólico" para uma faixa musical. Não há clonagem de voz a partir de uma amostra enviada pelo usuário no beta atual — as vozes são geradas do zero a partir da descrição, o que mantém o recurso longe do território juridicamente mais delicado que as ferramentas de clonagem de voz ocupam.
Para criadores que constroem personagens com IA ou cenas narradas, este é um ponto de partida significativo: é possível iterar sobre a personalidade vocal apenas com texto, sem gravar áudio de referência ou licenciar uma voz específica. A contrapartida é um controle menos preciso em comparação com plataformas dedicadas de texto para fala — o ranking aberto de TTS do Hugging Face apresenta várias alternativas caso a qualidade de voz refinada seja a prioridade.

A interface Speech da Suno permite que usuários insiram um roteiro ou descrição por prompt para gerar uma faixa com voz e música de fundo simultânea.
Imagem: The Verge / The Verge AI
O caso de uso mais direto é a narração de vídeos curtos — o tipo de base de áudio de 30 a 90 segundos que criadores atualmente montam gerando música na Suno (ou em um concorrente), gerando fala em uma ferramenta de TTS separada e editando ambos em um DAW ou editor de vídeo. O Suno Speech comprime tudo isso em uma única etapa.
O próprio enquadramento da Suno, conforme relatado pelo The Verge, é cuidadoso: «A música sempre estará no centro do que fazemos» — sinalizando que o Speech é uma extensão do produto de música, não um reposicionamento em direção à IA de voz geral. Esse enquadramento também sugere que o recurso será ajustado para contextos musicais (vinhetas, faixas narradas, músicas faladas) em vez de produção de audiobooks ou podcasts de longa duração.
Para criadores de imagens e vídeos com IA que já usam a Suno para áudio de fundo, a adição de narração sincronizada elimina mais uma dependência externa. Um criador que produz um slideshow narrado por IA ou um curta animado agora tem um pipeline de áudio plausível em uma única plataforma — gere a voz e a música juntas, exporte e insira no editor de vídeo.
O beta está disponível agora na web e no mobile. Como acontece com a maioria dos betas da Suno, a qualidade das saídas e o escopo dos recursos provavelmente mudarão antes do lançamento completo — portanto, a versão atual vale a pena testar para avaliar a adequação, mas ainda não justifica reconstruir um pipeline de produção em torno dela.