출처
나만의 작품으로
이 이야기에서 영감을 받으셨나요? 그 아이디어를 단 몇 초 만에 나만의 AI 아트로 만들어 보세요. 무료로 시작할 수 있고, 카드 등록도 필요 없습니다.
무료로 만들기 시작이 소식에 대해 이야기 나누기
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요

Elias는 헤드라인 뒤의 연구를 쉬운 언어로 풀어냅니다.
이 이야기에서 영감을 받으셨나요? 그 아이디어를 단 몇 초 만에 나만의 AI 아트로 만들어 보세요. 무료로 시작할 수 있고, 카드 등록도 필요 없습니다.
무료로 만들기 시작컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요
AI 음악 플랫폼 Suno가 Speech라는 공개 베타 기능을 출시했다. 스크립트나 텍스트 설명으로 음성 오디오를 생성하고 AI가 작곡한 배경 음악과 결합해, 기존에 두 가지 도구가 필요했던 작업을 단 하나의 프롬프트로 처리할 수 있다.
Suno Speech는 두 가지 입력을 받는다. 직접 스크립트(말하고 싶은 내용)와 설명 프롬프트(「밤하늘을 차분하게 설명하는 내레이터」)다. 모델은 이에 맞는 음성을 생성하는 동시에, 그 아래에 깔릴 반주 음악을 작곡한다. The Verge에 따르면, 두 오디오 레이어는 사후에 이어 붙이는 방식이 아니라 함께 생성된다. 즉, 음악의 타이밍과 다이나믹이 처음부터 음성을 중심으로 구성되며 나중에 덧붙여지지 않는다.
이 차이는 내레이션을 별도로 생성한 음악 베드에 수동으로 맞춰본 경험이 있는 사람이라면 누구에게나 중요하다. 템포 조정, 무음 구간 트리밍, 페이드인 조절 같은 번거로운 작업이 두 요소가 단일 생성 과정을 공유할 때 사라진다.

Suno의 Speech 기능은 단일 텍스트 프롬프트로 음성 오디오와 배경 음악을 생성하며, 공개 베타의 예시 출력 결과가 여기에 표시되어 있다.
Suno Speech의 보컬 스타일은 플랫폼의 음악 모드와 동일한 논리를 따르는 프롬프트 방식으로 제어된다. 「거칠고 느린 내레이터」나 「활기찬 팟캐스트 호스트」를 묘사하면 「우울한 피아노가 있는 로파이 힙합」을 지정해 음악 트랙을 만드는 것과 유사하게 출력이 형성된다. 현재 베타에서는 업로드된 샘플로부터의 음성 복제 기능은 없으며, 음성은 설명으로부터 새롭게 생성된다. 이는 음성 복제 도구가 점유하는 법적으로 복잡한 영역을 피할 수 있게 해준다.
AI 캐릭터나 내레이션 장면을 제작하는 크리에이터에게 이는 의미 있는 출발점이다. 참조 오디오를 녹음하거나 특정 음성을 라이선스하지 않고도 텍스트만으로 보컬 개성을 반복 조정할 수 있다. 단점은 전용 텍스트-투-스피치 플랫폼에 비해 정밀한 제어가 어렵다는 점이다. 세밀한 음성 품질이 우선순위라면 Hugging Face의 오픈 TTS 리더보드에서 여러 대안을 벤치마크할 수 있다.

Suno의 Speech 인터페이스에서 사용자는 스크립트나 프롬프트 설명을 입력해 동시 배경 음악이 포함된 음성 트랙을 생성할 수 있다.
가장 직접적인 활용 사례는 숏폼 영상 내레이션이다. 크리에이터들이 현재 Suno(또는 경쟁 플랫폼)에서 음악을 생성하고, 별도의 TTS 도구에서 음성을 생성한 뒤, DAW나 영상 편집기에서 두 요소를 편집해 조합하는 30~90초 분량의 오디오 베드가 그 대상이다. Suno Speech는 이 과정을 한 단계로 압축한다.
The Verge가 보도한 Suno의 공식 입장은 신중하다. 「음악은 항상 우리가 하는 일의 핵심에 있을 것」이라며, Speech가 범용 음성 AI로의 방향 전환이 아닌 음악 제품의 확장임을 시사한다. 이 입장은 또한 이 기능이 장편 오디오북이나 팟캐스트 제작보다는 음악적 맥락(인트로, 내레이션 트랙, 스포큰 워드 곡)에 맞게 조정될 것임을 암시한다.
이미 배경 오디오로 Suno를 활용하는 AI 이미지 및 영상 크리에이터에게 동기화된 내레이션의 추가는 외부 의존성을 하나 더 줄여준다. AI 내레이션 슬라이드쇼나 애니메이션 단편을 제작하는 크리에이터는 이제 단일 플랫폼 오디오 파이프라인을 현실적으로 구축할 수 있다. 음성과 음악을 함께 생성하고, 내보내고, 영상 편집기에 바로 넣으면 된다.
베타는 현재 웹과 모바일 전반에 걸쳐 라이브 상태다. 대부분의 Suno 베타와 마찬가지로 정식 출시 전에 출력 품질과 기능 범위가 변경될 가능성이 높다. 따라서 현재 버전은 적합성을 테스트해볼 만하지만, 아직 프로덕션 파이프라인을 재구성할 단계는 아니다.