
Eliasは見出しの裏にある研究を、わかりやすい言葉でひもときます。
コンパニオンを選んで、この話題についての感想を聞いてみましょう

AIミュージックプラットフォームのSunoが、「Speech」と呼ばれるパブリックベータ機能を公開した。スクリプトまたはテキストによる説明から音声を生成し、AIが作曲したバックグラウンドミュージックと重ね合わせる — かつては2つのツールを必要としていたワークフローを、シングルプロンプトへと集約した。
Suno Speechは2種類の入力を受け付ける。直接的なスクリプト(読み上げたいテキスト)と、説明的なプロンプト(「夜空を穏やかに解説するナレーター」など)だ。モデルはそれに合った声を生成し、同時にその下に敷くインストゥルメンタルミュージックを作曲する。The Vergeによると、2つのオーディオレイヤーは後から合成されるのではなく、同時に生成される — つまり、ミュージックのタイミングやダイナミクスは最初からスピーチに合わせて形成され、後付けで追加されるわけではない。
この違いは、ナレーションを別途生成したミュージックベッドに手動で同期させる作業に時間を費やしてきた人にとって重要だ。テンポの調整、無音部分のトリミング、フェードインの微調整といった通常の手間は、両要素がシングルジェネレーションパスを共有することで消えてなくなる。

Sunoのスピーチ機能は、単一のテキストプロンプトから音声とバッキングミュージックを生成する。パブリックベータのサンプル出力を示している。
Suno Speechのボイススタイルはプロンプト駆動型で、プラットフォームのミュージックモードと同じロジックに従う。「しゃがれた、ゆっくりとしたナレーター」や「明るいポッドキャストホスト」と記述することで、「メランコリックなピアノを使ったlo-fiヒップホップ」と指定してミュージックトラックを形成するのと同様に、出力が形成される。現在のベータではアップロードしたサンプルからのボイスクローニングは行われない — 声は説明から新たに生成されるため、ボイスクローニングツールが抱える法的にデリケートな領域を回避している。
AIキャラクターやナレーション付きシーンを制作するクリエイターにとって、これは意義ある出発点だ。参照音声を録音したり特定の声をライセンスしたりすることなく、テキストだけでボーカルパーソナリティを繰り返し調整できる。トレードオフとして、専用のテキスト読み上げプラットフォームと比べると精密なコントロールは劣る — 細かい音声品質が優先事項であれば、Hugging FaceのオープンTTSリーダーボードでいくつかの代替手段をベンチマークできる。

SunoのSpeechインターフェースでは、スクリプトまたはプロンプトの説明を入力することで、バックグラウンドミュージックと同時に音声トラックを生成できる。
最も直接的なユースケースはショートフォーム動画のナレーションだ — クリエイターが現在、Suno(またはライバルツール)でミュージックを生成し、別のTTSツールでスピーチを生成し、DAWや動画編集ソフトで両方を編集することで組み立てている、30〜90秒程度のオーディオベッドのことだ。Suno Speechはそれをワンステップに圧縮する。
The Vergeが報じたSuno自身の説明は慎重だ。「ミュージックは常に私たちの取り組みの核心にある」 — これはSpeechがミュージック製品の拡張であり、汎用ボイスAIへの方向転換ではないことを示している。この説明はまた、この機能が長編オーディオブックやポッドキャスト制作よりも、ミュージカルなコンテキスト(イントロ、ナレーション付きトラック、スポークンワードソング)に向けてチューニングされることを示唆している。
バックグラウンドオーディオにSunoをすでに活用しているAIイメージ・動画クリエイターにとって、同期されたナレーションの追加は外部依存をさらに一つ排除する。AIナレーション付きスライドショーやアニメーションショートを制作するクリエイターは、実用的なシングルプラットフォームのオーディオパイプラインを手に入れた — 声とミュージックをまとめて生成し、エクスポートして、動画編集ソフトに取り込むだけだ。
ベータはWebとモバイルの両方で現在公開中だ。Sunoのほとんどのベータと同様に、正式リリース前に出力品質や機能の範囲が変わる可能性が高い — そのため、現在のバージョンは適合性をテストする価値はあるが、プロダクションパイプラインを再構築するにはまだ時期尚早だ。