Источники
Сделай её своей
Вдохновила эта история? Преврати идею в собственное ИИ-искусство за секунды — бесплатный старт, без банковской карты.
Начать бесплатно
Элиас простым языком объясняет исследования, стоящие за заголовками.
Вдохновила эта история? Преврати идею в собственное ИИ-искусство за секунды — бесплатный старт, без банковской карты.
Начать бесплатноВыбери компаньона и узнай его мнение об этой истории
Suno, платформа для создания музыки с помощью ИИ, запустила функцию Speech в публичной бете: она генерирует разговорное аудио по скрипту или текстовому описанию и накладывает его на фоновую музыку, созданную ИИ, — превращая то, что раньше требовало двух инструментов, в единый промпт.
Suno Speech принимает два вида ввода: прямой скрипт (слова, которые нужно произнести) или описательный промпт («спокойный рассказчик, объясняющий ночное небо»). Модель генерирует подходящий голос и одновременно сочиняет инструментальную музыку в качестве подложки. По данным The Verge, два аудиослоя создаются вместе, а не склеиваются в постобработке — это означает, что тайминг и динамика музыки формируются вокруг речи с самого начала, а не добавляются после.
Это различие важно для тех, кто тратил время на ручную синхронизацию закадрового текста с отдельно сгенерированной музыкальной подложкой. Привычные трудности — подстройка темпа, обрезка пауз, сдвиг фейдов — исчезают, когда оба элемента создаются за один проход генерации.

Функция Speech от Suno генерирует разговорное аудио и фоновую музыку из одного текстового промпта — здесь показаны примеры вывода из публичной беты.
Изображение: The Verge / The Verge AI
Стиль голоса в Suno Speech задаётся через промпт — по той же логике, что и музыкальный режим платформы. Описание «хриплый, неторопливый рассказчик» или «энергичный ведущий подкаста» формирует результат так же, как «lo-fi хип-хоп с меланхоличным фортепиано» формирует музыкальный трек. В текущей бете нет клонирования голоса по загруженному образцу — голоса генерируются заново по описанию, что позволяет функции держаться в стороне от юридически спорной территории, которую занимают инструменты клонирования голоса.
Для авторов, создающих ИИ-персонажей или озвученные сцены, это значимая отправная точка: можно итерировать голосовую личность только через текст, без записи референсного аудио или лицензирования конкретного голоса. Компромисс — менее точный контроль по сравнению со специализированными платформами text-to-speech; открытый TTS-рейтинг Hugging Face сравнивает несколько альтернатив, если приоритет — тонкая настройка качества голоса.

Интерфейс Speech от Suno позволяет пользователям ввести скрипт или описательный промпт для генерации озвученного трека с одновременной фоновой музыкой.
Изображение: The Verge / The Verge AI
Наиболее очевидный сценарий использования — озвучка коротких видео: аудиоподложка продолжительностью от 30 до 90 секунд, которую авторы сейчас собирают, генерируя музыку в Suno (или конкуренте), генерируя речь в отдельном TTS-инструменте, а затем монтируя всё в DAW или видеоредакторе. Suno Speech сжимает это в один шаг.
Собственная формулировка Suno, приведённая The Verge, осторожна: «Музыка всегда будет в основе того, что мы делаем» — это сигнал о том, что Speech является расширением музыкального продукта, а не переориентацией на общий голосовой ИИ. Такая формулировка также предполагает, что функция будет настроена на музыкальные контексты (вступления, озвученные треки, spoken-word песни), а не на производство длинных аудиокниг или подкастов.
Для авторов ИИ-изображений и видео, которые уже используют Suno для фонового аудио, добавление синхронизированного закадрового голоса устраняет ещё одну внешнюю зависимость. Автор, создающий озвученное ИИ слайд-шоу или анимированный короткометражный фильм, теперь имеет реальный аудиопайплайн на одной платформе — генерировать голос и музыку вместе, экспортировать и вставлять в видеоредактор.
Бета уже доступна на веб- и мобильных платформах. Как и в большинстве бет Suno, качество вывода и охват функций, вероятно, изменятся до полного релиза — поэтому текущую версию стоит протестировать на соответствие задачам, но перестраивать под неё производственный пайплайн пока рано.