Джерела
Зроби її своєю
Надихнула ця історія? Перетвори ідею на власне ШІ-мистецтво за лічені секунди — безкоштовний старт, без банківської картки.
Почати безкоштовно
Еліас простою мовою пояснює дослідження, що стоять за заголовками.
Надихнула ця історія? Перетвори ідею на власне ШІ-мистецтво за лічені секунди — безкоштовний старт, без банківської картки.
Почати безкоштовноОбери компаньйона і дізнайся його думку про цю історію
Suno, платформа для створення музики за допомогою ШІ, запустила функцію у відкритому бета-тестуванні під назвою Speech, яка генерує розмовне аудіо зі сценарію або текстового опису та накладає його на фонову музику, створену ШІ, — перетворюючи те, що раніше вимагало двох інструментів, на єдиний запит.
Suno Speech приймає два види введення: прямий сценарій (слова, які потрібно озвучити) або описовий запит («спокійний оповідач, який розповідає про нічне небо»). Модель потім генерує голос відповідно до нього та одночасно створює інструментальну музику, яка звучить під ним. За даними The Verge, два аудіошари генеруються разом, а не зшиваються після — це означає, що тайминг і динаміка музики формуються навколо мовлення з самого початку, а не додаються пізніше.
Ця відмінність важлива для тих, хто витрачав час на ручну синхронізацію озвучення з окремо згенерованою музичною підкладкою. Звичне тертя — налаштування темпу, обрізання пауз, підгонка фейдів — зникає, коли обидва елементи проходять єдиний цикл генерації.

Функція Speech від Suno генерує розмовне аудіо та фонову музику з єдиного текстового запиту, показано тут на прикладах виводу з відкритої бети.
Зображення: The Verge / The Verge AI
Стиль голосу в Suno Speech керується запитами, дотримуючись тієї самої логіки, що й музичний режим платформи. Опис «хрипкий, повільний оповідач» або «енергійний ведучий подкасту» формує результат так само, як вказівка «lo-fi хіп-хоп із меланхолійним піаніно» формує музичний трек. У поточній бета-версії немає клонування голосу із завантаженого зразка — голоси генеруються заново з опису, що дозволяє функції уникнути більш юридично складної території, яку займають інструменти клонування голосу.
Для авторів, які створюють ШІ-персонажів або сцени з озвученням, це значуща відправна точка: можна ітерувати голосову особистість лише через текст, без запису референсного аудіо або ліцензування конкретного голосу. Компроміс — менш точний контроль порівняно зі спеціалізованими платформами text-to-speech; відкрита таблиця лідерів TTS від Hugging Face порівнює кілька альтернатив, якщо пріоритетом є точна якість голосу.

Інтерфейс Speech від Suno дозволяє користувачам вводити сценарій або описовий запит для генерації озвученого треку з одночасною фоновою музикою.
Зображення: The Verge / The Verge AI
Найбільш очевидний сценарій використання — озвучення короткометражних відео: аудіопідкладка тривалістю від 30 до 90 секунд, яку автори зараз збирають, генеруючи музику в Suno (або конкуренті), генеруючи мовлення в окремому TTS-інструменті, а потім редагуючи обидва в DAW або відеоредакторі. Suno Speech стискає це до одного кроку.
Власне формулювання Suno, як повідомляє The Verge, обережне: «Музика завжди буде в основі того, що ми робимо» — сигналізуючи, що Speech є розширенням музичного продукту, а не переорієнтацією на загальний голосовий ШІ. Це формулювання також натякає, що функція буде налаштована під музичні контексти (вступи, треки з озвученням, пісні у форматі spoken-word), а не на виробництво довгих аудіокниг або подкастів.
Для авторів ШІ-зображень і відео, які вже використовують Suno для фонового аудіо, додавання синхронізованого озвучення усуває ще одну зовнішню залежність. Автор, який створює ШІ-нарований слайдшоу або анімований короткометражний фільм, тепер має реалістичний аудіопайплайн на одній платформі — генерувати голос і музику разом, експортувати та вставляти у відеоредактор.
Бета вже доступна на веб- і мобільних платформах. Як і з більшістю бета-версій Suno, якість виводу та обсяг функцій, ймовірно, зміняться до повного релізу — тому поточну версію варто протестувати на відповідність, але ще не варто перебудовувати навколо неї виробничий пайплайн.