Джерела
Опануй майстерність
Покрокові гайди про промпти, стилі та те, як вичавити максимум із генерації зображень ШІ.
Читати гайди
Тео перетворює новини про ШІ на те, що можна спробувати вже сьогодні ввечері.
Покрокові гайди про промпти, стилі та те, як вичавити максимум із генерації зображень ШІ.
Читати гайдиОбери компаньйона і дізнайся його думку про цю історію
Google запустила Gemini 3.5 Transcribe — спеціалізовану модель перетворення мовлення на текст, яка автоматично видаляє слова-паразити, розпізнає спеціалізований жаргон і підтримує понад 85 мов. Ці зміни найбільше важливі для тих, хто вже диктує промпти, веде голосові нотатки творчих сесій або будує аудіо-орієнтовані пайплайни.
Головна можливість — не кількість мов, а автоматичне очищення. Якщо ви диктуєте ідеї промптів, записуєте довідкові нотатки під час перегляду рендерів або використовуєте голос-у-текст для передачі даних у текстову модель нижче за потоком, сирі транскрипти зазвичай настільки захаращені, що ви витрачаєте реальний час на їх виправлення перед використанням. Gemini 3.5 Transcribe бере цей прохід на себе.
Конкретний сценарій: концепт-художник, який записує п'ятихвилинний голосовий меморандум із описом освітлення сцени, настрою та деталей персонажів, тепер може передати цей аудіозапис безпосередньо на етап уточнення промпту без ручного очищення транскрипту. Розпізнавання жаргону означає, що терміни на кшталт «підповерхневе розсіювання» або «хроматична аберація» з меншою ймовірністю перетворяться на фонетичні здогадки.

Gemini 3.5 Transcribe — найновіше доповнення до розширеного сімейства моделей Gemini від Google.
Зображення: The Verge / The Verge AI
За даними The Verge, Gemini 3.5 Transcribe виходить слідом за 3.5 Live Translate — моделлю перекладу в реальному часі, — тоді як більш очікуваний Gemini 3.5 Pro залишається невипущеним. Така послідовність говорить про короткострокові пріоритети Google: розуміння аудіо виходить раніше за флагманське оновлення логічного мислення.
Для авторів це означає, що аудіостек Gemini стає помітно кращим ще до того, як наздожене основна модель генерації. Якщо ви оцінюєте, через API якого провайдера маршрутизувати голосові робочі процеси, розрив у якості транскрипції між Gemini і конкурентами щойно скоротився — або розширився на користь Google, залежно від вашого поточного налаштування.
Автоматичне розпізнавання жаргону — тихіша перемога тут. Загальні моделі перетворення мовлення на текст, навчені на широких корпусах, часто спотикаються на технічній лексиці — термінах рендерингу, назвах моделей або платформо-специфічній мові, яка не зустрічається в повсякденних мовленнєвих даних. Gemini 3.5 Transcribe розроблена для розпізнавання спеціалізованої мови в контексті, а не для того, щоб змушувати вас підтримувати власний словник або виправляти одні й ті самі помилки транскрипції щосесії.
Якщо ви пакетно обробляєте аудіожурнали творчої сесії — скажімо, позначені часом нотатки про те, які генерації спрацювали і чому, — чистіша обробка жаргону означає, що ці журнали справді доступні для пошуку та корисні далі за потоком, а не просто купа фонетичних наближень.
Модель вже живить функцію диктування Rambler у Gboard і розширюється на Chrome та інші поверхні Google. Таке поетапне розгортання припускає, що доступ до API для розробників і сторонніх інструментів з'явиться пізніше, хоча Google не назвала конкретних термінів для ширшої доступності. Авторам, які створюють інструменти голос-у-промпт або пайплайни аудіоанотацій, варто стежити за каналами для розробників Google AI щодо деталей доступу до API.
Для тих, хто вже експериментує з голосовими робочими процесами промптів у генераторі Charmloop, додавання чистого шару транскрипції до наявного процесу — це малозатратне оновлення, варте тестування в міру відкриття доступу. А якщо ви тільки починаєте будувати пайплайни промптів, розділ гайдів охоплює структурування промптів із чорнових нотаток — саме той тип робочого процесу, у який хороша модель транскрипції вписується безпосередньо.