Источники
Освой мастерство
Пошаговые гайды о промптах, стилях и о том, как выжать максимум из генерации изображений ИИ.
Читать гайды
Тео превращает новости об ИИ в то, что можно попробовать уже сегодня вечером.
Пошаговые гайды о промптах, стилях и о том, как выжать максимум из генерации изображений ИИ.
Читать гайдыВыбери компаньона и узнай его мнение об этой истории
Google выпустила Gemini 3.5 Transcribe — специализированную модель преобразования речи в текст, которая автоматически удаляет слова-паразиты, распознаёт специализированный жаргон и поддерживает более 85 языков. Эти изменения особенно важны, если вы уже надиктовываете промпты, ведёте голосовые записи творческих сессий или строите аудиоуправляемые пайплайны.
Главная возможность — не количество языков, а автоматическая очистка. Если вы надиктовываете идеи промптов, записываете справочные заметки при просмотре рендеров или используете голос для передачи текста в downstream-модель, сырые транскрипты обычно настолько захламлены, что вы тратите реальное время на их исправление, прежде чем они становятся пригодными к использованию. Gemini 3.5 Transcribe берёт этот проход на себя.
Конкретный сценарий: концепт-художник, записывающий пятиминутное голосовое сообщение с описанием освещения сцены, настроения и деталей персонажа, теперь может напрямую передать это аудио на этап уточнения промпта без ручной чистки транскрипта. Распознавание жаргона означает, что термины вроде «subsurface scattering» или «chromatic aberration» с меньшей вероятностью превратятся в фонетические догадки.

Gemini 3.5 Transcribe — последнее дополнение к расширяющемуся семейству моделей Google Gemini.
Изображение: The Verge / The Verge AI
По данным The Verge, Gemini 3.5 Transcribe выходит вслед за 3.5 Live Translate — моделью перевода в реальном времени, — тогда как более ожидаемый Gemini 3.5 Pro по-прежнему не выпущен. Эта последовательность говорит кое-что о краткосрочных приоритетах Google: понимание аудио выходит раньше флагманского обновления рассуждений.
Для авторов это означает, что аудиостек Gemini становится заметно лучше ещё до того, как подтянется основная модель генерации. Если вы оцениваете, через API какого провайдера направлять голосовые рабочие процессы, разрыв в качестве транскрипции между Gemini и конкурентами только что сократился — или расширился в пользу Google, в зависимости от вашей текущей конфигурации.
Автоматическое распознавание жаргона — более тихая победа. Универсальные модели преобразования речи в текст, обученные на широких корпусах, нередко спотыкаются на технической лексике — терминах рендеринга, названиях моделей или платформенном языке, который не встречается в повседневных речевых данных. Gemini 3.5 Transcribe разработана для распознавания специализированного языка в контексте, а не для того, чтобы вы вели собственный словарь или исправляли одни и те же ошибки транскрипции каждую сессию.
Если вы пакетно обрабатываете аудиозаписи творческой сессии — например, заметки с временными метками о том, какие генерации сработали и почему, — более чистая обработка жаргона означает, что эти записи действительно доступны для поиска и полезны в дальнейшем, а не просто груда фонетических приближений.
Модель уже лежит в основе функции диктовки Rambler в Gboard и расширяется на Chrome и другие поверхности Google. Такое поэтапное развёртывание предполагает, что доступ через API для разработчиков и сторонних инструментов последует, хотя Google не назвала конкретных сроков более широкой доступности. Авторам, создающим инструменты голос-в-промпт или пайплайны аудиоаннотации, стоит следить за каналами для разработчиков Google AI для получения подробностей о доступе к API.
Для тех, кто уже экспериментирует с голосовыми рабочими процессами промптов в генераторе Charmloop, добавление чистого слоя транскрипции к существующему процессу — это малозатратное обновление, которое стоит протестировать по мере открытия доступа. А если вы только начинаете строить пайплайны промптов, раздел руководств охватывает структурирование промптов из черновых заметок — именно тот тип рабочего процесса, в который хорошая модель транскрипции вписывается напрямую.