Źródła
Opanuj rzemiosło
Poradniki krok po kroku o promptach, stylach i tym, jak wycisnąć maksimum z generowania obrazów AI.
Czytaj poradniki
Theo zamienia newsy o AI w rzeczy, które wypróbujesz jeszcze dziś wieczorem.
Poradniki krok po kroku o promptach, stylach i tym, jak wycisnąć maksimum z generowania obrazów AI.
Czytaj poradnikiWybierz towarzysza i poznaj jego zdanie na temat tej historii
Google uruchomił Gemini 3.5 Transcribe — dedykowany model zamiany mowy na tekst, który automatycznie usuwa słowa-wypełniacze, wykrywa specjalistyczny żargon i obsługuje ponad 85 języków. To zmiany, które mają największe znaczenie, jeśli już teraz dyktuje się prompty, rejestruje sesje twórcze głosem lub buduje potoki oparte na dźwięku.\n\n## Najważniejsze informacje\n\n- Gemini 3.5 Transcribe to nowy, samodzielny członek rodziny modeli Gemini, odrębny od Gemini 3.5 Pro (wciąż niepublikowanego) i niedawno uruchomionego 3.5 Live Translate.\n- Model automatycznie wycina słowa-wypełniacze — „yyy", „eee" i podobne werbalne nawyki — tworząc czystsze transkrypcje bez ręcznej edycji.\n- Automatycznie wykrywa specjalistyczny żargon, co oznacza, że słownictwo branżowe (np. LoRA, inpainting czy CFG scale) powinno przetrwać transkrypcję w niezmienionej formie.\n- Obsługa obejmuje ponad 85 języków, co czyni go jedną z najszerszych wielojęzycznych ofert mowy Google.\n- Ta sama technologia AI zasila funkcję Rambler w Gboard i jest rozszerzana na Chrome oraz inne produkty Google, jak podaje Ars Technica.\n\n## Dlaczego usuwanie słów-wypełniaczy zmienia Twój przepływ pracy\n\nGłówną funkcją nie jest liczba obsługiwanych języków — lecz automatyczne porządkowanie tekstu. Jeśli dyktuje się pomysły na prompty, nagrywa notatki referencyjne podczas przeglądania renderów lub używa zamiany głosu na tekst do zasilania modelu tekstowego, surowe transkrypcje są zazwyczaj na tyle zaśmiecone, że trzeba poświęcić realny czas na ich poprawienie, zanim staną się użyteczne. Gemini 3.5 Transcribe wykonuje ten krok za Ciebie.\n\nKonkretny scenariusz: artysta koncepcyjny, który nagrywa pięciominutową notatkę głosową opisującą oświetlenie sceny, nastrój i szczegóły postaci, może teraz przesłać ten dźwięk bezpośrednio do etapu dopracowywania promptu bez ręcznego czyszczenia transkrypcji. Wykrywanie żargonu oznacza, że terminy takie jak „subsurface scattering" czy „chromatic aberration" rzadziej zostaną zniekształcone w fonetyczne zgadywanki.\n\n\n\n## Gdzie 3.5 Transcribe plasuje się w rodzinie Gemini\n\nWedług The Verge Gemini 3.5 Transcribe następuje po 3.5 Live Translate — modelu tłumaczenia w czasie rzeczywistym — podczas gdy szerzej wyczekiwany Gemini 3.5 Pro pozostaje niepublikowany. Ta kolejność mówi coś o krótkoterminowych priorytetach Google: rozumienie dźwięku trafia do użytkowników przed flagową aktualizacją rozumowania.\n\nDla twórców oznacza to, że stos audio Gemini staje się znacząco lepszy, zanim dogoni go główny model generatywny. Jeśli oceniasz, przez API którego dostawcy kierować przepływy pracy oparte na głosie, luka w jakości transkrypcji między Gemini a konkurencją właśnie się zmniejszyła — lub poszerzyła na korzyść Google, w zależności od Twojej obecnej konfiguracji.\n\n## Wykrywanie żargonu w praktyce\n\nAutomatyczne wykrywanie żargonu to cichszy sukces tego modelu. Ogólne modele zamiany mowy na tekst, trenowane na szerokich korpusach, często potykają się o słownictwo techniczne — terminy renderowania, nazwy modeli czy język specyficzny dla platform, który nie pojawia się w codziennych danych mowy. Gemini 3.5 Transcribe jest zaprojektowany tak, by rozpoznawać specjalistyczny język w kontekście, zamiast zmuszać użytkownika do utrzymywania własnej listy słownictwa lub poprawiania tych samych błędów transkrypcji w każdej sesji.\n\nJeśli przetwarza się wsadowo logi audio z sesji twórczej — powiedzmy, opatrzone znacznikami czasu notatki o tym, które generacje się sprawdziły i dlaczego — czystsze obsługiwanie żargonu sprawia, że te logi są naprawdę przeszukiwalne i użyteczne dalej w potoku, a nie tylko stosem fonetycznych przybliżeń.\n\n## Ścieżka wdrożenia: od Gboard do Chrome i dalej\n\nModel już zasila funkcję dyktowania Rambler w Gboard i jest rozszerzany na Chrome oraz kolejne powierzchnie Google. To etapowe wdrożenie sugeruje, że dostęp przez API dla deweloperów i narzędzi zewnętrznych nastąpi w ślad za tym, choć Google nie podał konkretnego harmonogramu szerszej dostępności. Twórcy budujący narzędzia do zamiany głosu na prompt lub potoki adnotacji audio powinni śledzić kanały dla deweloperów Google AI w poszukiwaniu szczegółów dotyczących dostępu do API.\n\nDla każdego, kto już eksperymentuje z przepływami pracy opartymi na głosie w generatorze Charmloop, dodanie czystej warstwy transkrypcji do istniejącego procesu to niskokosztowe usprawnienie warte przetestowania, gdy dostęp się otworzy. A jeśli dopiero zaczynasz budować potoki promptów, sekcja przewodników omawia strukturyzowanie promptów z surowych notatek — właśnie ten rodzaj przepływu pracy, w który dobry model transkrypcji wpisuje się bezpośrednio.