Bronnen
Leer het vak
Stapsgewijze gidsen over prompts, stijlen en hoe je het meeste uit AI-beeldgeneratie haalt.
Lees de gidsen
Theo vertaalt AI-nieuws naar dingen die je vanavond nog kunt proberen.
Stapsgewijze gidsen over prompts, stijlen en hoe je het meeste uit AI-beeldgeneratie haalt.
Lees de gidsenKies een companion en ontdek wat die van dit verhaal vindt
Google heeft Gemini 3.5 Transcribe gelanceerd, een toegewijd spraak-naar-tekst-model dat automatisch stopwoordjes verwijdert, gespecialiseerd jargon herkent en meer dan 85 talen ondersteunt — veranderingen die er het meest toe doen als je al prompts inspreekt, creatieve sessies per stem bijhoudt of audio-gedreven pipelines bouwt.\n\n## Belangrijkste punten\n\n- Gemini 3.5 Transcribe is een nieuw, zelfstandig lid van de Gemini-modelfamilie, los van Gemini 3.5 Pro (nog niet uitgebracht) en het onlangs gelanceerde 3.5 Live Translate.\n- Het model bewerkt automatisch stopwoordjes weg — „ums", „ahs" en vergelijkbare verbale tics — wat zorgt voor schonere transcripties zonder handmatige bewerking.\n- Het detecteert gespecialiseerd jargon automatisch, wat betekent dat domeinspecifieke woordenschat (denk aan LoRA, inpainting of CFG scale) de transcriptie intact zou moeten overleven.\n- Ondersteuning omvat meer dan 85 talen, waarmee het een van Google's breedste meertalige spraakoplossingen is.\n- Dezelfde onderliggende AI drijft Gboard's Rambler-functie aan en breidt zich uit naar Chrome en andere Google-producten, aldus Ars Technica.\n\n## Waarom het verwijderen van stopwoordjes de functie is die je workflow verandert\n\nDe hoofdfunctie is niet het aantal talen — het is de automatische opschoning. Als je promptideeën dicteert, referentienotities opneemt terwijl je renders bekijkt, of spraak-naar-tekst gebruikt om een downstream tekstmodel te voeden, zijn ruwe transcripties doorgaans zo rommelig dat je er echte tijd aan kwijt bent om ze bruikbaar te maken. Gemini 3.5 Transcribe neemt die stap voor je over.\n\nEen concreet scenario: een conceptkunstenaar die een spraaknotitie van vijf minuten opneemt over de belichting, sfeer en karakterdetails van een scène, kan die audio nu rechtstreeks doorsturen naar een prompt-verfijningsstap zonder de transcriptie handmatig te moeten opschonen. De jargondetectie zorgt ervoor dat termen als „subsurface scattering" of „chromatic aberration" minder snel worden verminkt tot fonetische gissingen.\n\n\n\n## Waar 3.5 Transcribe nu past binnen de Gemini-familie\n\nVolgens The Verge volgt Gemini 3.5 Transcribe op 3.5 Live Translate — een realtime vertaalmodel — terwijl het meer verwachte Gemini 3.5 Pro nog niet is uitgebracht. Die volgorde vertelt je iets over Google's kortetermijnprioriteiten: audiobegrip wordt eerder uitgebracht dan de flagship-redeneerverbetering.\n\nVoor makers betekent dit dat de Gemini-audiostack merkbaar beter wordt voordat het kernmodel voor generatie bijtrekt. Als je evalueert via welke provider-API je spraakgedreven workflows wilt routeren, is de kloof in transcriptiekwaliteit tussen Gemini en concurrenten kleiner geworden — of juist groter in Google's voordeel, afhankelijk van je huidige setup.\n\n## Jargondetectie in de praktijk\n\nAutomatische jargondetectie is de stillere winst hier. Generieke spraak-naar-tekst-modellen die zijn getraind op brede corpora struikelen vaak over technische woordenschat — rendertermen, modelnamen of platformspecifieke taal die niet voorkomt in alledaagse spraakdata. Gemini 3.5 Transcribe is ontworpen om gespecialiseerde taal in context te herkennen, in plaats van je te dwingen een aangepaste woordenlijst bij te houden of elke sessie dezelfde foutieve transcriptie te corrigeren.\n\nAls je audiologs van een creatieve sessie batchgewijs verwerkt — bijvoorbeeld tijdgestempelde notities over welke generaties werkten en waarom — zorgt betere jargonverwerking ervoor dat die logs daadwerkelijk doorzoekbaar en bruikbaar zijn, in plaats van slechts een stapel fonetische benaderingen.\n\n## Uitrolpad: van Gboard naar Chrome en verder\n\nHet model drijft al Gboard's Rambler-dicteerfunctie aan en breidt zich uit naar Chrome en aanvullende Google-platforms. Die gefaseerde uitrol suggereert dat API-toegang voor ontwikkelaars en tools van derden zal volgen, hoewel Google geen specifieke tijdlijn heeft gegeven voor bredere beschikbaarheid. Makers die spraak-naar-prompt-tools of audio-annotatiepipelines bouwen, dienen de Google AI-ontwikkelaarskanalen in de gaten te houden voor details over API-toegang.\n\nVoor iedereen die al experimenteert met spraakgedreven promptworkflows in de Charmloop-generator is het koppelen van een schone transcriptielaag aan je bestaande proces een laagdrempelige upgrade die het waard is om te testen zodra de toegang opengaat. En als je nieuwer bent in het bouwen van promptpipelines, behandelt de gidssectie het structureren van prompts vanuit ruwe notities — precies het soort workflow waar een goed transcriptiemodel naadloos in past.