Sources
Maîtrisez l’art IA
Des guides pas à pas sur les prompts, les styles et comment tirer le meilleur de la génération d’images par IA.
Lire les guides
Theo transforme l'actualité de l'IA en choses à essayer dès ce soir.
Des guides pas à pas sur les prompts, les styles et comment tirer le meilleur de la génération d’images par IA.
Lire les guidesChoisissez un compagnon et découvrez son avis sur cette histoire
Google a lancé Gemini 3.5 Transcribe, un modèle de reconnaissance vocale dédié qui supprime automatiquement les mots de remplissage, détecte le jargon spécialisé et prend en charge plus de 85 langues — des changements qui comptent surtout si vous dictez déjà des prompts, enregistrez vos sessions créatives par la voix ou construisez des pipelines pilotés par l'audio.
La capacité phare n'est pas le nombre de langues — c'est le nettoyage automatique. Si vous dictez des idées de prompts, enregistrez des notes de référence en examinant des rendus ou utilisez la dictée vocale pour alimenter un modèle de texte en aval, les transcriptions brutes sont généralement assez encombrées pour que vous passiez un temps réel à les corriger avant de pouvoir les utiliser. Gemini 3.5 Transcribe gère cette étape à votre place.
Un scénario concret : un concept artist qui enregistre un mémo vocal de cinq minutes décrivant l'éclairage, l'ambiance et les détails des personnages d'une scène peut désormais injecter cet audio directement dans une étape de raffinement de prompt sans nettoyer manuellement la transcription. La détection du jargon signifie que des termes comme « subsurface scattering » ou « chromatic aberration » ont moins de chances d'être déformés en approximations phonétiques.

Gemini 3.5 Transcribe est le dernier ajout à la famille de modèles Gemini en pleine expansion de Google.
Image : The Verge / The Verge AI
Selon The Verge, Gemini 3.5 Transcribe succède à 3.5 Live Translate — un modèle de traduction en temps réel — tandis que le très attendu Gemini 3.5 Pro reste inédit. Cette séquence en dit long sur les priorités à court terme de Google : la compréhension audio est déployée avant la mise à niveau phare du raisonnement.
Pour les créateurs, cela signifie que la pile audio Gemini s'améliore sensiblement avant que le modèle de génération principal ne la rattrape. Si vous évaluez quel fournisseur d'API utiliser pour router vos workflows vocaux, l'écart de qualité de transcription entre Gemini et ses concurrents vient de se réduire — ou de s'élargir en faveur de Google, selon votre configuration actuelle.
La détection automatique du jargon est la victoire discrète ici. Les modèles de reconnaissance vocale génériques entraînés sur de larges corpus trébuchent souvent sur le vocabulaire technique — termes de rendu, noms de modèles ou langage propre à une plateforme qui n'apparaît pas dans les données de parole quotidienne. Gemini 3.5 Transcribe est conçu pour reconnaître le langage spécialisé en contexte plutôt que de vous obliger à maintenir une liste de vocabulaire personnalisée ou à corriger les mêmes erreurs de transcription à chaque session.
Si vous traitez par lots des journaux audio d'une session créative — par exemple, des notes horodatées sur les générations qui ont fonctionné et pourquoi — une meilleure gestion du jargon signifie que ces journaux sont réellement consultables et utiles en aval, et non pas simplement un tas d'approximations phonétiques.
Le modèle alimente déjà la fonctionnalité de dictée Rambler de Gboard et s'étend à Chrome et à d'autres surfaces Google. Ce déploiement progressif laisse entendre que l'accès API pour les développeurs et les outils tiers suivra, bien que Google n'ait pas donné de calendrier précis pour une disponibilité plus large. Les créateurs qui construisent des outils de voix-vers-prompt ou des pipelines d'annotation audio devraient surveiller les canaux développeurs Google AI pour les détails d'accès à l'API.
Pour quiconque expérimente déjà des workflows de prompts pilotés par la voix dans le générateur Charmloop, associer une couche de transcription propre à votre processus existant est une mise à niveau à faible friction qui vaut la peine d'être testée dès que l'accès s'ouvre. Et si vous débutez dans la construction de pipelines de prompts, la section guides couvre la structuration des prompts à partir de notes brutes — exactement le type de workflow dans lequel un bon modèle de transcription s'intègre directement.