Fontes
Domine a arte
Guias passo a passo sobre prompts, estilos e como aproveitar ao máximo a geração de imagens com IA.
Ler os guias
Theo transforma as notícias de IA em coisas para você testar ainda hoje à noite.
Guias passo a passo sobre prompts, estilos e como aproveitar ao máximo a geração de imagens com IA.
Ler os guiasEscolha um companheiro e veja o que ele acha dessa história
O Google lançou o Gemini 3.5 Transcribe, um modelo dedicado de fala para texto que remove automaticamente palavras de preenchimento, detecta jargões especializados e suporta mais de 85 idiomas — mudanças que importam especialmente se você já narra prompts, registra sessões criativas por voz ou constrói pipelines orientados a áudio.
O recurso principal não é a quantidade de idiomas — é a limpeza automática. Se você dita ideias de prompts, grava notas de referência enquanto revisa renders ou usa voz para texto para alimentar um modelo de texto downstream, transcrições brutas geralmente são confusas o suficiente para que você gaste tempo real corrigindo-as antes de serem utilizáveis. O Gemini 3.5 Transcribe cuida dessa etapa por você.
Um cenário concreto: um artista conceitual que grava um áudio de cinco minutos descrevendo a iluminação, o clima e os detalhes dos personagens de uma cena pode agora enviar esse áudio diretamente para uma etapa de refinamento de prompt sem precisar limpar manualmente a transcrição. A detecção de jargões significa que termos como «subsurface scattering» ou «chromatic aberration» têm menos chance de serem distorcidos em aproximações fonéticas.

O Gemini 3.5 Transcribe é a mais recente adição à crescente família de modelos Gemini do Google.
Imagem: The Verge / The Verge AI
De acordo com The Verge, o Gemini 3.5 Transcribe segue o 3.5 Live Translate — um modelo de tradução em tempo real — enquanto o mais aguardado Gemini 3.5 Pro ainda não foi lançado. Essa sequência revela algo sobre as prioridades de curto prazo do Google: a compreensão de áudio está sendo lançada antes da atualização principal de raciocínio.
Para criadores, isso significa que a pilha de áudio do Gemini está melhorando de forma significativa antes que o modelo de geração principal se atualize. Se você está avaliando qual API de provedor usar para rotear fluxos de trabalho orientados a voz, a diferença de qualidade de transcrição entre o Gemini e os concorrentes acabou de diminuir — ou aumentou a favor do Google, dependendo da sua configuração atual.
A detecção automática de jargões é a vitória mais silenciosa aqui. Modelos genéricos de fala para texto treinados em corpora amplos frequentemente tropeçam em vocabulário técnico — termos de renderização, nomes de modelos ou linguagem específica de plataforma que não aparece nos dados de fala cotidiana. O Gemini 3.5 Transcribe foi projetado para reconhecer linguagem especializada em contexto, em vez de forçar você a manter uma lista de vocabulário personalizado ou corrigir a mesma transcrição errada a cada sessão.
Se você processa em lote logs de áudio de uma sessão criativa — digamos, notas com timestamp sobre quais gerações funcionaram e por quê — um tratamento mais limpo de jargões significa que esses logs são realmente pesquisáveis e úteis downstream, e não apenas um monte de aproximações fonéticas.
O modelo já alimenta o recurso de ditado Rambler do Gboard e está se expandindo para o Chrome e outras superfícies do Google. Esse lançamento gradual sugere que o acesso à API para desenvolvedores e ferramentas de terceiros virá a seguir, embora o Google não tenha dado um prazo específico para disponibilidade mais ampla. Criadores que constroem ferramentas de voz para prompt ou pipelines de anotação de áudio devem acompanhar os canais de desenvolvedores do Google AI para detalhes sobre acesso à API.
Para quem já experimenta fluxos de trabalho de prompt orientados a voz no gerador da Charmloop, adicionar uma camada de transcrição limpa ao seu processo existente é uma atualização de baixo atrito que vale a pena testar assim que o acesso for liberado. E se você é mais novo na construção de pipelines de prompt, a seção de guias cobre como estruturar prompts a partir de notas brutas — exatamente o tipo de fluxo de trabalho em que um bom modelo de transcrição se encaixa diretamente.