Fuentes
Aprende el oficio
Guías paso a paso sobre prompts, estilos y cómo sacar el máximo partido a la generación de imágenes con IA.
Leer las guías
Theo convierte las noticias de IA en cosas que puedes probar esta misma noche.
Guías paso a paso sobre prompts, estilos y cómo sacar el máximo partido a la generación de imágenes con IA.
Leer las guíasElige un compañero y descubre su opinión sobre esta noticia
Google ha lanzado Gemini 3.5 Transcribe, un modelo de voz a texto dedicado que elimina automáticamente las muletillas, detecta jerga especializada y admite más de 85 idiomas: cambios que importan especialmente si ya narras prompts, registras sesiones creativas por voz o construyes pipelines impulsados por audio.
La capacidad principal no es el número de idiomas, sino la limpieza automática. Si dictas ideas de prompts, grabas notas de referencia mientras revisas renders o usas voz a texto para alimentar un modelo de texto posterior, las transcripciones en bruto suelen estar lo suficientemente desordenadas como para que pierdas tiempo real corrigiéndolas antes de que sean utilizables. Gemini 3.5 Transcribe se encarga de ese paso por ti.
Un escenario concreto: un artista conceptual que graba una nota de voz de cinco minutos describiendo la iluminación, el ambiente y los detalles de los personajes de una escena puede ahora enviar ese audio directamente a un paso de refinamiento de prompts sin limpiar manualmente la transcripción. La detección de jerga significa que términos como «subsurface scattering» o «chromatic aberration» tienen menos probabilidades de convertirse en aproximaciones fonéticas irreconocibles.

Gemini 3.5 Transcribe es la última incorporación a la creciente familia de modelos Gemini de Google.
Imagen: The Verge / The Verge AI
Según The Verge, Gemini 3.5 Transcribe sigue a 3.5 Live Translate —un modelo de traducción en tiempo real— mientras que el más esperado Gemini 3.5 Pro sigue sin lanzarse. Esa secuencia dice algo sobre las prioridades a corto plazo de Google: la comprensión de audio se está lanzando antes que la actualización insignia de razonamiento.
Para los creadores, esto significa que la pila de audio de Gemini mejora de forma significativa antes de que el modelo de generación principal se ponga al día. Si estás evaluando a través de qué API de proveedor enrutar los flujos de trabajo impulsados por voz, la brecha de calidad de transcripción entre Gemini y sus competidores acaba de reducirse —o de ampliarse a favor de Google, según tu configuración actual.
La detección automática de jerga es la victoria más silenciosa aquí. Los modelos genéricos de voz a texto entrenados en corpus amplios suelen tropezar con el vocabulario técnico: términos de renderizado, nombres de modelos o lenguaje específico de plataformas que no aparece en los datos de habla cotidiana. Gemini 3.5 Transcribe está diseñado para reconocer lenguaje especializado en contexto, en lugar de obligarte a mantener una lista de vocabulario personalizado o corregir la misma transcripción errónea en cada sesión.
Si procesas por lotes registros de audio de una sesión creativa —por ejemplo, notas con marca de tiempo sobre qué generaciones funcionaron y por qué— un manejo más limpio de la jerga significa que esos registros son realmente buscables y útiles más adelante, no solo un montón de aproximaciones fonéticas.
El modelo ya impulsa la función de dictado Rambler de Gboard y se está expandiendo a Chrome y otras superficies de Google. Ese despliegue por etapas sugiere que el acceso a la API para desarrolladores y herramientas de terceros llegará después, aunque Google no ha dado un calendario específico para una disponibilidad más amplia. Los creadores que construyen herramientas de voz a prompt o pipelines de anotación de audio deberían seguir los canales de desarrolladores de Google AI para obtener detalles sobre el acceso a la API.
Para quienes ya experimentan con flujos de trabajo de prompts por voz en el generador de Charmloop, añadir una capa de transcripción limpia a tu proceso existente es una mejora de bajo esfuerzo que vale la pena probar cuando el acceso esté disponible. Y si eres nuevo en la construcción de pipelines de prompts, la sección de guías cubre cómo estructurar prompts a partir de notas en bruto: exactamente el tipo de flujo de trabajo en el que un buen modelo de transcripción encaja directamente.