
Theo는 AI 뉴스를 오늘 밤 바로 시도해볼 수 있는 것들로 바꿔 드립니다.
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요

Google이 Gemini 3.5 Transcribe를 출시했습니다. 군더더기 단어를 자동으로 제거하고, 전문 용어를 감지하며, 85개 이상의 언어를 지원하는 전용 음성-텍스트 변환 모델입니다 — 이미 프롬프트를 음성으로 입력하거나, 창작 세션을 음성으로 기록하거나, 오디오 기반 파이프라인을 구축하고 있다면 특히 주목할 만한 변화입니다.
핵심 기능은 언어 수가 아니라 자동 정리입니다. 프롬프트 아이디어를 받아쓰거나, 렌더링 결과를 검토하면서 참고 메모를 녹음하거나, 음성-텍스트 변환으로 다운스트림 텍스트 모델에 입력을 제공한다면, 원시 전사본은 대개 너무 지저분해서 실제로 사용하기 전에 수정하는 데 상당한 시간을 소비하게 됩니다. Gemini 3.5 Transcribe가 그 과정을 대신 처리해 줍니다.
구체적인 시나리오: 장면의 조명, 분위기, 캐릭터 세부 사항을 묘사하는 5분짜리 음성 메모를 녹음하는 컨셉 아티스트는 이제 전사본을 수동으로 정리하지 않고도 해당 오디오를 프롬프트 정제 단계로 바로 연결할 수 있습니다. 전문 용어 감지 덕분에 「서브서피스 스캐터링」이나 「색수차」 같은 용어가 음성 추측으로 뭉개질 가능성도 줄어듭니다.

Gemini 3.5 Transcribe는 Google의 확장되는 Gemini 모델 패밀리의 최신 추가 모델입니다.
The Verge에 따르면, Gemini 3.5 Transcribe는 실시간 번역 모델인 3.5 Live Translate에 이어 출시되었으며, 더 많은 기대를 받고 있는 Gemini 3.5 Pro는 아직 출시되지 않았습니다. 이 순서는 Google의 단기 우선순위에 대해 시사하는 바가 있습니다. 오디오 이해 기능이 플래그십 추론 업그레이드보다 먼저 출시되고 있다는 점입니다.
크리에이터 입장에서는, 핵심 생성 모델이 따라오기 전에 Gemini 오디오 스택이 의미 있게 개선되고 있다는 뜻입니다. 음성 기반 워크플로를 어느 공급자의 API로 연결할지 평가 중이라면, Gemini와 경쟁사 간의 전사 품질 격차가 좁혀졌거나 — 현재 설정에 따라 — Google에 유리하게 벌어졌을 수 있습니다.
자동 전문 용어 감지는 조용한 승리입니다. 광범위한 코퍼스로 훈련된 일반 음성-텍스트 변환 모델은 일상적인 음성 데이터에 등장하지 않는 렌더링 용어, 모델 이름, 플랫폼 특화 언어 같은 기술 어휘에서 자주 실수를 범합니다. Gemini 3.5 Transcribe는 커스텀 어휘 목록을 유지하거나 매 세션마다 동일한 오류를 수정하도록 강요하는 대신, 문맥 속에서 전문 언어를 인식하도록 설계되었습니다.
창작 세션의 오디오 로그를 일괄 처리하는 경우 — 예를 들어 어떤 생성 결과가 효과적이었고 그 이유가 무엇인지에 대한 타임스탬프 메모 — 전문 용어 처리가 깔끔해지면 해당 로그가 실제로 검색 가능하고 다운스트림에서 유용하게 활용됩니다. 단순한 음성 근사치 더미가 아니라요.
이 모델은 이미 Gboard의 Rambler 받아쓰기 기능을 구동하고 있으며 Chrome 및 추가적인 Google 서비스로 확장되고 있습니다. 이 단계적 출시는 개발자 및 서드파티 도구를 위한 API 접근이 뒤따를 것임을 시사하지만, Google은 광범위한 가용성에 대한 구체적인 일정을 밝히지 않았습니다. 음성-프롬프트 도구나 오디오 주석 파이프라인을 구축하는 크리에이터는 API 접근 세부 사항을 위해 Google AI 개발자 채널을 주시해야 합니다.
Charmloop 생성기에서 이미 음성 기반 프롬프트 워크플로를 실험하고 있다면, 깔끔한 전사 레이어를 기존 프로세스와 결합하는 것은 접근이 열리는 대로 시도해 볼 만한 저마찰 업그레이드입니다. 프롬프트 파이프라인 구축이 처음이라면, 가이드 섹션에서 거친 메모로부터 프롬프트를 구조화하는 방법을 다루고 있습니다 — 바로 훌륭한 전사 모델이 직접 연결되는 종류의 워크플로입니다.