
TheoはAIニュースを、今夜すぐ試せるテクニックに変えます。
コンパニオンを選んで、この話題についての感想を聞いてみましょう

Googleは専用の音声テキスト変換モデル「Gemini 3.5 Transcribe」をリリースした。フィラーワードの自動除去、専門用語の検出、85以上の言語のサポートを備えており——プロンプトを音声で入力したり、クリエイティブセッションを音声でログに残したり、音声駆動のパイプラインを構築しているユーザーにとって特に重要な変更点だ。
注目すべき機能は言語数ではなく、自動クリーンアップだ。プロンプトのアイデアをディクテーションしたり、レンダリングを確認しながら参考メモを録音したり、音声テキスト変換で下流のテキストモデルに入力したりする場合、生のトランスクリプトは大抵散らかっており、使える状態にするまでに相当な時間がかかる。Gemini 3.5 Transcribeはその作業を代わりに行ってくれる。
具体的なシナリオとして:シーンのライティング、ムード、キャラクターの詳細を説明する5分間のボイスメモを録音したコンセプトアーティストが、トランスクリプトを手動で修正することなく、その音声をプロンプト精製ステップに直接パイプできるようになる。専門用語検出により、「サブサーフェス・スキャタリング」や「色収差」といった用語が音声的な当て推量に変換されてしまうリスクも低減される。

Gemini 3.5 TranscribeはGoogleの拡大するGeminiモデルファミリーへの最新追加だ。
The Vergeによると、Gemini 3.5 Transcribeはリアルタイム翻訳モデルの3.5 Live Translateに続くリリースであり、より広く期待されているGemini 3.5 Proはまだ未リリースだ。このシーケンスはGoogleの近期優先事項を示している:音声理解が、フラッグシップの推論アップグレードより先に出荷されているのだ。
クリエイターにとって、これはコア生成モデルが追いつく前にGeminiの音声スタックが着実に改善されていることを意味する。音声駆動のワークフローをどのプロバイダーのAPIにルーティングするか評価しているなら、Geminiとライバルのトランスクリプションクオリティのギャップはちょうど縮まった——あるいは現在の環境によっては、Googleに有利な方向で広がったと言えるかもしれない。
自動専門用語検出は、より静かな勝利だ。広範なコーパスで学習した汎用音声テキスト変換モデルは、日常の音声データには登場しないレンダリング用語、モデル名、プラットフォーム固有の言語といった技術的語彙でつまずくことが多い。Gemini 3.5 Transcribeは、カスタム語彙リストの管理やセッションごとの同じ誤変換の修正を強いることなく、文脈の中で専門用語を認識するよう設計されている。
クリエイティブセッションの音声ログ——たとえば、どの生成結果がうまくいったかとその理由についてのタイムスタンプ付きメモ——をバッチ処理する場合、専門用語の処理が改善されることで、それらのログが実際に検索可能で下流でも役立つものになり、単なる音声近似の山にならずに済む。
このモデルはすでにGboardのRamblerディクテーション機能を動かしており、ChromeやほかのGoogle製品にも展開が拡大している。この段階的なロールアウトは、開発者やサードパーティツール向けのAPIアクセスも続くことを示唆しているが、Googleは広範な提供開始の具体的なタイムラインを示していない。音声からプロンプトへのツールや音声アノテーションパイプラインを構築しているクリエイターは、APIアクセスの詳細についてGoogle AI開発者チャンネルを注視すべきだ。
Charmloopジェネレーターで音声駆動のプロンプトワークフローをすでに試している方にとって、クリーンなトランスクリプションレイヤーを既存のプロセスに組み合わせることは、アクセスが開放され次第試す価値のある低摩擦なアップグレードだ。プロンプトパイプラインの構築が初めての方は、ガイドセクションでラフなメモからプロンプトを構造化する方法を解説している——優れたトランスクリプションモデルが直接組み込まれるようなワークフローだ。