出典
このニュースについて話す相手
コンパニオンを選んで、この話題についての感想を聞いてみましょう

TheoはAIニュースを、今夜すぐ試せるテクニックに変えます。
コンパニオンを選んで、この話題についての感想を聞いてみましょう
Amazon Prime Videoは、画面上の俳優の口の動きを人間が吹き替えた音声に合わせてデジタルで変形させるAIリップシンク機能を開始した——まずはドイツのロマンティックドラマ『Maxton Hall』の英語吹き替え版からのスタートだ。

Maxton HallはAIリップシンク吹き替えが英語版に適用された初のPrime Videoタイトルとなった。
従来の吹き替えには目に見えるズレが残る。俳優の唇はドイツ語の音節を形成しているのに、サウンドトラックは英語を届けており、脳はそのミスマッチを数秒以内に検知してしまう。Prime Videoのシステムはそのズレを映像レイヤーで解消する。人間の声優のパフォーマンスには一切手を加えず、口の形状を変形させることで置き換えた音素に合わせるのだ。うまく機能すれば、視聴者が母国語のコンテンツに期待するシームレスなシンクに近い結果が得られる。
ここではパイプラインについて正確に理解しておく価値がある。音声トラックは依然として人間の吹き替え声優が収録しており、Prime Videoは合成音声を生成しているわけではない。AIの処理はポストプロダクションの映像処理にのみ存在する。吹き替え音声の音素タイミングを解析し、元の映像の口の領域をそれに合わせて変形させるのだ。これは、大規模な予算のプロダクションで視覚効果スタジオが手作業で行う口部置換作業を、ターゲットを絞って自動化したものと考えればよい——それをストリーミング規模で適用している。
AI映像クリエイターにとって、この区別は実践的に重要だ。このようなツールは本質的に、既存の映像に対して動作する口部リターゲティングモデルであり、オープンソースの映像パイプラインにすでに登場しているフェイスリエナクトメントやリップシンクのノードと重なる技術だ。Adobe PremiereのGenerative Mediaフィーチャーやスタンドアロンのリエナクトメントモデルでリップシンクレイヤーを試したことがあるなら、Prime Videoの展開は同じクラスの技術であり、ただ放送グレードのパイプライン上で人間の音声をドライバーとして動作しているに過ぎない。
現時点では、この機能は単一タイトルの実験だ。Prime Videoは次にどの番組が対象になるか、またそのタイムラインも明らかにしていない。正直なところ、現状はこうだ。英語吹き替えのドイツのロマコメ1作品に、漠然とした拡大の約束があるだけだ。
限定的なローンチはキャリブレーションの動きとして理にかなっている。リップシンクの品質は視聴者が判断するのが非常に容易であり、俳優がゴム製のように見えるような過剰補正があれば即座に反発を招く。すでに熱心な国際的視聴者を持つシリーズから始めることで、Amazonは比較的限られたリスクで実世界のテストベッドを得られる。

Prime Videoは、強力な国際的ファンを持つドイツのシリーズMaxton HallをAIリップシンク展開のテストベッドとして選んだ。
AI生成クリップを第二言語に吹き替えるボイスオーバーアーティストなど、多言語映像コンテンツを制作するクリエイターにとって、これは自動化された口部リターゲティングが研究デモから本番パイプラインへと急速に移行していることを示すシグナルだ。「Prime Videoにできること」と「プラグインにできること」のギャップは2年間縮まり続けている。すでにキャラクターアニメーションを生成してセリフをレイヤリングしているなら、オープンソースの口部リターゲティングモデルに注目しておくことが実践的な次のステップだ。その基礎技術はもはや珍しいものではない。
Prime Videoの動きはまた、より広いパターンを裏付けている。映像制作におけるAI統合で最も持続性があるのは、人間のクリエイティブな作業——ここでは声優のパフォーマンス——を中心に置き、AIが機械的な整合問題を処理するものだ。これは、自分のワークフローにおいてどこに生成を適用し、どこに自動化を適用するかを決める際の有用なフレームワークとなる。