- Gemini 3.8 Liveに映像生成と音声を組み合わせたアバター機能が追加された
- 97言語をまたぐ切替と、対話を止めない裏側処理が特徴
- 生成物には検出用の電子透かしSynthIDが付与される
Google DeepMindは2026年9月24日、対話AI「Gemini 3.8 Live」に視覚的なアバターを重ねる新機能「Live Avatar」を発表した。前週にローンチされたばかりのGemini 3.8 Liveを土台にした追加機能で、近リアルタイムの映像生成と音声応答を組み合わせ、動的な見た目を持つ相手が「聞き、見て、話す」体験を作り出すという。
具体的には、精密なリップシンク(発話と口の動きの同期)、自然な表情、スムーズな会話の受け渡し(ターンテイキング)を備え、企業がバーチャル対応をより対話的に拡張できるとしている。97言語の間で映像の劣化やずれを起こさず切り替えられる点、対話を止めずに裏側でツール呼び出しやデータ取得を進められる「非同期ツール呼び出し」に対応する点も挙げられている。用途例としてはカスタマーサービスやインタラクティブなウォークスルー、ホテルでのチェックイン対応が示されており、これは社内会議のような対人ミーティングではなく、企業が外部の利用者に向ける応対の場面が中心に据えられていることを意味する。発表当日からGemini Enterpriseで利用可能になっており、高品質な参照画像から特定の人物や既存キャラクターの特徴を保持した独自アバターを作る機能も用意されているが、こちらは現時点では企業ごとに利用許可を出すアローリスト登録(許可リスト)を通じてのみ使える限定的な提供にとどまる。
読者にとっての意味は、企業の一次窓口対応が「文字だけのチャットボット」から「表情と間合いを持つ映像の応対役」へ置き換わる選択肢が現実の製品として動き出したことにある。予約確認や手続き案内のような定型対応では、無表情な音声合成より視覚的な手がかりがある応対の方が利用者の理解や安心感につながりやすい。一方で、こうした技術がまだ対人の商談や社内の打ち合わせをどう変えるかは今回の発表の範囲外であり、録音した音声をAIボイスメモのメモリスのようなツールに渡して後から文字起こし・要約する、という記録の取り方自体が置き換わる話ではない。
この機能が投げかける論点の一つは、本人そっくりの映像を生成できる技術がなりすましの土台にもなりうるという点だ。Live Avatarは参照画像からブランドスタイルや人物の特徴を保持したアバターを作れる。だからこそGoogle DeepMindは、Live Avatarを含む自社AI製品の出力すべてにSynthIDという電子透かしを組み込んでいると説明している。この透かしは音声・映像に直接埋め込まれ、人の目や耳では気づけないままAI生成コンテンツを検出可能にし、誤情報や誤った発言者への帰属を減らす狙いがあるという。ただし透かしは「検出する側」がSynthIDに対応した検証手段を持っていて初めて機能する仕組みであり、対応環境が広がるまでは、映像通話やSNS上の切り抜きで見た「本人らしき映像」を鵜呑みにしない習慣を利用者側が持つ必要は残る。カスタムアバターの作成が現状エンタープライズのアローリスト登録に限られているのも、この種の悪用を発表段階から絞り込む設計だと読める。
これとは別に、対話AIの実用性を左右してきたのはターンテイキングの精度だという業界的な事情も見ておきたい。音声対話AIは長年、相手の発話が終わったかどうかの判定でつまずいてきた。判定が早すぎれば相手の発言を遮り、遅すぎれば不自然な間が空く。Live Avatarが「精密なリップシンク」「滑らかなターンテイキング」を機能の柱として挙げているのは、映像を足すこと自体より先に、この受け渡しの精度が実用の前提条件だと開発側が捉えている表れだろう。非同期ツール呼び出しで裏側の処理を対話と並走させられるようになったのも、応答までの待ち時間という同じ課題への対策にあたる。企業が導入を検討する際は、見た目の作り込みよりも、この会話のテンポが自社の利用場面(問い合わせ対応か、手続き案内か)でどこまで自然に感じられるかを、まず確かめるべきだろう。
続報として、Gemini自体の音声モデル強化についてはGemini 3.8 Flash TTSの発表もあわせて出ている。
詳細はGoogle DeepMindの公式発表で確認できる。




