- Googleが新TTSモデル2種を発表
- 30秒サンプルで声を複製、同意確認とSynthID標準搭載
- 声の出所管理が録音現場の実務課題に
Googleは2026年9月23日、Geminiファミリーに新しいテキスト読み上げ(TTS)モデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を追加したと発表した。合成音声の生成を、あらかじめ用意された定型の声から、作り込める制作環境へ変える取り組みと位置づけている。両モデルはGoogle AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook、Google Vidsを通じて、独自のキャラクターの声を生成したり場面ごとのセリフを演出したりする用途に使える。
「Gemini 3.8 Flash TTS」は、自然言語のプロンプトだけで役柄やアクセント、声の特徴を指定し、ゼロから声を作る用途に重点を置く。100を超える言語・方言に対応し、メキシコスペイン語やケベックフランス語、スコットランド英語といった地域ごとの言い回しの違いも含む2,000種類以上の音声ライブラリが用意された。Googleは、従来30種類だった音声を無限に拡張可能にしたとしている。一方の「Gemini 3.8 Flash-Lite TTS」は、大量の吹き替えや音声コンテンツ生成、音声で応答するAIサービス(音声エージェント)向けに、低コストでの大量処理と表現力が求められる用途に振った設計だ。両モデルは、3.5 Live Translateや3.5 Transcribeなど、急速に広がるGemini Audioファミリーの新顔にあたる。
声そのものを複製する機能も備わった。自分の声、または使用権のある声の30秒の音声サンプルから、一貫した声のプロファイルを再現できる。ここには本人の同意を確認する仕組みと、AI生成物であることを示す電子透かし技術「SynthID」が組み込まれた。加えて、コンテンツの生成元を記録する規格「C2PA」の資格情報も付き、開発者と声の提供者の双方を保護する狙いだとしている。声色やピッチ、アクセントを後から微調整する「音声リミックス」機能は近く公開予定という。
この発表が仕事の現場に届くのは、ポッドキャストやオーディオブック、動画のナレーション制作といった音声コンテンツづくりの現場からだろう。声の複製・演出がプロンプト操作で完結するようになれば、ナレーターの手配や収録の調整にかけていた時間が短縮される可能性がある。同時に、誰の声を、どんな許諾のもとで使ったかという記録の重みが増す。
声の複製に同意確認とSynthID、C2PAがモデル提供側の標準機能として組み込まれた点は、業務で声を扱う場面の実務を変える。企業がナレーション制作やプレゼン動画で音声合成を使う機会が増えるほど、声の使用許諾をどう記録し保管するかが問われるようになる。取材や打ち合わせで「この声を使ってよい」という同意を口頭で得た場面ほど、そのやり取り自体を音声として残しておく価値がある。会議や商談を録音してAIが文字起こし・要約するAIボイスメモのメモリスのような仕組みを、許諾のやり取りの記録用途に充てるのも一案だ。
これとは別に、Flash TTSとFlash-Lite TTSという二層構成そのものにも、ツール選定の論点がある。表現の作り込みを重視する制作物にはFlash TTS、量とコストを優先する吹き替えや音声エージェントにはFlash-Liteという役割分担は、生成AIモデル一般に見られる「高品質・低コスト」の二極化がTTSにも及んだ形だ。業務で音声合成の導入を検討する際は、単一のモデルで全用途をまかなおうとせず、用途ごとに求める品質とコストの基準を先に決め、それに合うモデル区分を選ぶ判断軸を持っておくと無駄が少ない。
Google公式ブログの発表によれば、両モデルはすでにGoogle AI Studioなどで利用できる状態にある。音声合成に関心のある向きは、Grok Voice Transcribeの動きともあわせて、Gemini Audioファミリーの拡張を追っておく価値がある。




