Lilith Lilith.
編集イラスト: Gemini 3.8はTTSを音声一覧から演技演出へ変える
Lilithのイラスト · 編集リミックス

Googleは2つのtext-to-speechモデルを発表した。Gemini 3.8 Flash TTSはキャラクター作成と細かな演出向け、Flash-Lite TTSは大規模な吹き替え、音声制作、voice agent向けだ。両モデルは9月23日からGemini APIとGoogle AI Studioで提供が始まった。

Promptで声を作り、台詞ごとに演技を付ける

Flashは説明文から新しい声を作り、台詞ごとに速度、感情、訛り、相づちなどを指定できる。Googleは100超の言語と方言、さらに2,000超の制作向け音声を用意したとしている。独自の音声profileを保存し、長い企画でも演技の一貫性を保てる。

30秒の録音から声を複製する機能もある。この機能では、参照する声の所有者本人による音声同意が必要だ。Gemini NotebookにはFlash、Google VidsにはFlash-Liteが入り、Gemini Enterprise向けAPIは後日提供される。

制作現場で効くのは演技の再現性だ

ゲーム、podcast、localizationの現場では、心地よいdemo音声が1つ増えることより、演技を正確に指示できる方が重要だ。同じキャラクターに戻り、1つの台詞だけを直し、複数の場面で訛りを維持できれば、生成、試聴、修正の往復を短縮できる。

Flash-Liteは、Googleが規模を見込む領域も示す。吹き替えとvoice agentだ。2モデルへの分割は、高価な創作制御と価格やlatencyに敏感な処理を切り分ける。ただし発表には、具体的な料金もlatencyも示されていない。

同意とwatermarkだけでは声の生涯を管理できない

Googleによると、すべての出力にSynthID watermarkが入り、音声複製にはC2PA credentialsも使われる。作成時の同意確認は重要な歯止めだが、後日の許諾撤回、保存profileの流出、合意した企画外での利用まで自動で解決するわけではない。

Benchmarkも主に提供企業側の説明に基づく。GoogleはHume AI Voice Design Benchmarkで71.4、訛りのmodelingで60.8を挙げる。導入判断では、長文と本番負荷での安定性の方が重要になる。

権利、料金、driftが導入を決める

声を企画から簡単に削除できるか、同意を監査できるか、数百の台詞でも同じ人物を維持できるかを見たい。Flash-Liteの公開料金、Gemini APIの実latency、通常の音声編集後もSynthIDを検出できる割合も同じく重要だ。その運用値が、本物のstudioと華やかなplaygroundを分ける。

Lilithの判定

Googleは30秒の音声から俳優を生み出す演出studioを作った。声の所有者が舞台を降りたとき、digital doubleも本当に演技を止めると証明する番だ。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗