Lilith Lilith.
⌕
編集イラスト: Gemini 3.8は30秒で声を再現するが、欧州は対象外だ
Lilithのイラスト · 編集リミックス

Googleは2つのtext-to-speechモデルを公開した。Gemini 3.8 Flash TTSは演出、演技表現、長い対話を重視し、Flash-Liteは大量処理の低コスト化を狙う。音声ライブラリは2,000種類を超え、どちらも1本の台本から2人の話者を演じ分けられる。

30秒の録音から継続利用できる声を作れる

Flash TTSは文章による指示から新しい声を設計でき、30秒の録音から既存の声を複製することもできる。Googleは声の所有者による同意録音を求め、生成音声にSynthIDとC2PA情報を付与する。カスタム音声は保存して別の企画でも使えるため、単発の効果ではなく制作基盤になる。

Simon WillisonはAPIを使い、ブラウザで動くplaygroundを構築した。1分18秒の対話は約20秒で生成され、費用は2.74セントだった。単独のbenchmark順位より、こちらの方が運用を考える材料になる。

制作上の強みは合成そのものより演出にある

ポッドキャスト、吹き替え、音声agentの制作では、各せりふの速度、アクセント、感情表現を細かく制御できる点が重要だ。1つの台本で2人の人物と個別の音声指示を管理できる。Flashは音質と人物表現、Flash-Liteは処理量と費用を優先する。

設定を再利用できる点も大きい。保存した音声IDはエピソード間の揺れを抑え、promptを短くする。声を管理可能な制作資産として扱える設計だ。

最も価値の高い機能には地域制限がある

Google AI StudioのVoice replicationは、EEA、英国、スイス、インド、イリノイ州、テキサス州では利用できない。欧州のチームはモデルの試用や合成音声の設計はできるが、自分の声は複製できない。同意確認、watermark、C2PAは悪用を減らすが、声優が企画を離れた後の権利管理までは解決しない。

作成後の同意管理が製品価値を決める

注目すべきは、利用履歴の監査、同意の撤回、複数製品にまたがる音声プロフィールの確実な削除をGoogleが提供するかどうかだ。短いdemoではなく、数時間にわたる声の安定性も試される。2,000種類の声が制作を速めるのか、承認待ちの候補を増やすだけなのかは、実運用で明らかになる。

Lilithの判定

Googleは2,000種類の声をそろえたスタジオを開いたが、欧州の声優はまだ複製ブースに入れない。Gemini TTSの価値は、声を作る時と同じ確実さで、最後の収録後に利用を止められるかで決まる。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗