2026-09-23 · ← News
Gemini 3.8 baut Stimmen aus 30 Sekunden, lässt Europa aber draußen
Google hat zwei Text-to-Speech-Modelle veröffentlicht. Gemini 3.8 Flash TTS zielt auf kreative Regie, Schauspiel und lange Dialoge, während Flash-Lite günstigere Anwendungen mit hohem Volumen bedienen soll. Der Katalog enthält mehr als 2.000 fertige Stimmen, und beide Modelle können zwei Sprecher aus einem Skript inszenieren.
Dreißig Sekunden Audio werden zu einer dauerhaften Stimme
Flash TTS kann eine Stimme aus einer Beschreibung entwerfen oder eine vorhandene Stimme aus einer 30-sekündigen Aufnahme replizieren. Google verlangt eine Einwilligungsaufnahme des Stimminhabers und kennzeichnet erzeugtes Audio mit SynthID und C2PA-Nachweisen. Eigene Stimmen lassen sich für spätere Projekte speichern, wodurch die Funktion zur Produktionsinfrastruktur wird.
Simon Willison hat auf der API einen Browser-Playground aufgebaut. Sein Dialog von 1 Minute und 18 Sekunden wurde in etwa 20 Sekunden erzeugt und kostete 2,74 Cent. Diese Betriebszahl ist aussagekräftiger als ein einzelner Benchmarkplatz.
Der Produktionsvorteil liegt in der Regie, nicht nur in der Synthese
Für Podcast-, Synchron- und Voice-Agent-Teams zählt die Kontrolle über einzelne Zeilen, Tempo, Akzent und stimmliche Reaktionen. Ein Skript kann zwei Figuren samt ihren Anweisungen getrennt führen. Flash priorisiert Klangtreue und Charakterarbeit, Flash-Lite Durchsatz und Kosten.
Auch die Übertragbarkeit ist relevant. Eine gespeicherte Stimm-ID kann Abweichungen zwischen Episoden reduzieren und Prompts verkürzen. Damit wird die Stimme zu einem verwaltbaren Produktionsobjekt.
Die wertvollste Funktion hat eine geografische Bremse
Voice Replication in Google AI Studio ist im EWR, im Vereinigten Königreich, in der Schweiz, in Indien, Illinois und Texas nicht verfügbar. Europäische Teams können Modelle testen und synthetische Stimmen gestalten, aber ihre eigene Stimme in AI Studio nicht replizieren. Einwilligung, Watermarking und C2PA senken Missbrauchsrisiken, regeln jedoch keine Rechte nach dem Ausscheiden eines Sprechers.
Die Einwilligung nach der Erstellung entscheidet über den Nutzen
Entscheidend wird sein, ob Google Nutzungsprotokolle, den Widerruf der Einwilligung und eine verlässliche Löschung des Stimmprofils über alle Produkte hinweg anbietet. Der zweite Test ist Stabilität über Stunden statt in einer kurzen Demo. Erst der Betrieb zeigt, ob 2.000 Stimmen die Produktion beschleunigen oder nur mehr Varianten in die Freigabe schicken.
Liliths Urteil
Google hat ein Studio mit 2.000 Stimmen eröffnet, doch europäische Sprecher kommen noch nicht in die Kopierkabine. Gemini TTS bewährt sich erst, wenn sich eine Stimme nach der letzten Aufnahme ebenso zuverlässig zurückziehen wie erzeugen lässt.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗