2026-09-23 · ← News
Gemini 3.8 macht aus TTS eine Regie für Stimmen
Google hat zwei Text-to-Speech-Modelle vorgestellt. Gemini 3.8 Flash TTS zielt auf Charaktergestaltung und detaillierte Regie, Flash-Lite TTS auf umfangreiches Dubbing, Audioproduktion und Voice Agents. Beide Modelle werden seit dem 23. September über die Gemini API und Google AI Studio ausgerollt.
Ein Prompt erzeugt die Stimme und jede Zeile erhält Regie
Flash kann aus einer Beschreibung eine neue Stimme erzeugen und jede Zeile über Tempo, Emotion, Akzent oder Gesprächslaute steuern. Google nennt mehr als 100 Sprachen und Dialekte sowie eine Bibliothek mit über 2.000 produktionsreifen Stimmen. Ein eigenes Profil lässt sich speichern, um die Darbietung über ein längeres Projekt hinweg konsistenter zu halten.
Das Modell kann außerdem eine Stimme aus einer 30-sekündigen Aufnahme replizieren. Dafür verlangt Google eine gesprochene Einwilligung des Eigentümers der Referenzstimme. Gemini Notebook erhält Flash, Google Vids Flash-Lite und beide Varianten sollen später per API zu Gemini Enterprise kommen.
Wiederholbare Darbietung ist der Vorteil in der Produktion
Für Teams in Spielen, Podcasts oder Lokalisierung zählt präzise Regie mehr als eine weitere angenehm klingende Demo. Zum selben Charakter zurückzukehren, eine einzelne Zeile zu ändern und den Akzent über mehrere Szenen zu halten, kann die Schleife aus Generieren, Anhören und Korrigieren verkürzen.
Flash-Lite zeigt zugleich, wo Google großes Volumen erwartet: Dubbing und Voice Agents. Die Trennung der Modelle unterscheidet aufwendige kreative Kontrolle von preis- und latenzsensiblen Aufgaben. Konkrete Angaben zu Preis oder Latenz fehlen in der Ankündigung jedoch.
Einwilligung und Watermark regeln nicht den gesamten Lebenszyklus
Laut Google trägt jede Ausgabe ein SynthID-Watermark. Bei der Stimmreplikation nennt das Unternehmen außerdem C2PA Credentials. Die Prüfung der Einwilligung bei der Erstellung ist eine wichtige Bremse, löst aber weder einen späteren Lizenzwiderruf noch den Diebstahl gespeicherter Profile oder die Nutzung außerhalb des vereinbarten Projekts.
Auch die Benchmarks bleiben weitgehend Teil der Anbietererzählung. Google meldet 71,4 Punkte im Hume AI Voice Design Benchmark und 60,8 bei der Akzentmodellierung. Für Kaufentscheidungen zählt die Stabilität über lange Texte und Produktionslasten stärker.
Rechte, Preis und Drift entscheiden über die Einführung
Entscheidend wird, wie einfach sich eine Stimme aus einem Projekt entfernen, eine Einwilligung prüfen und ein Charakter über Hunderte Zeilen stabil halten lässt. Ebenso wichtig sind der öffentliche Preis von Flash-Lite, die reale Latenz der Gemini API und die Erkennbarkeit von SynthID nach üblicher Audiobearbeitung. Diese Betriebswerte trennen ein Studio von einem beeindruckenden Playground.
Liliths Urteil
Google hat ein Regiestudio gebaut, in dem aus 30 Sekunden Audio ein Darsteller entsteht. Nun muss es beweisen, dass dessen digitales Double wirklich aufhört zu spielen, sobald der Stimmeninhaber die Bühne verlässt.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗