2026-09-23 · ← Aktualności
Gemini 3.8 buduje głos z 30 sekund, ale Europę zostawia za drzwiami
Google udostępnił dwa modele text-to-speech. Gemini 3.8 Flash TTS stawia na reżyserię, aktorską ekspresję i długie dialogi, a Flash-Lite ma obsługiwać tańsze zadania na dużą skalę. Katalog obejmuje ponad 2 000 gotowych głosów, a oba modele potrafią prowadzić dwie postacie w jednym scenariuszu.
Trzydzieści sekund nagrania wystarcza do stworzenia trwałego głosu
Flash TTS potrafi zaprojektować nowy głos na podstawie opisu albo odtworzyć istniejący z 30-sekundowego nagrania. Google wymaga nagrania zgody właściciela głosu, a wygenerowane audio oznacza za pomocą SynthID i poświadczeń C2PA. Własny głos można zachować do kolejnych projektów, więc funkcja staje się elementem produkcji, a nie jednorazowym efektem.
Simon Willison zbudował nad API własny playground działający w przeglądarce. Dialog o długości 1 minuty i 18 sekund powstał w około 20 sekund i kosztował 2,74 centa. Taka liczba mówi o praktyce więcej niż sama pozycja w benchmarku.
Przewagę daje reżyseria, a nie sama synteza
Dla zespołów tworzących podcasty, dubbing i agentów głosowych liczy się kontrola nad każdą kwestią, tempem, akcentem i reakcjami wokalnymi. Jeden scenariusz może zachować odrębne postacie oraz instrukcje dla ich głosów. Flash wybiera jakość i charakter, Flash-Lite przepustowość i koszt.
Znaczenie ma również przenośność ustawień. Zapisany identyfikator głosu ogranicza dryf między odcinkami i skraca prompt, dzięki czemu głos może być zarządzanym zasobem produkcyjnym.
Najcenniejszą funkcję ogranicza geografia
Voice replication w Google AI Studio nie działa w EOG, Wielkiej Brytanii, Szwajcarii, Indiach, Illinois ani Teksasie. Europejskie zespoły mogą testować modele i projektować syntetyczne głosy, lecz nie skopiują własnego głosu w AI Studio. Zgoda, watermark i C2PA ograniczają ryzyko nadużyć, ale nie rozwiązują zarządzania prawami po odejściu lektora z projektu.
O wyniku zdecyduje zarządzanie zgodą po utworzeniu głosu
Kluczowym sygnałem będzie audyt użycia, możliwość cofnięcia zgody i pewne usunięcie profilu głosowego we wszystkich produktach Google. Drugim testem pozostaje stabilność przez wiele godzin, a nie krótka prezentacja. Dopiero produkcja pokaże, czy 2 000 głosów przyspiesza pracę, czy tylko zwiększa liczbę wariantów czekających na akceptację.
Werdykt Lilith
Google otworzył studio z 2 000 głosów, ale europejski lektor wciąż nie wejdzie do kabiny kopiowania. Wartość Gemini TTS rozstrzygnie się przy wycofaniu głosu po ostatnim ujęciu, nie przy jego efektownym tworzeniu.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗