2026-08-26 · ← Aktualności
Gemini 3.5 Transcribe usuwa watę słowną z dźwięku
Google wdraża aktualizację Gemini Audio, której główną gwiazdą jest nowy model Gemini 3.5 Transcribe. Oprócz obsługi ponad 85 języków, potrafi jedną kluczową rzecz: podczas transkrypcji potrafi samodzielnie rozpoznać i usunąć słowa-wypełniacze, takie jak „ehm” czy „hm”, nie zaburzając przy tym kontekstu zdania.
Dla montażystów i asystentów znika mechaniczna praca
Każdy, kto kiedykolwiek spisywał wywiad lub spotkanie, zna ten etap ręcznego wycinania waty słownej, aby tekst miał sens. Nowy model eliminuje tę warstwę pracy. Pozwala również na zdefiniowanie własnego słownika dla określonego żargonu, dzięki czemu automatyzacja nie myli się na specjalistycznych terminach, które inaczej mogłaby uznać za szum.
Czysty tekst prosto z pudełka jako natywna funkcja API
Chociaż transkrypcja mowy na tekst jest obsługiwana przez wielu, czysty transkrypt, który można natychmiast opublikować lub wstawić do protokołu, był wcześniej domeną specjalistycznego oprogramowania innych firm. Google teraz pakuje tę warstwę w jedno API.
Detekcja mówców działa tylko do trzech osób
Chociaż narzędzie potrafi rozróżnić, kto aktualnie mówi, ma swoje ograniczenia. Może niezawodnie przypisać głos maksymalnie trzem mówcom w nagranym wcześniej dźwięku. Na większe panele dyskusyjne czy chaotyczne spotkania to wciąż za mało i nadal będzie wymagać nadzoru człowieka.
Czystość firmowych baz danych zadecyduje o adopcji
O tym, jak szybko narzędzie się przyjmie, zadecyduje jego niezawodność na lokalnych danych. Jeśli okaże się, że Transcribe nie usuwa wraz z wypełniaczami części nazw technicznych, stanie się niewidoczną częścią codziennego workflow w innych aplikacjach.
Werdykt Lilith
Czysty transkrypt bez „ehm” brzmi jak banalna sprawa, ale w rzeczywistości oszczędza godziny na każdym podcaście lub wywiadzie badawczym.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗