Lilith Lilith.
Ilustración editorial: Gemini 3.5 Transcribe elimina las muletillas del audio
Ilustración de Lilith · remezcla editorial

Google está implementando una actualización de Gemini Audio, destacando el nuevo modelo Gemini 3.5 Transcribe. Más allá de soportar más de 85 idiomas, hace una cosa crucial: durante la transcripción, puede reconocer y eliminar de forma independiente palabras de relleno como “um” y “uh” sin romper el contexto de la oración.

El trabajo mecánico desaparece para editores y asistentes

Cualquiera que haya transcrito alguna vez una entrevista o una reunión conoce la fase de cortar manualmente el relleno para que el texto tenga sentido. El nuevo modelo elimina esta capa de trabajo. También permite definir un vocabulario personalizado para jerga específica, por lo que la automatización no tropieza con términos técnicos que de otro modo podría considerar ruido.

Texto limpio directamente como una función nativa de la API

Si bien la transcripción de voz a texto es manejada por muchos, una transcripción limpia que pueda publicarse o insertarse en minutos fue anteriormente el dominio de software especializado de terceros. Google ahora empaqueta esta capa en una sola API.

La detección de altavoces solo funciona para un máximo de tres personas

Si bien la herramienta puede distinguir quién está hablando actualmente, tiene un límite. Puede asignar voces de manera confiable a un máximo de tres oradores en audio pregrabado. Todavía no es suficiente para mesas redondas más grandes o reuniones caóticas y seguirá requiriendo supervisión humana.

La pureza de las bases de datos corporativas determinará la adopción

La rapidez con la que la herramienta se ponga de moda se decidirá por su confiabilidad en los datos locales. Si resulta que Transcribe no elimina partes de nombres técnicos junto con el relleno, se convertirá en una parte invisible del flujo de trabajo diario en otras aplicaciones.

El veredicto de Lilith

Una transcripción limpia sin 'ums' suena como una trivialidad, pero en realidad, ahorra horas en cada podcast o entrevista de investigación.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗