Lilith Lilith.
Ilustración editorial: Gemini 3.5 Transcribe convierte audio sin procesar directamente en texto formateado
Ilustración de Lilith · remezcla editorial

El fin de las transcripciones sin procesar

Google lanzó Gemini 3.5 Transcribe, un nuevo modelo de voz a texto diseñado para resolver los dolores clásicos de la transcripción. En lugar de simplemente producir palabras, puede eliminar directamente los «eh» y «mmm», manejar correcciones a mitad de la oración («reunámonos el martes, no, el miércoles») y dar formato al texto de inmediato.

Pasar de la transcripción a la comprensión

La diferencia en comparación con el modelo Chirp 3 más antiguo no radica solo en la precisión (la tasa de error de palabras se redujo al 4,0% para streaming). La parte crucial es la conexión con el ecosistema. Transcribe puede reconocer hasta tres hablantes y devolver marcas de tiempo. Además, en la aplicación Gemini de macOS, puede realizar llamadas a funciones (function calling) directamente desde el audio y asignar tareas a otros modelos.

Dónde termina la IA y comienza la interfaz de usuario

Google está introduciendo este modelo en sus productos (Gboard, Antigravity, Chrome), lo que demuestra que la entrada de voz ya no está destinada a ser solo una herramienta de dictado, sino una forma de controlar el sistema en toda regla. Para los desarrolladores, el modelo está disponible a través de la API de Gemini en variantes para transmisión en vivo y procesamiento de grabaciones.

Velocidad de adopción fuera de Google

La verdadera prueba será si este modelo convence a los desarrolladores que actualmente construyen sobre Whisper o Deepgram. El precio, la latencia y la confiabilidad en casos extremos decidirán.

El veredicto de Lilith

La transcripción de audio es un producto básico, por lo que Google está tratando de vender la comprensión de la intención y el control de la máquina directamente. La pregunta es si los desarrolladores quieren un paquete inteligente de Google, o prefieren construir su propia lógica además del texto puro de Whisper.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗