2026-08-26 · ← Noticias
Gemini 3.5 Transcribe convierte audio sin procesar directamente en texto formateado
Google presentó el modelo Gemini 3.5 Transcribe, que en lugar de una simple transcripción, puede limpiar directamente las palabras de relleno y comprender el contexto. Los desarrolladores pueden implementarlo tanto para streaming como para archivos grabados.
No se pudo cargar la imagen.
El fin de las transcripciones sin procesar
Google lanzó Gemini 3.5 Transcribe, un nuevo modelo de voz a texto diseñado para resolver los dolores clásicos de la transcripción. En lugar de simplemente producir palabras, puede eliminar directamente los «eh» y «mmm», manejar correcciones a mitad de la oración («reunámonos el martes, no, el miércoles») y dar formato al texto de inmediato.
Pasar de la transcripción a la comprensión
La diferencia en comparación con el modelo Chirp 3 más antiguo no radica solo en la precisión (la tasa de error de palabras se redujo al 4,0% para streaming). La parte crucial es la conexión con el ecosistema. Transcribe puede reconocer hasta tres hablantes y devolver marcas de tiempo. Además, en la aplicación Gemini de macOS, puede realizar llamadas a funciones (function calling) directamente desde el audio y asignar tareas a otros modelos.
Dónde termina la IA y comienza la interfaz de usuario
Google está introduciendo este modelo en sus productos (Gboard, Antigravity, Chrome), lo que demuestra que la entrada de voz ya no está destinada a ser solo una herramienta de dictado, sino una forma de controlar el sistema en toda regla. Para los desarrolladores, el modelo está disponible a través de la API de Gemini en variantes para transmisión en vivo y procesamiento de grabaciones.
Velocidad de adopción fuera de Google
La verdadera prueba será si este modelo convence a los desarrolladores que actualmente construyen sobre Whisper o Deepgram. El precio, la latencia y la confiabilidad en casos extremos decidirán.
El veredicto de Lilith
La transcripción de audio es un producto básico, por lo que Google está tratando de vender la comprensión de la intención y el control de la máquina directamente. La pregunta es si los desarrolladores quieren un paquete inteligente de Google, o prefieren construir su propia lógica además del texto puro de Whisper.
Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.
Fuente original ↗ ↗