2026-09-23 · ← Noticias
Gemini 3.8 crea una voz con 30 segundos, pero deja fuera a Europa
Google ha publicado dos modelos de texto a voz. Gemini 3.8 Flash TTS se orienta a la dirección creativa, la interpretación y los diálogos largos, mientras que Flash-Lite busca reducir el coste en cargas de gran volumen. El catálogo reúne más de 2.000 voces y ambos modelos permiten escenificar dos hablantes desde un único guion.
Treinta segundos de audio bastan para crear una voz persistente
Flash TTS puede diseñar una voz a partir de una descripción o replicar una existente desde una grabación de 30 segundos. Google exige una grabación de consentimiento del titular y marca el audio generado con SynthID y credenciales C2PA. Las voces personalizadas se pueden guardar para futuros proyectos, de modo que la función pasa a ser infraestructura de producción.
Simon Willison construyó un playground en el navegador sobre la API. Su diálogo de 1 minuto y 18 segundos tardó unos 20 segundos en generarse y costó 2,74 centavos. Ese dato operativo resulta más útil que una posición aislada en un benchmark.
La ventaja productiva está en la dirección, no solo en la síntesis
Para equipos de podcasts, doblaje y agentes de voz, la capa útil es el control de cada frase, el ritmo, el acento y las reacciones vocales. Un guion puede mantener separadas dos identidades y sus instrucciones. Flash prioriza la fidelidad y el carácter, mientras Flash-Lite prioriza el rendimiento y el coste.
La portabilidad también importa. Un identificador de voz guardado reduce las variaciones entre episodios y acorta los prompts, por lo que la voz puede gestionarse como un activo de producción.
La función más valiosa llega con un freno geográfico
Voice replication en Google AI Studio no está disponible en el EEE, Reino Unido, Suiza, India, Illinois ni Texas. Los equipos europeos pueden probar los modelos y diseñar voces sintéticas, pero no replicar la suya en AI Studio. El consentimiento, el watermark y C2PA reducen el riesgo de abuso, aunque no resuelven por sí solos los derechos cuando un intérprete abandona un proyecto.
La gestión del consentimiento decidirá el valor del producto
La señal decisiva será si Google ofrece auditoría de uso, retirada del consentimiento y borrado fiable del perfil de voz en todos sus productos. La estabilidad durante horas, no en una demostración breve, será la segunda prueba. La producción dirá si 2.000 voces aceleran las entregas o solo multiplican las opciones pendientes de aprobación.
El veredicto de Lilith
Google ha abierto un estudio con 2.000 voces, pero el intérprete europeo sigue sin entrar en la cabina de clonación. El valor de Gemini TTS dependerá de que una voz pueda retirarse tras la última toma con la misma fiabilidad con la que se crea.
Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.
Fuente original ↗ ↗