Lilith Lilith.
⌕
Ilustración editorial: Gemini 3.8 Live estrena un rostro que habla 97 idiomas
Ilustración de Lilith · remezcla editorial

Google ha combinado el diálogo en directo de Gemini 3.8 Live con vídeo de avatar generado de forma continua. Un agente empresarial puede escuchar, procesar imágenes, hablar y cambiar de expresión durante la conversación sin esperar a que termine cada llamada a herramientas.

Live Avatar une voz, vídeo y herramientas en un único flujo

Gemini 3.8 Live with Live Avatar genera audio y vídeo casi en tiempo real. Google promete sincronización labial precisa, turnos fluidos y expresiones naturales. El function calling asíncrono permite consultar datos o ejecutar una herramienta en segundo plano mientras el diálogo continúa.

El sistema puede alternar entre 97 idiomas y adaptar sobre la marcha el movimiento de los labios y las expresiones. Google ofrece una biblioteca de personajes predefinidos. También permite crear un avatar propio desde una imagen de referencia de alta calidad y conservar la identidad visual de una marca o personaje, aunque esta opción solo está disponible para empresas autorizadas mediante allowlisting. Todo el audio y vídeo generado incorpora la marca SynthID, según Google.

El agente empresarial gana una interfaz social, no otro formato de salida

En atención al cliente, onboarding o visitas interactivas, el rostro se convierte en una capa funcional. El usuario puede ver una reacción mientras trabaja el backend y entender mejor cuándo escucha o responde el sistema. Las herramientas asíncronas quizá importen más que los gráficos, porque mantienen viva la conversación durante el trabajo de fondo.

Los equipos de producto también reciben una superficie mucho mayor que diseñar y probar. A la precisión de la respuesta se suman voz, expresión, lip sync, latencia y estado de las herramientas. El error ya no es solo una frase equivocada. Puede ser una sonrisa segura mientras se rechaza un pago.

Un rostro fluido puede ocultar un backend impreciso o caro

El anuncio no aporta mediciones públicas de latencia integral, errores de lip sync, precio de la capa de vídeo ni rendimiento bajo carga prolongada. La disponibilidad en Gemini Enterprise tampoco lo convierte en un producto de consumo abierto y la identidad personalizada sigue limitada por allowlisting.

SynthID ayuda a establecer el origen, pero no resuelve el consentimiento sobre una imagen de referencia, los permisos ni la corrección de las respuestas. Los despliegues empresariales necesitarán registros, identificación clara de la IA y una vía fiable hacia una persona.

La latencia, el coste por sesión y los fallos decidirán su valor

Las primeras señales útiles llegarán de conversaciones largas con clientes: si audio y vídeo se desincronizan, si una herramienta en segundo plano bloquea la sesión y cuánto cuesta una llamada de varios minutos. También importará cómo comunica el avatar una duda o una avería técnica.

Google ha mostrado una capa de presentación convincente. El valor en producción dependerá de medir toda la cadena, desde el micrófono y el function calling hasta el vídeo, no solo de que el rostro resulte creíble.

El veredicto de Lilith

Google ha puesto tras el mostrador un rostro que habla 97 idiomas y sigue conversando mientras trabajan las herramientas. La empresa lo valorará cuando deje de sonreír ante un fallo y llame a la persona adecuada.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗ ↗