Lilith Lilith.
Ilustración editorial: Gemini 3.8 Live obtiene Extended Thinking. Mantiene el contexto en segundo plano mientras hablas
Ilustración de Lilith · remezcla editorial

Los nuevos modelos ya no se congelan al ejecutar herramientas

Google anunció Gemini 3.8 Live y la versión 3.8 Live Extended Thinking, que juntos forman una nueva generación de modelos conversacionales. La diferencia clave es la separación de respuestas rápidas de tareas asíncronas. Mientras que los modelos anteriores tenían que pausar la comunicación al trabajar con herramientas y no podían ser interrumpidos, Extended Thinking se ejecuta en segundo plano, permitiéndote continuar conversando fluidamente con el modelo incluso mientras maneja otra tarea.

Aunque la página principal de Google era algo limitada en detalles, las demostraciones que la acompañan ilustran claramente la nueva arquitectura. El modelo combina un flujo verbal rápido (3.8 Live) y un proceso backend separado para el razonamiento estructurado (Extended Thinking) que no se interrumpen entre sí.

Para la UX de asistentes de voz, esto resuelve el mayor cuello de botella

Hasta ahora, los agentes de voz funcionaban muy bien ya sea como chat o como orquestadores de tareas, pero nunca ambos a la vez. Cuando dabas un prompt complejo que requería búsqueda de datos o ejecución de código, tenías que quedarte callado hasta que terminara la tarea. Si interrumpías el modelo con una instrucción complementaria, toda la secuencia de cadena de pensamiento a menudo colapsaba.

La división en dos flujos paralelos cambia esto. Significa que los desarrolladores pueden construir agentes que mantengan una pequeña charla o acepten nuevas instrucciones mientras su parte backend sigue trabajando en un problema pesado. Este es un cambio masivo para cualquier implementación de asistente en el mundo real en movimiento.

La arquitectura es más compleja y exige una sincronización de estado perfecta

El límite reside en qué tan bien intercambian contexto estos dos sistemas. Si Extended Thinking en segundo plano llega a una conclusión que ya no es válida porque mientras tanto cambiaste verbalmente la instrucción, existe el riesgo de alucinaciones asíncronas. El marketing afirma que el modelo maneja la multitarea sin problemas, pero la implementación real fuera de las demos de Google revelará rápidamente cuán agresivamente el modelo descarta las ramas de contexto antiguas tras un nuevo input.

Al mismo tiempo, aún no está claro qué tan disponible está Extended Thinking a través de API para desarrolladores habituales y a qué costo, o si es una función propietaria bloqueada solo en la aplicación Gemini.

Dependerá de si las pausas largas de la API rompen la ejecución paralela

La prueba de que esto funciona no será otra demostración pulida, sino la capacidad de mantener una conversación fluida incluso cuando la herramienta en segundo plano falla y tiene que hacer varios intentos. Si el modelo frontend comienza a inventar cosas solo para llenar el silencio en ese momento, la ilusión de dos flujos paralelos se desmoronará rápidamente.

El veredicto de Lilith

El asistente de IA dejó de ser un walkie-talkie al que debes esperar. En su lugar, se convirtió en un colega de pleno derecho que puede mantener contacto visual normal mientras trabaja en algo complejo.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗