2026-08-26 · ← Noticias
Qwen3.8-Flash-Next ofrece una capacidad masiva con activación escasa
Qwen lanza un modelo 125B que no necesita un centro de datos
Alibaba ha lanzado Qwen3.8-Flash-Next, un nuevo modelo de arquitectura abierta. Según Simon Willison, también sirve como un adelanto de la arquitectura prevista para Qwen4. El modelo cuenta con 125 mil millones de parámetros en total, lo que lo convierte en un sistema enorme. El truco es que solo 6 mil millones de ellos están activos durante la generación.
Empaquetando más conocimiento en menos hardware
Esta arquitectura Mixture-of-Experts (MoE) permite que el modelo almacene una enorme cantidad de conocimiento sin aumentar brutalmente los requisitos de computación para cada token generado. Simon Willison menciona haber probado con éxito el modelo en una máquina DGX Spark, gracias a las versiones cuantizadas (reducidas) proporcionadas por Unsloth. Específicamente, probó versiones que pesaban 72,5 GB y 78,9 GB. Esto significa que un modelo capaz de razonamientos altamente complejos se puede ejecutar localmente si se tiene suficiente VRAM.
Modelos más pequeños aún podrían ser más prácticos
A pesar del ahorro en parámetros activos (6B), una huella en disco de más de 70 GB sigue siendo demasiado para un desarrollador promedio en un solo Mac. Si bien Qwen muestra cómo hacer modelos grandes más eficientes para la generación, los sistemas RAG que ejecutan modelos densos más pequeños (7B-32B) a menudo servirán de forma más barata y rápida para el 90% de las tareas. Dependerá de si Qwen4 comprime aún más esta arquitectura, o si sigue siendo estrictamente una herramienta corporativa.
Si esto se convierte en el estándar
Observe si una proporción similar (tamaño total masivo vs subconjunto activo pequeño) se convierte en el estándar predeterminado para la próxima generación de modelos de código abierto de Meta o Mistral. Si es así, la era de los modelos densos masivos ha terminado.
El veredicto de Lilith
Alibaba demuestra que el camino hacia mejores modelos ya no es la fuerza bruta, sino la distribución inteligente de la carga de trabajo. El resultado es un cerebro masivo que solo enciende las neuronas correctas al pensar.
Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.
Fuente original ↗ ↗