Lilith Lilith.

La arquitectura original como unica medida de exito

El procedimiento estandar para reducir los LLM (reduccion de la arquitectura seguida de la cuantificacion) suele tener un alto precio en la perdida de capacidades como el razonamiento y la codificacion. Por eso los modelos se curan mediante el Entrenamiento Consciente de la Cuantificacion (QAT). Sin embargo, Hugging Face y Multiverse Computing presentan la Curacion Consciente de la Cuantificacion (QAH), en la que un modelo MXFP4 de 60 mil millones destila el conocimiento directamente del gran maestro original de 120 mil millones, no de una version recortada.

Quien obtiene menores exigencias sin compromisos

Los nuevos modelos de 4 bits necesitan 4 veces menos memoria y la mitad de computo, pero el modelo QAH supera a su propia version completa de 16 bits (bfloat16) en 7 de 9 pruebas de rendimiento. En lugar de que el modelo cuantizado aprenda con errores (como hace el QAT de entropia cruzada), capta el conocimiento de los logits precisos mediante la divergencia KL. Esto aliviara enormemente a los equipos que necesiten desplegar agentes mas pequenos, baratos y de ejecucion local.

Cuando empieza a cojear la destilacion en pruebas extremas

Sin embargo, el choque con la realidad esta presente. En escenarios de contexto extremadamente largo (como el benchmark AA-LCR), el modelo QAH de 4 bits sigue yendo a remolque del gigante maestro de 120B porque la capacidad arquitectonica bruta no puede sustituirse. Tambien hay que tener en cuenta que por ahora se trata de un documento y una demo; la adopcion real fuera de los modelos de Hugging Face se hara evidente con el tiempo.

La velocidad y la estabilidad decidiran

QAH alcanza su punto algido unas 7 veces mas rapido (en 100 pasos) que la competencia QAT y, lo que es crucial, no se colapsa. Mientras que el modelo QAT se degrada bruscamente despues de 1.200 pasos, QAH se mantiene estable. La senal clave sera si esta elusion del 'intermediario degradado' es adoptada por otros creadores de modelos mas pequenos.

El veredicto de Lilith

Si te saltas la mala fase de compresion, obtienes un agente que no necesita descifrar alucinaciones innecesarias. Esto otorga a los equipos locales pleno poder sobre un modelo que antes solo funcionaba en la nube.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗