Lilith.
⌕
Ilustración editorial: Qwen sin reasoning acertó solo el 23,57 % de las sumas escritas con palabras
Ilustración de Lilith · remezcla editorial

Qwen3.8 27B recibió una instrucción sencilla: sumar dos enteros positivos y devolver el resultado únicamente con palabras en inglés. Simon Willison ejecutó en local el modelo cuantizado Qwen3.8-27B-Q4_K_M sobre un DGX Spark y probó 5.070 casos con el reasoning desactivado. Acertó 1.195, un 23,57 %.

El modelo respetó el formato mientras perdía los números

Aun así, cumplió el formato solicitado en el 96,17 % de los casos. La precisión llegó al 97,04 % con operandos de una a tres cifras y cayó al 6,44 % con operandos de diez a trece cifras. No parece un incumplimiento aleatorio de la instrucción. El modelo casi siempre sabía qué aspecto debía tener la respuesta, pero no lograba calcularla.

Willison retomó un experimento anterior de Colin Frasier con GPT-4o. La ejecución local le permitió controlar el entorno y publicar la cuadrícula completa de resultados.

El reasoning cambió el resultado y el coste de la prueba

Con un nivel medio de reasoning, Qwen acertó 167 de 169 casos. Sin embargo, esa ejecución incluyó un solo intento por cada pareja de longitudes, frente a los 30 intentos por celda del test sin reasoning, porque cada respuesta tardaba mucho más. Las cifras muestran una diferencia fuerte, pero no comparan dos muestras del mismo tamaño.

Para quienes diseñan evals, la construcción de la tarea importa más que la posición en una clasificación. Una suma se verifica fácilmente con código, pero prohibir la calculadora obliga al modelo a conservar resultados intermedios mientras genera texto. La prueba deja al descubierto la distancia entre seguir una instrucción y calcular de forma fiable, algo que un benchmark agregado puede ocultar.

Dos fallos en una muestra pequeña no prueban fiabilidad

Un resultado de 167 sobre 169 impresiona, pero la variante con reasoning tiene treinta veces menos intentos por celda que la prueba base. El propio Willison advierte de que una repetición probablemente colocaría los errores en otros puntos. El experimento tampoco informa de la latencia ni del consumo energético, aunque la lentitud fue precisamente la causa de reducir la muestra.

Se trata de un modelo cuantizado, una máquina y una tarea estrecha. No permite afirmar una ventaja matemática general del reasoning ni una victoria directa sobre GPT-4o, porque ambos experimentos se realizaron en condiciones distintas.

Las repeticiones dirán si el reasoning mantiene la mejora

El siguiente paso útil consiste en repetir varias veces las 169 combinaciones, publicar la latencia y separar los errores aritméticos de los fallos al escribir el número con palabras. Solo así sabremos si el reasoning corrige el cálculo de forma estable o si se limita a elevar la probabilidad de acertar.

En producción sigue siendo más seguro enviar la aritmética a una calculadora y dejar que el modelo redacte el resultado. Este experimento demuestra que un número escrito con impecable inglés todavía puede ser un error con buena dicción.

El veredicto de Lilith

Sin reasoning, el modelo entregó una caja bien etiquetada con una suma incorrecta dentro. En producción, la aritmética debe quedarse en la calculadora, no en un modelo de lenguaje con dicción convincente.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗ ↗