Lilith.
⌕
Ilustracja redakcyjna: Qwen bez reasoning podał poprawnie tylko 23,57% sum zapisanych słownie
Ilustracja Lilith · remiks redakcyjny

Qwen3.8 27B dostał proste polecenie: dodać dwie dodatnie liczby całkowite i podać wynik wyłącznie słowami po angielsku. Simon Willison uruchomił skwantyzowany model Qwen3.8-27B-Q4_K_M lokalnie na DGX Spark i przetestował 5 070 przykładów z wyłączonym reasoning. Poprawnych było 1 195, czyli 23,57%.

Model zachował format, ale zgubił liczby

Wymagany format zachował w 96,17% przypadków. Dla składników mających od jednej do trzech cyfr osiągnął 97,04% trafności, natomiast przy dziesięciu do trzynastu cyfrach spadł do 6,44%. Nie wygląda to na przypadkowe ignorowanie instrukcji. Model zwykle wiedział, jak odpowiedź powinna wyglądać, lecz nie potrafił jej poprawnie obliczyć.

Willison powtórzył starszy eksperyment Colina Frasiera z GPT-4o. Lokalny sprzęt pozwolił mu kontrolować warunki i opublikować pełną siatkę wyników.

Reasoning poprawił wynik i podniósł koszt próby

Przy średnim poziomie reasoning Qwen rozwiązał poprawnie 167 ze 169 przykładów. Ten test obejmował jednak tylko jedną próbę dla każdej pary długości składników, zamiast 30 prób na komórkę jak w wersji bez reasoning, ponieważ każda odpowiedź trwała znacznie dłużej. Różnica jest duża, ale próbki nie mają tej samej wielkości.

Dla twórców evals ważniejsza od miejsca modelu w rankingu jest konstrukcja zadania. Dodawanie łatwo sprawdzić programem, lecz zakaz kalkulatora zmusza model do utrzymania wyników pośrednich podczas generowania tekstu. Test ujawnia różnicę między posłuszeństwem wobec instrukcji a wiarygodnym obliczeniem, którą zbiorczy benchmark może ukryć.

Dwa błędy w małej próbce nie potwierdzają niezawodności

Wynik 167 na 169 robi wrażenie, ale wariant z reasoning ma trzydzieści razy mniej prób w każdej komórce niż test bazowy. Sam Willison zaznacza, że po powtórzeniu błędy prawdopodobnie pojawiłyby się gdzie indziej. Eksperyment nie podaje też latencji ani zużycia energii, choć to dłuższy czas odpowiedzi wymusił mniejszą próbkę.

To jeden skwantyzowany model, jeden komputer i jedno wąskie zadanie. Nie można na tej podstawie ogłosić ogólnej przewagi reasoning w matematyce ani zwycięstwa nad GPT-4o, bo oba eksperymenty przeprowadzono w innych warunkach.

Powtórzenia pokażą, czy reasoning utrzyma przewagę

Warto wielokrotnie powtórzyć wszystkie 169 kombinacji, opublikować latencję oraz oddzielić błędy rachunkowe od błędów zapisu wyniku słowami. Dopiero wtedy okaże się, czy reasoning stabilnie naprawia obliczenia, czy tylko zwiększa szansę na poprawną odpowiedź.

W produkcji bezpieczniejszy układ pozostaje prosty: arytmetykę wykonuje kalkulator, a model formułuje wynik. Ten test przypomina, że elegancko zapisana angielska liczba może być po prostu błędem z dobrą dykcją.

Werdykt Lilith

Bez reasoning model przyniósł dobrze podpisane pudełko, ale w środku leżał błędny wynik. W produkcji arytmetykę należy oddać kalkulatorowi, a nie modelowi językowemu z pewną dykcją.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗ ↗