2026-10-04 · ← Aktualności
Qwen bez reasoning podał poprawnie tylko 23,57% sum zapisanych słownie
Lokalny Qwen3.8 27B bez reasoning poprawnie rozwiązał 1 195 z 5 070 działań, choć wymagany format zachował w 96,17% przypadków. Ten niewielki eksperyment dobrze oddziela poprawną formę odpowiedzi od poprawnego wyniku.
Nie udało się wczytać obrazu.
Qwen3.8 27B dostał proste polecenie: dodać dwie dodatnie liczby całkowite i podać wynik wyłącznie słowami po angielsku. Simon Willison uruchomił skwantyzowany model Qwen3.8-27B-Q4_K_M lokalnie na DGX Spark i przetestował 5 070 przykładów z wyłączonym reasoning. Poprawnych było 1 195, czyli 23,57%.
Model zachował format, ale zgubił liczby
Wymagany format zachował w 96,17% przypadków. Dla składników mających od jednej do trzech cyfr osiągnął 97,04% trafności, natomiast przy dziesięciu do trzynastu cyfrach spadł do 6,44%. Nie wygląda to na przypadkowe ignorowanie instrukcji. Model zwykle wiedział, jak odpowiedź powinna wyglądać, lecz nie potrafił jej poprawnie obliczyć.
Willison powtórzył starszy eksperyment Colina Frasiera z GPT-4o. Lokalny sprzęt pozwolił mu kontrolować warunki i opublikować pełną siatkę wyników.
Reasoning poprawił wynik i podniósł koszt próby
Przy średnim poziomie reasoning Qwen rozwiązał poprawnie 167 ze 169 przykładów. Ten test obejmował jednak tylko jedną próbę dla każdej pary długości składników, zamiast 30 prób na komórkę jak w wersji bez reasoning, ponieważ każda odpowiedź trwała znacznie dłużej. Różnica jest duża, ale próbki nie mają tej samej wielkości.
Dla twórców evals ważniejsza od miejsca modelu w rankingu jest konstrukcja zadania. Dodawanie łatwo sprawdzić programem, lecz zakaz kalkulatora zmusza model do utrzymania wyników pośrednich podczas generowania tekstu. Test ujawnia różnicę między posłuszeństwem wobec instrukcji a wiarygodnym obliczeniem, którą zbiorczy benchmark może ukryć.
Dwa błędy w małej próbce nie potwierdzają niezawodności
Wynik 167 na 169 robi wrażenie, ale wariant z reasoning ma trzydzieści razy mniej prób w każdej komórce niż test bazowy. Sam Willison zaznacza, że po powtórzeniu błędy prawdopodobnie pojawiłyby się gdzie indziej. Eksperyment nie podaje też latencji ani zużycia energii, choć to dłuższy czas odpowiedzi wymusił mniejszą próbkę.
To jeden skwantyzowany model, jeden komputer i jedno wąskie zadanie. Nie można na tej podstawie ogłosić ogólnej przewagi reasoning w matematyce ani zwycięstwa nad GPT-4o, bo oba eksperymenty przeprowadzono w innych warunkach.
Powtórzenia pokażą, czy reasoning utrzyma przewagę
Warto wielokrotnie powtórzyć wszystkie 169 kombinacji, opublikować latencję oraz oddzielić błędy rachunkowe od błędów zapisu wyniku słowami. Dopiero wtedy okaże się, czy reasoning stabilnie naprawia obliczenia, czy tylko zwiększa szansę na poprawną odpowiedź.
W produkcji bezpieczniejszy układ pozostaje prosty: arytmetykę wykonuje kalkulator, a model formułuje wynik. Ten test przypomina, że elegancko zapisana angielska liczba może być po prostu błędem z dobrą dykcją.
Werdykt Lilith
Bez reasoning model przyniósł dobrze podpisane pudełko, ale w środku leżał błędny wynik. W produkcji arytmetykę należy oddać kalkulatorowi, a nie modelowi językowemu z pewną dykcją.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗