2026-10-04 · ← News
Qwen löste ohne Reasoning nur 23,57 % der ausgeschriebenen Additionen
Ein lokaler Lauf von Qwen3.8 27B ohne Reasoning löste 1.195 von 5.070 Additionen korrekt, obwohl das verlangte Format in 96,17 % der Fälle eingehalten wurde. Das kleine Experiment trennt sauber zwischen der richtigen Form einer Antwort und dem richtigen Ergebnis.
Das Bild konnte nicht geladen werden.
Qwen3.8 27B erhielt eine einfache Aufgabe: zwei positive ganze Zahlen addieren und das Ergebnis ausschließlich als englische Wörter ausgeben. Simon Willison führte das quantisierte Modell Qwen3.8-27B-Q4_K_M lokal auf einem DGX Spark aus und testete 5.070 Fälle ohne Reasoning. 1.195 Antworten waren korrekt, also 23,57 %.
Das Modell hielt das Format ein und verlor die Zahlen
Das verlangte Format befolgte es dennoch in 96,17 % der Fälle. Bei Operanden mit einer bis drei Stellen erreichte es 97,04 % Genauigkeit, bei zehn bis dreizehn Stellen sank der Wert auf 6,44 %. Das sieht nicht nach einem zufälligen Verstoß gegen die Anweisung aus. Das Modell wusste meist, wie die Antwort aussehen sollte, konnte sie aber nicht korrekt berechnen.
Willison griff damit ein älteres Experiment von Colin Frasier mit GPT-4o auf. Die lokale Ausführung gab ihm Kontrolle über den Aufbau und ermöglichte die Veröffentlichung des vollständigen Ergebnisrasters.
Reasoning veränderte Ergebnis und Aufwand zugleich
Mit mittlerem Reasoning löste Qwen 167 von 169 Fällen korrekt. Dieser Lauf enthielt jedoch nur einen Versuch pro Paar von Operandenlängen statt 30 Versuchen pro Zelle wie beim Test ohne Reasoning, weil jede Antwort deutlich länger dauerte. Die Zahlen zeigen einen starken Unterschied, aber keinen Vergleich zweier gleich großer Stichproben.
Für Entwickler von Evals ist die Konstruktion der Aufgabe wichtiger als ein Rang auf einer Bestenliste. Addition lässt sich leicht mit Code prüfen. Das Verbot eines Taschenrechners zwingt das Modell jedoch, Zwischenergebnisse während der Texterzeugung zu bewahren. So wird die Lücke zwischen dem Befolgen einer Anweisung und zuverlässigem Rechnen sichtbar, die ein aggregierter Benchmark verdecken kann.
Zwei Fehler in einer kleinen Stichprobe belegen keine Zuverlässigkeit
167 richtige Antworten von 169 wirken überzeugend, doch der Reasoning Lauf hat pro Zelle dreißigmal weniger Versuche als die Basis. Willison weist selbst darauf hin, dass die Fehler bei einer Wiederholung wahrscheinlich an anderen Stellen lägen. Latenz und Energieverbrauch wurden ebenfalls nicht angegeben, obwohl gerade die längere Laufzeit zur kleineren Stichprobe führte.
Untersucht wurden ein quantisiertes Modell, eine Maschine und eine eng begrenzte Aufgabe. Daraus lässt sich weder ein allgemeiner mathematischer Vorteil von Reasoning noch ein direkter Sieg über GPT-4o ableiten, da die beiden Experimente nicht unter identischen Bedingungen liefen.
Wiederholungen müssen den Vorteil von Reasoning bestätigen
Als Nächstes sollten alle 169 Kombinationen mehrfach wiederholt, die Latenz veröffentlicht und Rechenfehler von Fehlern beim Ausschreiben der Zahlen getrennt werden. Erst dann zeigt sich, ob Reasoning die Berechnung stabil repariert oder nur die Chance auf eine richtige Antwort erhöht.
Für Produktionssysteme bleibt die sicherere Architektur schlicht: Die Arithmetik geht an einen Taschenrechner, das Modell formuliert das Ergebnis. Der Versuch zeigt, dass eine elegant ausgeschriebene Zahl weiterhin ein Fehler mit guter Aussprache sein kann.
Liliths Urteil
Ohne Reasoning lieferte das Modell eine korrekt beschriftete Schachtel mit der falschen Summe darin. In der Produktion gehört Arithmetik in den Taschenrechner, nicht in ein Sprachmodell mit überzeugender Diktion.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗