Lilith.
⌕
編集イラスト: Qwenはreasoningなしでは英語表記の足し算に23.57%しか正解できなかった
Lilithのイラスト · 編集リミックス

Qwen3.8 27Bに与えられた指示は単純だった。2つの正の整数を足し、結果だけを英単語で返す。Simon Willisonは量子化版のQwen3.8-27B-Q4_K_MをDGX Spark上でローカル実行し、reasoningを無効にして5,070問を試した。正解は1,195問で、正答率は23.57%だった。

形式を守れても数字は失われた

指定形式への準拠率は96.17%だった。1桁から3桁のオペランドでは正答率97.04%に達したが、10桁から13桁では6.44%まで落ちた。指示を無視したために失敗したわけではなさそうだ。モデルは答えの見た目をほぼ理解していたが、計算そのものに失敗した。

Willisonは、Colin FrasierがGPT-4oで行った以前の実験を再検証した。ローカル実行によって条件を管理し、結果の全グリッドも公開できた。

reasoningは成績と試験コストの両方を変えた

reasoningを中程度に設定すると、Qwenは169問中167問に正解した。ただし、回答に大幅に時間がかかったため、この実験は各オペランド桁数の組み合わせにつき1回だけだった。reasoningなしの実験では各セルを30回試している。差は大きいが、同じ規模の標本を比べた結果ではない。

evalsを作る側にとって重要なのは、モデルの順位より課題の設計だ。足し算はコードで簡単に検証できる。しかし計算機を禁じると、モデルは文章を生成しながら中間結果を保持しなければならない。この試験は、指示に従う能力と確実に計算する能力の隔たりを、総合benchmarkより鮮明に示す。

小さな標本の2つの誤答では信頼性を証明できない

169問中167問という成績は印象的だが、reasoningありの各セルの試行数は基準実験の30分の1だ。Willison自身も、もう一度実行すれば誤答する場所は変わるだろうと述べている。回答時間の長さが標本を縮小した理由なのに、実験はlatencyや消費電力も報告していない。

対象は1つの量子化モデル、1台のマシン、1種類の狭い課題に限られる。条件が同一ではないため、reasoningが数学全般で優位だとも、GPT-4oに直接勝ったとも結論づけられない。

反復実験がreasoningの効果を見極める

次は169通りの組み合わせを複数回ずつ試し、latencyを公開し、足し算の誤りと英単語への変換ミスを分けて集計する必要がある。そこで初めて、reasoningが計算を安定して修正するのか、正解の確率を上げるだけなのか判断できる。

実運用の安全な設計は変わらない。算術は計算機に任せ、モデルには結果を表現させる。この実験が見せたのは、流暢な英語で書かれた数字も、発音のよい誤答にすぎない場合があるということだ。

Lilithの判定

reasoningなしのモデルは、正しいラベルを貼った箱に間違った合計を入れて届けた。本番環境の算術は、もっともらしく話す言語モデルではなく計算機に任せるべきだ。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗