2026-10-07 · ← ニュース
OpenAIはGPT-6 Lunaを3種の判断に絞り、pluginがterminalから使えるようにした
OpenAIはGPT-6 Lunaを使い、二値判定、選択、数値scoreを返すDecisions APIを公開した。Simon Willisonのpluginは、入力100万tokenあたり0.10ドルで構造化された判断を得られる利点と、判断理由が返らない代償を同時に示す。
画像を読み込めませんでした。
OpenAIはGPT-6 Lunaを基盤とするDecisions APIを公開し、Simon Willisonは自身のLLM CLI向けにllm-openai-decisions 0.1a0を出した。APIはテキストと画像を受け取り、命題が真である確率、事前定義した選択肢、指定した尺度上のscoreという3種類の構造化出力を返す。
GPT-6 Lunaは文章ではなく確率を返す
Willisonは画像への質問を例に、回答形式、評価名、確率を含むJSON objectが返る様子を示した。pluginはllm install llm-openai-decisionsで導入でき、LLMが対応する他社モデルと同じterminal workflowから利用できる。
OpenAIの料金は入力100万tokenあたり0.10ドルで、出力は無料だ。構想はTypeSafe AIのJevに近く、どちらも二値判定、選択、scoreを扱う。Willisonの比較では、テキスト入力のJevは100万tokenあたり0.042ドルで、GPT-6 Lunaは画像入力にも対応する。
専用の判断層がroutingと分類を単純にする
汎用の生成モデルは文章を作り、application側が後からcategoryや数値を抜き出すことが多い。Decisions APIは、より狭く明確な契約を開発者に与える。問い合わせのrouting、queueの優先付け、moderation、reranking、固定基準による文書評価に向く。
実務上の変化は、chatが賢くなることではない。非構造データと決定論的なapplication logicの間に、安価な部品を置けることだ。Willisonのpluginは、製品発表をterminalから繰り返し試せる道具に変えた。
1つの小数が誤りと偏りを隠す
構造化出力は統合を簡単にする一方、判断の中身を見えにくくする。モデルが返すのは確率やscoreであり、判断を左右した理由や具体的な手掛かりではない。採用候補者の順位付けや顧客トラブルの処理など、影響の大きい用途では、整ったAPIを監査可能性と取り違えてはいけない。
低価格は、自社データで偽陽性と偽陰性を測る前の大規模導入も誘う。evalsには境界例、言語の変更、画像入力、投稿内容を使った操作の試みを含める必要がある。
自社データでのcalibrationが実用性を決める
開発者は、scoreが実際の確率と対応するか、小さなprompt変更でどれほど揺れるか、安全なthresholdで人へ渡せるかを検証すべきだ。Jevとの比較も同じ課題集合で行う必要がある。安いtoken価格だけでは誤りの費用は分からない。
OpenAIがJevのテキスト形式に加えた画像入力も重要な観測点になる。GPT-6 Lunaが両方のmodalityでcalibrationを保ち、チームが結果を継続監査できれば、特化型decision modelは生成LLMの隣に独自の居場所を得る。
Lilithの判定
GPT-6 Lunaはapplicationに整った数値を渡すが、証言は添えない。その数値で人や争いを分類するなら、異議を唱えられる人間をそばに置く必要がある。
外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。
元の記事 ↗ ↗