Lilith.
⌕
編集イラスト: OpenAIはGPT-6 Lunaを3種の判断に絞り、pluginがterminalから使えるようにした
Lilithのイラスト · 編集リミックス

OpenAIはGPT-6 Lunaを基盤とするDecisions APIを公開し、Simon Willisonは自身のLLM CLI向けにllm-openai-decisions 0.1a0を出した。APIはテキストと画像を受け取り、命題が真である確率、事前定義した選択肢、指定した尺度上のscoreという3種類の構造化出力を返す。

GPT-6 Lunaは文章ではなく確率を返す

Willisonは画像への質問を例に、回答形式、評価名、確率を含むJSON objectが返る様子を示した。pluginはllm install llm-openai-decisionsで導入でき、LLMが対応する他社モデルと同じterminal workflowから利用できる。

OpenAIの料金は入力100万tokenあたり0.10ドルで、出力は無料だ。構想はTypeSafe AIのJevに近く、どちらも二値判定、選択、scoreを扱う。Willisonの比較では、テキスト入力のJevは100万tokenあたり0.042ドルで、GPT-6 Lunaは画像入力にも対応する。

専用の判断層がroutingと分類を単純にする

汎用の生成モデルは文章を作り、application側が後からcategoryや数値を抜き出すことが多い。Decisions APIは、より狭く明確な契約を開発者に与える。問い合わせのrouting、queueの優先付け、moderation、reranking、固定基準による文書評価に向く。

実務上の変化は、chatが賢くなることではない。非構造データと決定論的なapplication logicの間に、安価な部品を置けることだ。Willisonのpluginは、製品発表をterminalから繰り返し試せる道具に変えた。

1つの小数が誤りと偏りを隠す

構造化出力は統合を簡単にする一方、判断の中身を見えにくくする。モデルが返すのは確率やscoreであり、判断を左右した理由や具体的な手掛かりではない。採用候補者の順位付けや顧客トラブルの処理など、影響の大きい用途では、整ったAPIを監査可能性と取り違えてはいけない。

低価格は、自社データで偽陽性と偽陰性を測る前の大規模導入も誘う。evalsには境界例、言語の変更、画像入力、投稿内容を使った操作の試みを含める必要がある。

自社データでのcalibrationが実用性を決める

開発者は、scoreが実際の確率と対応するか、小さなprompt変更でどれほど揺れるか、安全なthresholdで人へ渡せるかを検証すべきだ。Jevとの比較も同じ課題集合で行う必要がある。安いtoken価格だけでは誤りの費用は分からない。

OpenAIがJevのテキスト形式に加えた画像入力も重要な観測点になる。GPT-6 Lunaが両方のmodalityでcalibrationを保ち、チームが結果を継続監査できれば、特化型decision modelは生成LLMの隣に独自の居場所を得る。

Lilithの判定

GPT-6 Lunaはapplicationに整った数値を渡すが、証言は添えない。その数値で人や争いを分類するなら、異議を唱えられる人間をそばに置く必要がある。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗