Lilith.
⌕
編集イラスト: Astraの契約workflow達成率は55%。だからこそIroncladの検証には意味がある
Lilithのイラスト · 編集リミックス

OpenAIとIroncladは、複雑な契約業務を11件の研究課題に落とし込んだ。平均スコアはGPT-6 Astraが55.0%、GPT-5.6 Solが41.6%だった。1回の試行にかかる推定平均時間も37.0分から19.2分へ短縮した。

11件の課題はクリック数ではなく完成した業務を測る

課題は法務、営業、調達にまたがる。秘密保持契約の設定、購買承認processの作成、選択した法域に合わせた再利用可能な契約条項の更新などが含まれる。OpenAIは、経験豊富な利用者でも1課題あたり平均30分から40分かかると見積もる。

各課題は複雑さに応じて8項目から50項目の基準で評価された。Ironcladはhosted test environmentを提供し、研究者はsynthetic training taskを作ってreinforcement learningを行った。内部の開発モデルは63.7%に達したが、OpenAIはこの結果を提供中のモデルとは結び付けていない。

業務softwareがfrontier modelの訓練場になる

法務分野そのものより重要なのは協業の形だ。software vendorがAPIの上にAI機能を追加するだけではない。domain expert、test environment、詳細な成功条件をfrontier modelの開発へ直接持ち込んでいる。

product teamにとっては、曖昧なagent構想を測定可能な課題へ変える方法になる。formを埋めるだけでは足りない。agentはworkflow全体で閾値、承認、例外を守り、完成したprocessが異なる入力でも機能するか確認しなければならない。

55%は研究の前進であって単独作業の許可証ではない

比較対象は、両社がIroncladのhosted environment内で設計した11件の課題だ。AstraはMax reasoning、SolはHigh reasoningという、それぞれが最高点を出した設定で動いた。独立した課題群、実行ごとのばらつき、失敗の重大度がなければ、本番の信頼性は判断できない。

今回の発表は、一般提供する新しいIronclad機能の公開でもない。OpenAIも人間の監督が依然として重要だと明記する。契約業務では、承認経路を一つ外す失敗が、九つの正しい入力より重い。

独立evalと失敗監査が導入の可否を決める

次に見るべきは、未知のprocess、反復実行、変更されたUIでの性能だ。企業には操作log、権限の強制、不確実時のescalationに加え、agentが19.2分動いた後に人間がどれだけ修正するかという測定も必要になる。

OpenAIは、具体的な失敗例、専門家、安全なtest environment、研究に使えるデータを提供できる少数のsoftware partnerを募集している。この協業から転用可能なevalが生まれれば、Astraの点数以上の価値を持つ。

Lilithの判定

Astraは契約workflowを19.2分で走り切ったが、ゴール脇には基準のほぼ半分が残った。法務担当者が手を離せるのはマウスまでで、責任からではない。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗