2026-09-09 · ← ニュース
GPT-6 Astra:隠された思考の連鎖は、アーキテクチャに欠けている以上のものを隠さない
Perex: GPT-6 Astraモデルはより良い結果をもたらしましたが、より短く隠された思考の連鎖に対する懸念ももたらしました。しかし、その予想されるアーキテクチャを詳細に見ると、モデルが長い内部対話を必要としない理由がわかります。
ループトランスフォーマーは新しいブロックを追加するのではなくリサイクルする
研究者のセバスチャン・ラシュカが議論している技術的な推測によると、GPT-6 Astraはループトランスフォーマーの概念を利用しています。モデルは使い捨てブロックの長い列でデータを処理するのではなく、中間計算を同じブロックのセットに送り返します。これらのブロックの重みは同じままなので、パラメーター数を劇的に増やすことなく、モデルにいわゆる再帰的な深さが与えられます。これは新しいアイデアではありませんが(2018年のUniversal Transformersですでに登場しています)、OpenAIはそれを合理化する方法を見つけたようです。ループのおかげで、モデルは同じ計算予算内で従来のアーキテクチャよりも優れた結果を達成できます。
推論が少ないからといって証拠を隠しているとは限らない
GPT-6 Astraに対する主な批判の1つは、監視機能の低下です。このモデルは、以前のモデルよりも短い思考の連鎖を生成します。しかしラシュカは、これが必ずしも戦略的な差し控えを意味するわけではないと主張しています。能力の高いモデルは単に間違いが少なく、行き止まりを試す必要があまりないだけです。思考の連鎖が短くなるのは、単にモデルが正しい解決策を早く見つけた結果である可能性があります。結局のところ、同じ傾向はすでに以前のモデルにも当てはまっていました。小規模なLunaは、同様の結果を達成するために、より有能なSolよりも多くの推論トークンを必要としました。ループによりアーキテクチャ自体の内部に計算能力が追加され、外部の推論トークンを即席のメモ帳として使用する必要性が減少します。
単なるハードウェアではなく、環境としてのコンピューター
議論はアーキテクチャを中心に展開していますが、Astraの真の画期的な点はグラフィカルユーザーインターフェースを制御する機能(コンピューターの使用)です。ラシュカは、OpenAIのMacの大量購入はトレーニング用ではなく、インタラクティブなmacOS環境を作成するためであったと指摘しています。モデルは強化学習を通じて画面を認識し、マウスまたはキーボードのアクションを生成することを学習します。これにより、モデルは独自のAPIインターフェースを持たないタスクに対してはるかに用途の広いツールになります。
異なるツールへの移行が現在の慣行の限界を明らかにする
将来のモデルに対する期待は、抽象的な推論から実際のシステムとの対話へと移行するはずです。開発者にとって、これは1つのことを意味します。古い指示を捨て、古いモデルを段階的にガイドしていた長いマニュアル(SKILL.md)を削除する必要があります。新しいモデルはもはやこの助けを必要としておらず、詳細すぎる指示は彼らを制限するだけです。オープンソースソリューションがアーキテクチャだけでなく、スムーズなUI制御に必要なトレーニングインフラストラクチャをどれだけ早く模倣できるかは依然として疑問です。
Lilithの判定
短い推論が内部ネットワークループによるものであるならば、Astraが必ずしもずる賢いわけではなく、単に書き出すよりも暗算が得意なだけです。しかし、どちらの場合でもモデルの頭の中を覗き込む窓はかなり狭くなります。
外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。
元の記事 ↗ ↗