Lilith Lilith.
編集イラスト: OpenAIがJalapeñoを初公開:独自チップでモデル実行コストを劇的に削減
Lilithのイラスト · 編集リミックス

OpenAIはエージェントの実行にNvidiaを必要とせず、トレーニングのみに必要とする

Jalapeñoは、Broadcomと共同開発された特定用途向け集積回路(ASIC)です。NvidiaのGPU(B200など)がトレーニング時の大規模な並列計算に設計されているのに対し、Jalapeñoはモデルがユーザーへの応答を生成する推論(インファレンス)フェーズに完全に特化しています。そして、AIプラットフォームの運用コストの大半を占めるのが、この推論プロセスです。

InferenceXプラットフォームでの初期ベンチマークは、劇的な飛躍を示しています。Nvidiaを搭載した最高レベルのシステム(GB200/GB300)と比較して、Jalapeñoは1ワットあたり50〜90%多い処理量を実現しています。これは、GPT-OSS 120BからDeepSeek R1、Kimi K2.5 1Tに至るまで、様々なモデルに適用されます。

ユーザーの観点からさらに興味深いのは、モデルが応答を生成し始めるまでの時間、つまりレイテンシです。ここでJalapeñoは、同等のNvidiaシステムと比較してエンドツーエンドのレイテンシを1.7倍から3.6倍削減しました。ハードウェア担当バイスプレジデントのRichard Hoは、スループットと低レイテンシの間の伝統的なトレードオフを打破することに成功したと主張しています。

AIサーーバールームにおけるNvidiaの独占の終わり

業界全体にとって、これは決定的な転換点となります。これまでNvidiaはAIサーーバールームの唯一の鍵を握り、価格と供給を決定づけてきました。彼らのチップは優れた汎用エンジンですが、「トークンの生成」という単一の用途には不必要に高価で電力を消費しすぎます。

推論専用に構築されたチップがあれば、APIを大幅に安く提供できます。OpenAIのモデル上で複雑なRAGパイプラインや長時間稼働するエージェントを構築する開発者にとって、これはトークンの価格が下がり、応答がスムーズになることを意味するはずです。Sam Altmanにとっては、損益計算書の最大の項目をコントロールするためのステップです。

カタログスペックと過酷な本番環境の現実

OpenAIは特定のモデルでの選りすぐりの結果を提示しています。しかし、ハードウェアの真のパフォーマンスは、膨大なユーザーのアクセス下で多様な本番環境のワークロードを実行したときに初めて明らかになります。2つ目のハードルは生産能力です。Broadcomの設計はTSMCでの製造を意味しますが、OpenAIはそこでAppleとNvidiaの順番待ちの列に並ばなければなりません。

Richard Hoは、今年は「少量」の導入にとどまり、2027年までは拡大しないと述べて熱気を冷ましています。それでもOpenAIはNvidiaを完全に切り捨てるつもりはなく、依然として「非常に良いパートナー」であると述べています。ChatGPTのような巨大なプロダクトの基盤ハードウェアを交換することは、走りながら心臓の手術をするようなものです。

いつAPIの価格に反映されるか

重要な指標となるのは、発表された省電力性とスループットの向上が、開発者向けのAPI価格にいつ反映されるかです。OpenAIがトークン価格を維持している限り、Jalapeñoは市場の破壊者としてではなく、彼ら自身の利益率を拡大するためのツールとして機能するだけです。

Lilithの判定

技術的なブレークスルーではなく、サプライチェーンの最適化です。OpenAIは生成されたすべての単語に対してNvidiaに税金を払いたくないため、独自の料金所を建設したのです。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗