
Sofiaはクリエイターの創作を左右するお金、政策、プラットフォームを追いかけます。
コンパニオンを選んで、この話題についての感想を聞いてみましょう

OpenAIのJalapeñoチップが、推論速度とエネルギー効率の両面で現行の最先端AIハードウェアを上回るベンチマーク結果を記録した——この組み合わせが量産スケールでも維持されれば、OpenAIが運用するすべてのモデルのコストとレイテンシーが圧縮されることになる。

大規模な高速AI推論に特化して設計されたOpenAIのJalapeñoチップ。
JalapeñoはOpenAIが独自設計したAIチップで、推論——学習済みモデルがプロンプトに応じて実際に出力を生成するステップ——に特化して構築されている。この区別は重要だ。AIの見出しを賑わすH100やその後継機といったトレーニングチップは、異なるワークロード向けに最適化されている。推論シリコンこそが、レスポンスの到達速度と、それを提供するための電力コストを決定する。
TechCrunchによると、JalapeñoはSemiAnalysisのInferenceXベンチマークでテストされ、現行の最先端チップを上回るトークン数/ユーザーおよびスループット/キロワットを記録した。OpenAIのAPIを利用するAI画像・AI動画ワークフローにとって、この2つの指標は直接的な意味を持つ。トークン数/ユーザーの向上は負荷時のキュー待ちの減少を意味し、スループット/キロワットの向上は1生成あたりの運用コスト低下を意味する。

ライバルの推論ハードウェアと比較したJalapeñoのトークン間時間(TBT)指標。
ほとんどの推論ハードウェアはトレードオフを強いられる。低レイテンシー(初回トークンの高速化、レスポンスの俊敏化)を追求すれば生のスループットが犠牲になり、逆もまた然りだ。この緊張関係こそが、大規模モデルのサービング提供が高コストになる理由であり、オペレーターは両指標を許容範囲内に保つために過剰なプロビジョニングを余儀なくされている。
The Vergeによると、OpenAIのハードウェア担当VP、Richard Hoは記者団に対し、Jalapeñoがそのトレードオフを回避すると語った。
「低レイテンシーと高スループットを両立した、両方の世界のベスト。」
— Richard Ho, OpenAI VP of Hardware
この主張が実際の本番トラフィック下でも維持されれば——これは重要な留保条件だが——OpenAIはピーク時に画像生成APIを重く感じさせるレイテンシースパイクを起こさずに、より多くの同時ユーザーにサービスを提供できることを意味する。APIを通じてバッチジョブを実行するクリエイターや、OpenAIモデルの上に生成パイプラインを構築しているクリエイターにとって、それが実際のメリットだ。

OpenAIによると、Jalapeñoは競合する推論ハードウェアよりもキロワットあたりの処理量が多い。
OpenAIが近期的な明確な勝者だ。独自シリコンを持つことで、推論キャパシティにおけるNvidiaの供給と価格設定への依存から脱却できる。このレバレッジは重要だ——2023年にStability AIなどがGPU不足に直面した際、推論コストが急騰しAPIの可用性が低下した。チップスタックを自社で持つことで、OpenAIはそのような圧力から身を守ることができる。
クリエイターにとっての下流の問題は、効率化の恩恵がAPI価格に反映されるかどうかだ。歴史的に見て、このレイヤーでのインフラコスト削減は最終的にコスト圧縮につながる——ただしそのタイムラインは四半期単位ではなく、製品サイクル単位で測られる。OpenAIはJalapeñoに関連した価格変更を発表していない。
一つ留意すべき点がある。ベンチマークデータはOpenAI自身の開示によるものだ。SemiAnalysisのInferenceXは信頼性の高い手法だが、具体的な実行条件、モデルサイズ、バッチ構成はスケールでの独立した再現がまだなされていない。数値は真剣に受け止めるに足る信頼性を持つが、確定した事実とはまだ言えない。
OpenAIホスト型モデルとCharmloopのモデルカタログなどのプラットフォーム上のセルフホスト型代替手段を比較検討しているクリエイターにとって、Jalapeñoの結果はOpenAIのホスト型推論がサードパーティGPUデプロイメントに対する速度優位をさらに拡大する可能性を示唆している——少なくとも競合他社が独自シリコンで応じるまでは。次の具体的なデータポイントは、JalapeñoがQuantity産スケールで展開された後にOpenAIのAPIレイテンシー数値が目に見えて変化するかどうかだ。