
Sofia는 크리에이터의 창작을 좌우하는 자본, 정책, 플랫폼을 추적합니다.
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요

OpenAI의 Jalapeño 칩이 추론 속도와 에너지 효율 두 항목 모두에서 현재 최고 수준의 AI 하드웨어를 능가하는 벤치마크 결과를 공개했습니다 — 이 성능이 실제 생산 규모에서도 유지된다면, OpenAI가 운영하는 모든 모델의 비용과 지연 시간이 줄어들게 됩니다.

대규모 고속 AI 추론을 위해 특별 설계된 OpenAI의 Jalapeño 칩.
Jalapeño는 OpenAI가 자체 설계한 AI 칩으로, 학습된 모델이 프롬프트에 응답해 실제로 출력을 생성하는 단계인 추론에 특화되어 있습니다. 이 구분은 중요합니다. AI 헤드라인을 장악하고 있는 H100과 그 후속 칩 같은 학습용 칩은 전혀 다른 워크로드에 최적화되어 있습니다. 추론 실리콘은 응답이 얼마나 빨리 도착하는지, 그리고 이를 제공하는 데 전기가 얼마나 드는지를 결정합니다.
TechCrunch에 따르면, Jalapeño는 SemiAnalysis의 InferenceX 벤치마크에서 테스트되어 현재 최고 수준 대비 더 많은 사용자당 토큰 수와 더 높은 킬로와트당 처리량을 기록했습니다. OpenAI API를 활용하는 AI 이미지 및 AI 영상 워크플로에서 이 두 지표는 직접적인 의미를 가집니다. 사용자당 토큰 수가 많다는 것은 부하 상황에서 대기열이 줄어든다는 뜻이고, 킬로와트당 처리량이 높다는 것은 생성당 운영 비용이 낮아진다는 의미입니다.

경쟁 추론 하드웨어와 비교한 Jalapeño의 토큰 간 시간(TBT) 지표.
대부분의 추론 하드웨어는 트레이드오프를 강요합니다. 지연 시간을 낮추면(첫 토큰이 빠르고 응답이 민첩해지면) 원시 처리량을 희생해야 하고, 그 반대도 마찬가지입니다. 이 긴장 관계가 대규모로 대형 모델을 서빙하는 비용이 비싼 이유입니다 — 운영자들은 두 지표를 모두 허용 가능한 수준으로 유지하기 위해 과잉 프로비저닝을 해야 합니다.
The Verge에 따르면, OpenAI 하드웨어 부문 부사장 Richard Ho는 기자들에게 Jalapeño가 이 트레이드오프를 극복했다고 밝혔습니다.
「낮은 지연 시간과 높은 처리량으로 두 마리 토끼를 모두 잡았습니다.」
— Richard Ho, OpenAI 하드웨어 부문 부사장
이 주장이 실제 프로덕션 트래픽에서도 유효하다면 — 이는 중요한 단서입니다 — OpenAI는 현재 피크 시간대에 이미지 생성 API를 느리게 만드는 지연 시간 급등 없이 더 많은 동시 사용자를 처리할 수 있게 됩니다. API를 통해 배치 작업을 실행하거나 OpenAI 모델 위에 생성 파이프라인을 구축하는 크리에이터에게 이것이 실질적인 이점입니다.

OpenAI에 따르면 Jalapeño는 경쟁 추론 하드웨어보다 킬로와트당 더 많은 작업을 처리합니다.
OpenAI는 명확한 단기 승자입니다. 독자적인 실리콘을 보유한다는 것은 추론 용량을 위해 Nvidia의 공급과 가격에 전적으로 의존하지 않아도 된다는 의미입니다. 이 레버리지는 중요합니다 — 2023년 Stability AI 등이 GPU 부족 사태에 직면했을 때 추론 비용이 급등하고 API 가용성이 저하되었습니다. 칩 스택을 직접 소유함으로써 OpenAI는 그러한 압박으로부터 자유로워집니다.
크리에이터 입장에서 하류 질문은 효율성 향상이 API 가격에 반영될지 여부입니다. 역사적으로 이 계층에서의 인프라 절감은 결국 비용 압축으로 이어지지만, 그 시간표는 분기 단위가 아닌 제품 사이클 단위로 측정됩니다. OpenAI는 Jalapeño와 연계된 가격 변경을 발표하지 않았습니다.
한 가지 주의할 점: 벤치마크 데이터는 OpenAI의 자체 공개에서 나온 것입니다. SemiAnalysis의 InferenceX는 신뢰받는 방법론이지만, 구체적인 실행 조건, 모델 크기, 배치 구성은 아직 대규모로 독립적으로 재현되지 않았습니다. 수치는 진지하게 받아들일 만큼 신뢰할 수 있지만, 아직 확정된 사실은 아닙니다.
OpenAI 호스팅 모델과 Charmloop의 모델 카탈로그 같은 플랫폼의 자체 호스팅 대안 중 하나를 선택하는 크리에이터에게, Jalapeño 결과는 OpenAI의 호스팅 추론이 서드파티 GPU 배포 대비 속도 우위를 더욱 넓힐 수 있음을 시사합니다 — 적어도 경쟁사들이 자체 실리콘으로 대응하기 전까지는. 다음 구체적인 데이터 포인트는 Jalapeño가 프로덕션 규모로 배포된 후 OpenAI의 API 지연 시간 수치가 눈에 띄게 변화하는지 여부가 될 것입니다.