Fontes
Veja em ação
Explore os modelos e estilos por trás de histórias como esta — conta gratuita e galeria na hora.
Explorar o catálogo
Sofia acompanha o dinheiro, as políticas e as plataformas que definem o que criadores podem fazer.
Explore os modelos e estilos por trás de histórias como esta — conta gratuita e galeria na hora.
Explorar o catálogoEscolha um companheiro e veja o que ele acha dessa história
O chip Jalapeño da OpenAI publicou resultados de benchmark que superam o hardware de IA estado-da-arte atual tanto em velocidade de inferência quanto em eficiência energética — uma combinação que, se mantida em escala de produção, comprime o custo e latência de cada modelo que a OpenAI executa.

Chip Jalapeño da OpenAI, construído especificamente para inferência rápida de IA em escala.
Imagem: The Verge / The Verge AI
Jalapeño é o chip de IA customizado da OpenAI, construído especificamente para inferência — a etapa onde um modelo treinado realmente gera saída em resposta a um prompt. Essa distinção importa: chips de treinamento (os H100s e seus sucessores que dominam as manchetes de IA) são otimizados para uma carga de trabalho diferente. Silício de inferência é o que determina quão rápido uma resposta chega e quanta eletricidade custa para entregá-la.
Segundo o TechCrunch, o Jalapeño foi testado no benchmark InferenceX da SemiAnalysis e registrou mais tokens por usuário e mais throughput por quilowatt que o estado-da-arte atual. Para fluxos de trabalho de IA-imagem e IA-vídeo que acessam as APIs da OpenAI, essas duas métricas se traduzem diretamente: mais tokens por usuário significa menos filas sob carga, e mais throughput por quilowatt significa menor custo operacional por geração.

Métrica de tempo-entre-tokens (TBT) do Jalapeño comparada ao hardware de inferência rival.
Imagem: The Verge / The Verge AI
A maioria do hardware de inferência força um tradeoff: extraia menor latência (primeiro token mais rápido, respostas mais ágeis) e você sacrifica throughput bruto, ou vice-versa. Essa tensão é por que servir modelos grandes em escala é caro — operadores têm que superprovisionamento para manter ambas as métricas aceitáveis.
Segundo o The Verge, o VP de hardware da OpenAI Richard Ho disse aos repórteres que o Jalapeño contorna esse tradeoff.
«O melhor dos dois mundos com menor latência e maior throughput.»
— Richard Ho, VP de Hardware da OpenAI
Se essa afirmação se mantém sob tráfego real de produção — uma ressalva significativa — significa que a OpenAI pode servir mais usuários simultâneos sem os picos de latência que atualmente fazem APIs de geração de imagem parecerem lentas em horários de pico. Para criadores executando jobs em lote através da API ou construindo pipelines de geração em cima dos modelos da OpenAI, essa é a vantagem prática.

Jalapeño executa mais trabalho por quilowatt que hardware de inferência concorrente, segundo a OpenAI.
Imagem: The Verge / The Verge AI
A OpenAI é a clara vencedora no curto prazo: silício proprietário significa que ela não depende mais inteiramente do fornecimento e preços da Nvidia para capacidade de inferência. Essa alavancagem importa — quando Stability AI e outros enfrentaram escassez de GPU em 2023, custos de inferência dispararam e disponibilidade da API sofreu. Possuir o stack de chips isola a OpenAI dessa pressão.
A questão downstream para criadores é se ganhos de eficiência chegam ao preço da API. Historicamente, economias de infraestrutura nesta camada eventualmente comprimem custos — mas o cronograma é medido em ciclos de produto, não trimestres. A OpenAI não anunciou mudanças de preço vinculadas ao Jalapeño.
Uma ressalva que vale manter: os dados de benchmark vêm da própria divulgação da OpenAI. O InferenceX da SemiAnalysis é uma metodologia respeitada, mas as condições específicas de execução, tamanhos de modelo e configurações de lote não foram replicadas independentemente em escala. Os números são críveis o suficiente para levar a sério; ainda não são fato estabelecido.
Para criadores escolhendo entre modelos hospedados pela OpenAI e alternativas auto-hospedadas em plataformas como o catálogo de modelos da Charmloop, os resultados do Jalapeño sugerem que a inferência hospedada da OpenAI pode ampliar sua vantagem de velocidade sobre deployments de GPU de terceiros — pelo menos até competidores responderem com seu próprio silício. O próximo ponto de dados concreto será se os números de latência da API da OpenAI mudam mensuravelmente uma vez que o Jalapeño seja implantado em escala de produção.