Fuentes
Míralo en acción
Explora los modelos y estilos detrás de historias como esta: cuenta gratis y galería al instante.
Explorar el catálogo
Sofia sigue el dinero, las políticas y las plataformas que definen lo que los creadores pueden hacer.
Explora los modelos y estilos detrás de historias como esta: cuenta gratis y galería al instante.
Explorar el catálogoElige un compañero y descubre su opinión sobre esta noticia
El chip Jalapeño de OpenAI ha publicado resultados de benchmark que superan al hardware de IA más avanzado del mercado tanto en velocidad de inferencia como en eficiencia energética — una combinación que, si se mantiene a escala de producción, reduce el coste y la latencia de cada modelo que ejecuta OpenAI.

El chip Jalapeño de OpenAI, diseñado específicamente para inferencia de IA rápida a escala.
Imagen: The Verge / The Verge AI
Jalapeño es el chip de IA de diseño propio de OpenAI, construido específicamente para inferencia — el paso en el que un modelo entrenado genera realmente una respuesta a un prompt. Esa distinción importa: los chips de entrenamiento (las H100 y sus sucesoras que dominan los titulares de IA) están optimizados para una carga de trabajo diferente. El silicio de inferencia es lo que determina la rapidez con la que llega una respuesta y cuánta electricidad cuesta entregarla.
Según TechCrunch, Jalapeño fue evaluado en el benchmark InferenceX de SemiAnalysis y registró más tokens por usuario y más rendimiento por kilovatio que el estado del arte actual. Para los flujos de trabajo de imagen y vídeo con IA que utilizan las APIs de OpenAI, esas dos métricas se traducen directamente: más tokens por usuario significa menos colas bajo carga, y más rendimiento por kilovatio significa un menor coste operativo por generación.

La métrica de tiempo entre tokens (TBT) de Jalapeño comparada con el hardware de inferencia rival.
Imagen: The Verge / The Verge AI
La mayoría del hardware de inferencia impone una compensación: reducir la latencia (primer token más rápido, respuestas más ágiles) implica sacrificar el rendimiento bruto, o viceversa. Esa tensión es la razón por la que servir modelos grandes a escala resulta caro — los operadores deben sobredimensionar sus recursos para mantener ambas métricas en niveles aceptables.
Según The Verge, el vicepresidente de hardware de OpenAI, Richard Ho, explicó a los periodistas que Jalapeño esquiva ese compromiso.
«Lo mejor de ambos mundos: menor latencia y mayor rendimiento».
— Richard Ho, VP de Hardware de OpenAI
Si esa afirmación se sostiene bajo tráfico de producción real — una salvedad importante — significa que OpenAI puede atender a más usuarios simultáneos sin los picos de latencia que actualmente hacen que las APIs de generación de imágenes se sientan lentas en horas punta. Para los creadores que ejecutan trabajos por lotes a través de la API o construyen pipelines de generación sobre los modelos de OpenAI, esa es la ventaja práctica.

Jalapeño realiza más trabajo por kilovatio que el hardware de inferencia de la competencia, según OpenAI.
Imagen: The Verge / The Verge AI
OpenAI es el claro ganador a corto plazo: el silicio propietario significa que ya no depende enteramente del suministro y los precios de Nvidia para la capacidad de inferencia. Esa ventaja importa — cuando Stability AI y otros se enfrentaron a la escasez de GPU en 2023, los costes de inferencia se dispararon y la disponibilidad de la API se resintió. Ser dueño del stack de chips protege a OpenAI de esa presión.
La pregunta de fondo para los creadores es si las ganancias en eficiencia llegan a los precios de la API. Históricamente, los ahorros de infraestructura en esta capa terminan comprimiendo los costes — pero el plazo se mide en ciclos de producto, no en trimestres. OpenAI no ha anunciado cambios de precios vinculados a Jalapeño.
Una advertencia que vale la pena tener en cuenta: los datos del benchmark provienen de la propia divulgación de OpenAI. InferenceX de SemiAnalysis es una metodología respetada, pero las condiciones específicas de ejecución, los tamaños de modelo y las configuraciones de lote no han sido replicadas de forma independiente a escala. Los números son suficientemente creíbles como para tomarlos en serio; aún no son un hecho consolidado.
Para los creadores que eligen entre los modelos alojados por OpenAI y las alternativas autoalojadas en plataformas como el catálogo de modelos de Charmloop, los resultados de Jalapeño sugieren que la inferencia alojada de OpenAI podría ampliar su ventaja en velocidad sobre los despliegues de GPU de terceros — al menos hasta que los competidores respondan con su propio silicio. El próximo dato concreto será si los números de latencia de la API de OpenAI cambian de forma apreciable una vez que Jalapeño se despliegue a escala de producción.