Источники
Посмотри в деле
Полистай модели и стили, что стоят за такими историями — бесплатный аккаунт, галерея сразу.
Открыть каталог
София следит за деньгами, политикой и платформами, которые определяют, что могут создавать авторы.
Полистай модели и стили, что стоят за такими историями — бесплатный аккаунт, галерея сразу.
Открыть каталогВыбери компаньона и узнай его мнение об этой истории
Чип Jalapeño от OpenAI показал результаты бенчмарков, которые превосходят современное передовое ИИ-оборудование как по скорости инференса, так и по энергоэффективности — комбинация, которая, если она сохранится в производственном масштабе, снижает стоимость и задержку каждой модели, которую запускает OpenAI.

Чип Jalapeño от OpenAI, созданный специально для быстрого ИИ-инференса в масштабе.
Изображение: The Verge / The Verge AI
Jalapeño — это кастомный ИИ-чип OpenAI, созданный специально для инференса — этапа, на котором обученная модель фактически генерирует вывод в ответ на запрос. Это различие важно: чипы для обучения (H100 и их преемники, которые доминируют в заголовках об ИИ) оптимизированы для другой рабочей нагрузки. Кремний для инференса определяет, как быстро приходит ответ и сколько электричества стоит его доставить.
По данным TechCrunch, Jalapeño был протестирован на бенчмарке InferenceX от SemiAnalysis и показал больше токенов на пользователя и больше пропускной способности на киловатт, чем современные передовые решения. Для рабочих процессов ИИ-изображений и ИИ-видео, которые обращаются к API OpenAI, эти две метрики переводятся напрямую: больше токенов на пользователя означает меньше очередей под нагрузкой, а больше пропускной способности на киловатт означает более низкие операционные расходы на генерацию.

Метрика времени между токенами (TBT) Jalapeño в сравнении с конкурирующим оборудованием для инференса.
Изображение: The Verge / The Verge AI
Большинство оборудования для инференса заставляет идти на компромисс: выжимайте более низкую задержку (более быстрый первый токен, более отзывчивые ответы) и вы жертвуете сырой пропускной способностью, или наоборот. Это напряжение объясняет, почему обслуживание больших моделей в масштабе дорого — операторы должны избыточно обеспечивать ресурсами, чтобы поддерживать обе метрики на приемлемом уровне.
По данным The Verge, вице-президент по оборудованию OpenAI Ричард Хо сказал журналистам, что Jalapeño обходит этот компромисс.
«Лучшее из двух миров с более низкой задержкой и более высокой пропускной способностью».
— Ричард Хо, вице-президент по оборудованию OpenAI
Если это утверждение выдержит реальный производственный трафик — значимая оговорка — это означает, что OpenAI может обслуживать больше одновременных пользователей без скачков задержки, которые в настоящее время делают API генерации изображений медленными в часы пик. Для создателей контента, выполняющих пакетные задания через API или создающих конвейеры генерации поверх моделей OpenAI, это практическое преимущество.

Jalapeño выполняет больше работы на киловатт, чем конкурирующее оборудование для инференса, согласно OpenAI.
Изображение: The Verge / The Verge AI
OpenAI является явным победителем в ближайшей перспективе: собственный кремний означает, что компания больше не зависит полностью от поставок и ценообразования Nvidia для мощности инференса. Этот рычаг важен — когда Stability AI и другие столкнулись с нехваткой GPU в 2023 году, расходы на инференс взлетели, а доступность API пострадала. Владение стеком чипов изолирует OpenAI от этого давления.
Вторичный вопрос для создателей контента заключается в том, достигнут ли прирост эффективности ценообразования API. Исторически экономия инфраструктуры на этом уровне в конечном итоге действительно сжимает расходы — но временные рамки измеряются продуктовыми циклами, а не кварталами. OpenAI не объявила об изменениях цен, связанных с Jalapeño.
Одна оговорка, которую стоит учесть: данные бенчмарков исходят от собственного раскрытия OpenAI. InferenceX от SemiAnalysis — это уважаемая методология, но конкретные условия запуска, размеры моделей и конфигурации пакетов не были независимо воспроизведены в масштабе. Цифры достаточно достоверны, чтобы воспринимать их серьезно; они еще не являются установленным фактом.
Для создателей контента, выбирающих между моделями, размещенными на OpenAI, и самостоятельно размещенными альтернативами на платформах вроде каталога моделей Charmloop, результаты Jalapeño предполагают, что размещенный инференс OpenAI может расширить свое преимущество в скорости над развертываниями GPU третьих сторон — по крайней мере, пока конкуренты не ответят своим собственным кремнием. Следующей конкретной точкой данных будет то, изменятся ли заметно цифры задержки API OpenAI, как только Jalapeño развернется в производственном масштабе.