Джерела
Подивись у дії
Переглянь моделі та стилі, що стоять за такими історіями — безкоштовний акаунт, галерея одразу.
Відкрити каталог
Софія стежить за грошима, політикою та платформами, які визначають, що можуть створювати автори.
Переглянь моделі та стилі, що стоять за такими історіями — безкоштовний акаунт, галерея одразу.
Відкрити каталогОбери компаньйона і дізнайся його думку про цю історію
Чіп Jalapeño від OpenAI опублікував результати бенчмарків, які перевершують сучасне апаратне забезпечення ШІ як за швидкістю інференсу, так і за енергоефективністю — поєднання, яке, якщо збережеться у виробничому масштабі, знизить вартість і затримку кожної моделі, що працює на OpenAI.

Чіп Jalapeño від OpenAI, створений спеціально для швидкого інференсу ШІ у масштабі.
Зображення: The Verge / The Verge AI
Jalapeño — це власний чіп ШІ від OpenAI, створений спеціально для інференсу — кроку, на якому навчена модель фактично генерує вихідні дані у відповідь на запит. Ця відмінність важлива: навчальні чіпи (H100 та їхні наступники, що домінують у заголовках про ШІ) оптимізовані для іншого навантаження. Кремній для інференсу визначає, наскільки швидко надходить відповідь і скільки електроенергії коштує її доставка.
За даними TechCrunch, Jalapeño тестувався на бенчмарку SemiAnalysis InferenceX і показав більше токенів на користувача та більшу пропускну здатність на кіловат, ніж сучасні аналоги. Для робочих процесів із генерацією зображень і відео за допомогою ШІ, що звертаються до API OpenAI, ці два показники мають пряме значення: більше токенів на користувача означає меншу чергу під навантаженням, а більша пропускна здатність на кіловат — нижчу операційну вартість кожної генерації.

Показник часу між токенами (TBT) Jalapeño порівняно з конкуруючим апаратним забезпеченням для інференсу.
Зображення: The Verge / The Verge AI
Більшість апаратного забезпечення для інференсу змушує йти на компроміс: зменшення затримки (швидший перший токен, жвавіші відповіді) коштує сирої пропускної здатності, і навпаки. Саме ця напруга робить обслуговування великих моделей у масштабі дорогим — оператори змушені надмірно забезпечувати ресурси, щоб обидва показники залишалися прийнятними.
За даними The Verge, віцепрезидент OpenAI з апаратного забезпечення Річард Хо повідомив журналістам, що Jalapeño обходить цей компроміс.
«Найкраще з обох світів — нижча затримка та вища пропускна здатність.»
— Richard Ho, OpenAI VP of Hardware
Якщо це твердження підтвердиться в умовах реального виробничого трафіку — а це суттєве застереження — це означає, що OpenAI зможе обслуговувати більше одночасних користувачів без стрибків затримки, які наразі роблять API генерації зображень повільними в години пік. Для творців, які виконують пакетні завдання через API або будують конвеєри генерації на основі моделей OpenAI, це практична перевага.

Jalapeño виконує більше роботи на кіловат, ніж конкуруюче апаратне забезпечення для інференсу, за даними OpenAI.
Зображення: The Verge / The Verge AI
OpenAI є очевидним переможцем у короткостроковій перспективі: власний кремній означає, що компанія більше не залежить повністю від постачання та ціноутворення Nvidia щодо потужностей для інференсу. Цей важіль має значення — коли Stability AI та інші зіткнулися з дефіцитом GPU у 2023 році, витрати на інференс зросли, а доступність API погіршилася. Володіння стеком чіпів захищає OpenAI від такого тиску.
Питання для творців полягає в тому, чи досягнуть переваги ефективності ціноутворення API. Історично заощадження на інфраструктурі на цьому рівні врешті-решт стискають витрати — але часові рамки вимірюються продуктовими циклами, а не кварталами. OpenAI не оголошував змін у ціноутворенні, пов'язаних із Jalapeño.
Варто зазначити одне застереження: дані бенчмарків надходять із власного розкриття інформації OpenAI. InferenceX від SemiAnalysis є авторитетною методологією, але конкретні умови запуску, розміри моделей і конфігурації пакетів ще не були незалежно відтворені у масштабі. Цифри достатньо достовірні, щоб сприймати їх серйозно; але вони ще не є встановленим фактом.
Для творців, які обирають між моделями, розміщеними на OpenAI, та самостійно розгорнутими альтернативами на таких платформах, як каталог моделей Charmloop, результати Jalapeño свідчать про те, що розміщений інференс OpenAI може розширити свою перевагу в швидкості над сторонніми розгортаннями GPU — принаймні до того, як конкуренти відповідять власним кремнієм. Наступним конкретним орієнтиром стане те, чи зміняться показники затримки API OpenAI відчутно після розгортання Jalapeño у виробничому масштабі.