Джерела
Подивись у дії
Переглянь моделі та стилі, що стоять за такими історіями — безкоштовний акаунт, галерея одразу.
Відкрити каталогОбговори це з
Обери компаньйона і дізнайся його думку про цю історію
Айріс пише про те, де ШІ-мистецтво зустрічається з культурою: стиль, авторство та образи, які мають значення.
Переглянь моделі та стилі, що стоять за такими історіями — безкоштовний акаунт, галерея одразу.
Відкрити каталогОбери компаньйона і дізнайся його думку про цю історію
LFM2.5-DSpark від Liquid AI досягає до 3,2 раза швидшого інференсу порівняно з базовою моделлю LFM2.5 на апаратному забезпеченні Apple Silicon, згідно з блогом Hugging Face — без жодного зафіксованого зниження якості вихідних даних.

LFM2.5-DSpark від Liquid AI — варіант LFM2.5 зі спекулятивним декодуванням, опублікований на Hugging Face.
Зображення: Hugging Face Blog
Пришвидшення — це не трюк зі стисненням. DSpark використовує спекулятивне декодування: компактна чернеткова модель пропонує послідовність токенів, а повна модель LFM2.5 верифікує їх за один прямий прохід. Коли чернетка правильна — а так буває більшість часу — система пропускає повільний цикл генерації токен за токеном. Результат — менше послідовних кроків для отримання того самого виводу, саме тому якість залишається незмінною, тоді як реальний час скорочується.
Для тих, хто запускає конвеєри підпису зображень, робочі процеси розширення промптів або генерацію діалогів персонажів локально на Mac серії M, ця різниця аж ніяк не теоретична. Прискорення у 3,2 раза для завдання, яке раніше займало вісім секунд, тепер вкладається менш ніж у три. Цикли ітерацій, що здавалися млявими, стають достатньо чуйними, щоб не виривати з творчого потоку.

Бенчмарки затримки BFCL показують, що LFM2.5-DSpark демонструє суттєво менший час відповіді порівняно з базовою моделлю на апаратному забезпеченні Apple Silicon.
Зображення: Hugging Face Blog
Цифри бенчмарків прив'язані до Apple Silicon. Чипи серії M особливо добре справляються з вимогами до пропускної здатності пам'яті при спекулятивному декодуванні — уніфікована архітектура пам'яті означає, що чернеткова та верифікаційна моделі використовують один пул без вузького місця PCIe, яке може нівелювати переваги на дискретних GPU. Авторам, що працюють на CUDA-системах, варто сприймати цифру 3,2x як верхню межу, а не гарантію; опубліковані дані Liquid AI не стверджують про еквівалентні переваги на апаратному забезпеченні NVIDIA.
Сам по собі цей акцент на Apple є сигналом. Дедалі більша частка спільноти локального інференсу працює на MacBook Pro та Mac Studio — машинах, які історично поступалися NVIDIA за сирою пропускною здатністю, але тепер є домом для серйозної екосистеми квантизованих та оптимізованих моделей. DSpark — це прямий крок назустріч цій аудиторії.
Практична перевага виходить за межі чистої швидкості. Швидша генерація токенів означає, що цикли уточнення промптів — туди-сюди з коригуванням опису персонажа або сценарного брифу перед передачею до генератора зображень — скорочуються з хвилин до секунд. Автори, які використовують LLM як перший шар перед зверненням до моделі зображень у своєму робочому процесі генерації AI-зображень, відчують різницю одразу.
Спекулятивне декодування також, як правило, зберігає стилістичний регістр моделі, оскільки останнє слово щодо кожного токена залишається за верифікатором, а не за чернеткою. Чернеткова модель може помилятися; велика модель її виправляє. Саме ця асиметрія дозволяє Liquid AI переконливо заявляти про відсутність втрати якості — архітектура забезпечує це структурно, а не через постфактумне налаштування.
Оптимізація інференсу у відкритих моделях цього року різко прискорилася: менші лабораторії знаходять резерви, які закриті API-провайдери рідко публікують. Дослідження каталогу моделей для локально запускуваних варіантів стає дедалі реальнішим для авторів, яким потрібна швидкість без хмарних рахунків. DSpark — один із найчистіших прикладів цієї тенденції: справжнє інженерне покращення, доступне вже зараз, з доданими бенчмарками.