Источники
Посмотри в деле
Полистай модели и стили, что стоят за такими историями — бесплатный аккаунт, галерея сразу.
Открыть каталогОбсуди это с
Выбери компаньона и узнай его мнение об этой истории
Ирис пишет о том, где ИИ-искусство встречается с культурой: стиль, авторство и образы, которые имеют значение.
Полистай модели и стили, что стоят за такими историями — бесплатный аккаунт, галерея сразу.
Открыть каталогВыбери компаньона и узнай его мнение об этой истории
LFM2.5-DSpark от Liquid AI достигает до 3,2 раза более высокой скорости инференса по сравнению с базовой моделью LFM2.5 на оборудовании Apple Silicon, согласно блогу Hugging Face — без какого-либо зафиксированного снижения качества выходных данных.

LFM2.5-DSpark от Liquid AI — вариант LFM2.5 со спекулятивным декодированием, опубликованный на Hugging Face.
Изображение: Hugging Face Blog
Прирост скорости — не трюк со сжатием. DSpark использует спекулятивное декодирование: компактная черновая модель предлагает последовательность токенов, а полная модель LFM2.5 верифицирует их за один прямой проход. Когда черновик оказывается верным — а это происходит в большинстве случаев — система пропускает медленный цикл пошаговой генерации токенов. В результате для получения того же вывода требуется меньше последовательных шагов, поэтому качество остаётся неизменным, а реальное время сокращается.
Для тех, кто запускает локально на Mac серии M конвейеры подписей к изображениям, рабочие процессы расширения промптов или генерацию диалогов персонажей, этот разрыв отнюдь не академический. Ускорение в 3,2 раза на задаче, которая раньше занимала восемь секунд, сокращает её до менее чем трёх. Итерационные циклы, казавшиеся медленными, становятся достаточно отзывчивыми, чтобы не выбиваться из творческого потока.

Бенчмарки задержки BFCL показывают, что LFM2.5-DSpark демонстрирует существенно меньшее время отклика по сравнению с базовой моделью на оборудовании Apple Silicon.
Изображение: Hugging Face Blog
Цифры бенчмарков привязаны к Apple Silicon. Чипы серии M особенно хорошо справляются с требованиями к пропускной способности памяти при спекулятивном декодировании — унифицированная архитектура памяти означает, что черновая и верифицирующая модели используют один пул без узкого места PCIe, которое может нивелировать прирост на дискретных GPU. Авторам, работающим на CUDA-системах, следует воспринимать цифру 3,2 раза как верхнюю границу, а не гарантию; опубликованные данные Liquid AI не претендуют на аналогичный прирост на оборудовании NVIDIA.
Сам акцент на Apple — уже сигнал. Растущая доля сообщества локального инференса работает на MacBook Pro и Mac Studio — машинах, которые исторически уступали NVIDIA по сырой пропускной способности, но теперь поддерживают серьёзную экосистему квантизованных и оптимизированных моделей. DSpark — прямая ставка на эту аудиторию.
Практическая выгода выходит за рамки чистой скорости. Более быстрая генерация токенов означает, что циклы уточнения промптов — итерационный процесс корректировки описания персонажа или сценарного брифа перед подачей в генератор изображений — сжимаются с минут до секунд. Авторы, использующие LLM как первичный слой перед обращением к модели изображений в своём рабочем процессе генерации AI-изображений, почувствуют разницу немедленно.
Спекулятивное декодирование также, как правило, сохраняет стилистический регистр модели, поскольку последнее слово за каждым токеном остаётся за верификатором, а не за черновиком. Черновая модель может ошибаться; большая модель её исправляет. Эта асимметрия объясняет, почему Liquid AI может убедительно заявлять об отсутствии потери качества — архитектура обеспечивает это структурно, а не через постфактумную настройку.
Оптимизация инференса на открытых весах в этом году резко ускорилась: небольшие лаборатории находят резервы, которые закрытые API-провайдеры редко публикуют. Изучение каталога моделей в поисках локально запускаемых вариантов становится всё более реальным для авторов, которым нужна скорость без облачных счетов. DSpark — один из наиболее показательных примеров этой тенденции: подлинное инженерное улучшение, доступное уже сейчас, с приложенными бенчмарками.