Источники
Освой мастерство
Пошаговые гайды о промптах, стилях и о том, как выжать максимум из генерации изображений ИИ.
Читать гайдыОбсуди это с
Выбери компаньона и узнай его мнение об этой истории

Элиас простым языком объясняет исследования, стоящие за заголовками.
Пошаговые гайды о промптах, стилях и о том, как выжать максимум из генерации изображений ИИ.
Читать гайдыВыбери компаньона и узнай его мнение об этой истории
Liquid AI опубликовала новую визуально-языковую модель LFM2.5-VL-DSpark, которая обрабатывает изображения и текст совместно до трёх раз быстрее, чем сопоставимые модели на стандартном инференс-оборудовании Hugging Face — прирост скорости, способный ощутимо сократить время ожидания для авторов, использующих VLM для подписи, описания или анализа сгенерированных изображений в своих рабочих процессах.
DSpark — это техника ускорения инференса от Liquid AI: представьте её как оптимизацию на уровне компилятора, которая перестраивает обработку токенов моделью так, чтобы больше вычислений выполнялось параллельно на одном GPU. Результат — более высокая пропускная способность: больше изображений анализируется в секунду или быстрее обрабатываются одиночные запросы, без переобучения базовой модели и уменьшения числа её параметров.
Это различие принципиально. Многие улучшения скорости в пространстве VLM достигаются за счёт квантизации — снижения числовой точности для экономии памяти и ускорения работы, что может размывать мелкие детали в описаниях изображений. DSpark работает на уровне планирования инференса, поэтому веса модели остаются нетронутыми, а качество вывода сохраняется.

Слой оптимизации инференса DSpark-Vision от Liquid AI перестраивает обработку токенов для повышения параллелизма на GPU.
Изображение: Hugging Face Blog
Для большинства авторов ИИ-арта VLM появляется в нескольких конкретных местах: автоматическая подпись датасетов для дообучения, запуск промптов «изображение в текст» для реверс-инжиниринга стиля или построение автоматических проверок качества пакетных генераций. Во всех трёх случаях узким местом является количество изображений, которые модель может обработать в минуту, а не количество параметров.
Трёхкратный прирост пропускной способности на том же оборудовании напрямую влияет на стоимость. Если автор запускает задачу подписи 10 000 изображений и платит за вычислительное время, трёхкратная пропускная способность означает примерно треть счёта — или тот же счёт при втрое большем объёме работы. Для тех, кто экспериментирует с генерацией ИИ-изображений в масштабе, эта арифметика заслуживает внимания.

Результаты бенчмарков показывают, что LFM2.5-VL-DSpark достигает до 3-кратного увеличения пропускной способности по сравнению с базовой моделью на идентичном оборудовании Hugging Face.
Изображение: Hugging Face Blog
Собственные бенчмарки Liquid AI демонстрируют паритет точности с LFM2.5-VL без DSpark. Честная оговорка: эти цифры получены самой Liquid AI, и независимые сторонние оценки пока не появились. Модель достаточно открыта для тестирования на Hugging Face, поэтому бенчмарки сообщества должны появиться быстро — однако авторам, которым требуется гарантированная точность для производственных пайплайнов подписи, следует провести собственные выборочные проверки перед внедрением.

Опубликованные результаты Liquid AI не показывают регрессии точности наряду с приростом пропускной способности — хотя независимая верификация пока ожидается.
Изображение: Hugging Face Blog
Релиз также выходит в момент, когда более широкая экосистема Hugging Face расширяет поддержку оптимизированных форматов моделей. Hugging Face недавно добавила нативную поддержку квантизированных моделей GGUF в библиотеку Transformers, сигнализируя о более широком стремлении сделать эффективный инференс первоклассной задачей платформы, а не второстепенной.
Модель загружается через стандартный пайплайн Hugging Face Transformers, поэтому любой автор, уже запускающий инференс VLM локально или через Hugging Face Inference Endpoints, может подключить LFM2.5-VL-DSpark с минимальными изменениями кода. Публикация в блоге Liquid AI содержит примеры кода для инференса. Для авторов, только знакомящихся с визуально-языковыми моделями, руководства Charmloop рассказывают о том, как VLM вписываются в рабочие процессы генерации изображений — в частности, для задач подписи и инверсии промптов.
Практический следующий шаг для тех, кто уже использует этап подписи или анализа изображений в своём пайплайне: загрузите модель, запустите её на своём существующем тестовом наборе и измерьте реальную пропускную способность на вашем оборудовании. Опубликованные цифры — это отправная точка, а не гарантия, — но заголовок «3×» при сохранённой точности достаточно убедителен, чтобы потратить на этот тест один вечер.