Źródła
Opanuj rzemiosło
Poradniki krok po kroku o promptach, stylach i tym, jak wycisnąć maksimum z generowania obrazów AI.
Czytaj poradnikiPogadaj o tym z
Wybierz towarzysza i poznaj jego zdanie na temat tej historii

Elias tłumaczy badania stojące za nagłówkami prostym językiem.
Poradniki krok po kroku o promptach, stylach i tym, jak wycisnąć maksimum z generowania obrazów AI.
Czytaj poradnikiWybierz towarzysza i poznaj jego zdanie na temat tej historii
Liquid AI opublikowało nowy model wizualno-językowy o nazwie LFM2.5-VL-DSpark, który przetwarza obrazy i tekst jednocześnie nawet trzy razy szybciej niż porównywalne modele na standardowym sprzęcie do wnioskowania Hugging Face — wzrost prędkości, który może znacząco skrócić czas oczekiwania dla twórców używających VLM-ów do opisywania, charakteryzowania lub analizowania wygenerowanych obrazów w swoich przepływach pracy.
DSpark to technika akceleracji wnioskowania Liquid AI — można ją traktować jako optymalizację na poziomie kompilatora, która restrukturyzuje sposób przetwarzania tokenów przez model tak, aby więcej obliczeń odbywało się równolegle na tym samym GPU. Efektem jest wyższa przepustowość: więcej analizowanych obrazów na sekundę lub szybszy czas odpowiedzi na pojedyncze zapytanie — bez ponownego trenowania modelu bazowego ani zmniejszania liczby jego parametrów.
To rozróżnienie ma znaczenie. Wiele usprawnień prędkości w przestrzeni VLM pochodzi z kwantyzacji — redukcji precyzji numerycznej w celu oszczędzania pamięci i zyskania prędkości, co może rozmywać drobne szczegóły w opisach obrazów. DSpark działa na poziomie harmonogramowania wnioskowania, dzięki czemu wagi modelu pozostają nienaruszone, a jakość wyników jest zachowana.

Warstwa optymalizacji wnioskowania DSpark-Vision od Liquid AI restrukturyzuje przetwarzanie tokenów w celu zwiększenia równoległości GPU.
Obraz: Hugging Face Blog
Dla większości twórców AI-art VLM pojawia się w kilku konkretnych miejscach: automatyczne opisywanie zbiorów danych do fine-tuningu, uruchamianie promptów obraz-do-tekstu w celu odtworzenia stylu metodą inżynierii wstecznej lub budowanie automatycznych kontroli jakości dla generacji wsadowych. We wszystkich trzech przypadkach wąskim gardłem jest liczba obrazów, które model może przetworzyć na minutę, a nie surowa liczba parametrów.
3-krotny wzrost przepustowości na tym samym sprzęcie przekłada się bezpośrednio na koszty. Jeśli twórca wykonuje zadanie opisywania 10 000 obrazów i płaci za godzinę obliczeniową, trzykrotna przepustowość oznacza mniej więcej jedną trzecią rachunku — lub ten sam rachunek przy trzykrotnie większej wydajności. Dla każdego eksperymentującego z generowaniem obrazów AI na dużą skalę ta arytmetyka jest warta uwagi.

Wyniki benchmarków pokazują, że LFM2.5-VL-DSpark osiąga nawet 3-krotną przepustowość w stosunku do modelu bazowego na identycznym sprzęcie Hugging Face.
Obraz: Hugging Face Blog
Własne benchmarki Liquid AI wykazują równoważność dokładności z LFM2.5-VL bez DSpark. Uczciwe zastrzeżenie: te liczby pochodzą od samego Liquid AI, a niezależne oceny stron trzecich jeszcze się nie pojawiły. Model jest wystarczająco otwarty, aby testować go na Hugging Face, więc benchmarki społeczności powinny pojawić się szybko — jednak twórcy potrzebujący gwarantowanej dokładności w produkcyjnych potokach opisywania powinni przeprowadzić własne wyrywkowe testy przed podjęciem zobowiązania.

Opublikowane wyniki Liquid AI nie wykazują regresji dokładności przy jednoczesnych wzrostach przepustowości — choć niezależna weryfikacja jest jeszcze w toku.
Obraz: Hugging Face Blog
Wydanie pojawia się również w momencie, gdy szerszy ekosystem Hugging Face rozszerza wsparcie dla zoptymalizowanych formatów modeli. Hugging Face niedawno dodało natywną obsługę skwantyzowanych modeli GGUF do biblioteki Transformers, sygnalizując szersze dążenie do uczynienia wydajnego wnioskowania priorytetem na platformie, a nie kwestią drugorzędną.
Model ładuje się przez standardowy potok Hugging Face Transformers, więc każdy twórca już uruchamiający wnioskowanie VLM lokalnie lub przez Hugging Face Inference Endpoints może zamienić go na LFM2.5-VL-DSpark przy minimalnych zmianach w kodzie. Wpis na blogu Liquid AI zawiera przykładowy kod wnioskowania. Dla twórców nowych w tematyce modeli wizualno-językowych przewodniki Charmloop opisują, jak VLM-y wpisują się w przepływy pracy generowania obrazów — szczególnie w zadaniach opisywania i inwersji promptów.
Praktyczny następny krok dla każdego, kto już uruchamia etap opisywania lub analizy obrazów w swoim potoku: pobierz model, uruchom go na swoim istniejącym zestawie testowym i zmierz rzeczywistą przepustowość na swoim sprzęcie. Opublikowane liczby to punkt wyjścia, nie gwarancja — ale wynik 3× przy zachowanej dokładności to wystarczająco silny sygnał, aby ten test był wart popołudnia.