Źródła
Zobacz w akcji
Przejrzyj modele i style stojące za takimi historiami — darmowe konto i galeria od razu.
Przeglądaj katalogPogadaj o tym z
Wybierz towarzysza i poznaj jego zdanie na temat tej historii
Iris pisze o styku sztuki AI i kultury — o stylu, autorstwie i obrazach, które mają znaczenie.
Przejrzyj modele i style stojące za takimi historiami — darmowe konto i galeria od razu.
Przeglądaj katalogWybierz towarzysza i poznaj jego zdanie na temat tej historii
LFM2.5-DSpark od Liquid AI osiąga do 3,2x szybszy inference niż bazowy model LFM2.5 na sprzęcie Apple Silicon, zgodnie z blogiem Hugging Face — bez zgłaszanej degradacji jakości wyników.

LFM2.5-DSpark od Liquid AI, wariant LFM2.5 ze spekulatywnym dekodowaniem, opublikowany na Hugging Face.
Obraz: Hugging Face Blog
Zysk prędkości nie jest sztuczką kompresji. DSpark wykorzystuje spekulatywne dekodowanie: kompaktowy model szkicowy proponuje sekwencję tokenów, a pełny model LFM2.5 weryfikuje je w jednym przejściu w przód. Gdy szkic jest poprawny — a jest nim przez większość czasu — system pomija powolną pętlę generowania token po tokenie. Efektem jest mniejsza liczba sekwencyjnych kroków do uzyskania tego samego wyniku, dlatego jakość pozostaje nienaruszona, podczas gdy czas zegarowy drastycznie spada.
Dla każdego, kto uruchamia lokalnie na Maku z serii M potoki podpisywania obrazów, przepływy pracy rozwijania promptów lub generowanie dialogów postaci, ta różnica nie jest akademicka. Przyspieszenie 3,2x dla zadania, które wcześniej zajmowało osiem sekund, sprawia, że teraz trwa poniżej trzech. Pętle iteracji, które wydawały się ospałe, stają się wystarczająco responsywne, by utrzymać twórczy flow.

Benchmarki opóźnień BFCL pokazują, że LFM2.5-DSpark osiąga znacznie krótsze czasy odpowiedzi niż model bazowy na sprzęcie Apple Silicon.
Obraz: Hugging Face Blog
Wyniki benchmarków są powiązane z Apple Silicon. Układy z serii M szczególnie dobrze radzą sobie z wymaganiami przepustowości pamięci spekulatywnego dekodowania — ujednolicona architektura pamięci oznacza, że modele szkicowy i weryfikujący współdzielą tę samą pulę bez wąskiego gardła PCIe, które może osłabiać zyski w konfiguracjach z dyskretnymi GPU. Twórcy korzystający z układów opartych na CUDA powinni traktować wartość 3,2x jako górną granicę, a nie gwarancję; opublikowane dane Liquid AI nie twierdzą o równoważnych zyskach na sprzęcie NVIDIA.
To podejście stawiające Apple na pierwszym miejscu jest samo w sobie sygnałem. Rosnąca część społeczności lokalnego inference działa na MacBookach Pro i Mac Studios — maszynach, które historycznie pozostawały w tyle za NVIDIA pod względem surowej przepustowości, ale teraz są gospodarzem poważnego ekosystemu skwantyzowanych i zoptymalizowanych modeli. DSpark to bezpośrednia propozycja dla tej grupy odbiorców.
Praktyczne korzyści wykraczają poza samą prędkość. Szybsze generowanie tokenów oznacza, że cykle dopracowywania promptów — wymiana polegająca na dostosowywaniu opisu postaci lub briefu sceny przed podaniem go do generatora obrazów — skracają się z minut do sekund. Twórcy, którzy używają LLM jako warstwy pierwszego przejścia przed trafieniem do modelu obrazów w swoim przepływie pracy generowania obrazów AI, natychmiast odczują różnicę.
Spekulatywne dekodowanie ma również tendencję do zachowywania stylistycznego rejestru modelu, ponieważ to weryfikator, a nie szkic, ma ostatnie słowo przy każdym tokenie. Model szkicowy może się mylić; duży model go koryguje. Ta asymetria jest powodem, dla którego Liquid AI może wiarygodnie twierdzić o braku utraty jakości — architektura wymusza to strukturalnie, a nie poprzez dostrajanie post-hoc.
Optymalizacja inference na modelach open-weight gwałtownie przyspiesza w tym roku, a mniejsze laboratoria odkrywają rezerwy, które dostawcy zamkniętych API rzadko publikują. Przeglądanie katalogu modeli w poszukiwaniu opcji uruchamialnych lokalnie jest coraz bardziej opłacalne dla twórców, którzy chcą prędkości bez rachunku za chmurę. DSpark jest jednym z czystszych przykładów tego trendu: prawdziwe usprawnienie inżynieryjne, dostępne już teraz, z dołączonymi benchmarkami.