Źródła
Zobacz w akcji
Przejrzyj modele i style stojące za takimi historiami — darmowe konto i galeria od razu.
Przeglądaj katalogPogadaj o tym z
Wybierz towarzysza i poznaj jego zdanie na temat tej historii

Theo zamienia newsy o AI w rzeczy, które wypróbujesz jeszcze dziś wieczorem.
Przejrzyj modele i style stojące za takimi historiami — darmowe konto i galeria od razu.
Przeglądaj katalogWybierz towarzysza i poznaj jego zdanie na temat tej historii
Liquid AI opublikowało otwarte modele decyzyjne d1 zaprojektowane do uruchamiania multimodalnego wnioskowania bezpośrednio na sprzęcie brzegowym — telefonach, laptopach i układach wbudowanych — bez przesyłania danych do serwera w chmurze. Dla twórców pragnących szybszego, prywatnego i lokalnego wnioskowania w swoich przepływach pracy to istotna zmiana architektoniczna.\n\n## Najważniejsze wnioski\n\n- Otwarte modele d1 Liquid AI to otwarte wagowo multimodalne modele decyzyjne zbudowane specjalnie z myślą o wdrożeniu brzegowym, a nie infrastrukturze chmurowej.\n- Modele przetwarzają wiele typów danych wejściowych — tekst, obraz i dane strukturalne — w ramach jednego przebiegu wnioskowania na sprzęcie o ograniczonych zasobach.\n- „Otwarte wagi" oznaczają, że wagi są publicznie dostępne do pobrania i można je uruchamiać lokalnie, modyfikować lub dostrajać bez subskrypcji API.\n- Wdrożenie brzegowe oznacza niższe opóźnienia, brak kosztów za wywołanie API i brak danych opuszczających urządzenie — istotne przy wsadowym przetwarzaniu dużych zestawów obrazów lokalnie.\n- Modele są hostowane na Hugging Face, co sprawia, że są natychmiast dostępne dla twórców korzystających już z Hub do zarządzania modelami.\n\n## Co architektura d1 robi inaczej\n\nWiększość modeli multimodalnych jest projektowana z myślą o procesorach GPU w centrach danych i udostępniana przez API. Modele d1 Liquid AI zbudowano wokół innego priorytetu: uruchamiania pełnej pętli decyzyjnej — percepcja danych wejściowych, rozumowanie, generowanie wyniku — na sprzęcie o ograniczonej pamięci i mocy obliczeniowej. Zgodnie z wpisem na blogu Hugging Face rodzina d1 wykorzystuje autorską architekturę Liquid AI (wywodzącą się z Liquid Neural Networks), a nie standardowy szkielet transformera, co częściowo pozwala osiągnąć mniejszy ślad pamięciowy.\n\nPraktyczny wniosek: twórca korzystający z lokalnej konfiguracji ComfyUI lub Automatic1111 mógłby, co do zasady, wpiąć model d1 w węzeł przepływu pracy odpowiedzialny za routing obrazów lub ich opisywanie — bez konieczności odwoływania się do zewnętrznego API czy dodawania opóźnień chmurowych.\n\n\n\n## Szczegół dotyczący otwartych wag, który zmienia rachunek kosztów\n\nKluczowe słowo to „otwarte wagi". Pobierasz wagi raz, uruchamiasz je na własnym sprzęcie i nie płacisz nic za każde wnioskowanie. Dla twórcy, który wsadowo przetwarza setki obrazów — generując opisy, kierując wyniki według typu treści lub przeprowadzając automatyczne kontrole jakości — wyeliminowanie opłat za wywołania API szybko daje odczuwalne oszczędności. Porównaj to z dostępem do modeli uzależnionym od subskrypcji, który stał się powszechny gdzie indziej: Google niedawno ograniczyło bezpłatnym użytkownikom Gemini dostęp wyłącznie do najlżejszego poziomu Flash Lite, co opisaliśmy w naszym raporcie o zmianach w bezpłatnym planie Google.\n\nDostrajanie jest również możliwe. Ponieważ wagi są otwarte, twórca pracujący w określonej niszy — wizualizacji architektonicznej, generowaniu kart postaci, fotografii produktowej — mógłby dostroić model d1 na danych dziedzinowych, aby jego decyzje dotyczące routingu lub opisywania były ostrzejsze dla tego konkretnego zastosowania.\n\n## Gdzie to pasuje w prawdziwym lokalnym potoku\n\nWyobraź sobie twórcę grafiki postaci, który generuje 200 obrazów w partii i musi automatycznie posortować wyniki według poziomu jakości przed skalowaniem. Dziś oznacza to zazwyczaj ręczny przegląd lub wywołanie API do modelu wizyjnego dla każdego obrazu. Lokalnie działający model d1 mógłby obsłużyć ten krok klasyfikacji na tej samej maszynie, która wykonuje generowanie — bez skoku sieciowego, bez kosztu za obraz, bez danych opuszczających studio.\n\nKonfiguracja nie jest jeszcze gotowa od razu do użycia. Trzeba pobrać wagi z Hugging Face, potwierdzić, że sprzęt spełnia wymagania pamięciowe określone przez Liquid AI, i ręcznie wpiąć model w swój potok. Jeśli masz już doświadczenie w pobieraniu modeli z Hub i uruchamianiu skryptów wnioskowania, próg wejścia jest niski. Jeśli dopiero zaczynasz przygodę z lokalnym wdrażaniem modeli, przewodniki Charmloop omawiają podstawy uruchamiania modeli z otwartymi wagami lokalnie.\n\n## Gdzie są luki\n\nWydanie d1 jest na wczesnym etapie. Wyniki benchmarków w porównaniu z podobnymi modelami brzegowymi — modelami on-device Apple'a, stosem edge AI Qualcomm lub serią Phi Microsoftu — nie są jeszcze powszechnie dostępne do bezpośredniego porównania. Architektura Liquid AI jest też mniej sprawdzona w potokach kreatywnych niż modele oparte na transformerach, wokół których przez lata narosły narzędzia społecznościowe. Należy spodziewać się pewnych trudności integracyjnych, zanim szersze społeczności ComfyUI i Automatic1111 zbudują dla niej standardowe węzły.\n\nNiemniej jednak otwarte wagowo modele multimodalne zoptymalizowane pod kątem sprzętu brzegowego są wciąż na tyle rzadkie, że rodzina d1 wypełnia realną lukę — szczególnie dla twórców, którzy czekali na lokalnie uruchamialną opcję obsługującą więcej niż tylko tekst. Sprawdź, co jest dostępne dla Twoich własnych przepływów pracy z generowaniem obrazów, podczas gdy narzędzia społecznościowe nadrabiają zaległości.