Джерела
Подивись у дії
Переглянь моделі та стилі, що стоять за такими історіями — безкоштовний акаунт, галерея одразу.
Відкрити каталогОбговори це з
Обери компаньйона і дізнайся його думку про цю історію

Тео перетворює новини про ШІ на те, що можна спробувати вже сьогодні ввечері.
Переглянь моделі та стилі, що стоять за такими історіями — безкоштовний акаунт, галерея одразу.
Відкрити каталогОбери компаньйона і дізнайся його думку про цю історію
Liquid AI опублікувала відкриті вагові моделі d1 для прийняття рішень, розроблені для виконання мультимодального інференсу безпосередньо на периферійному обладнанні — смартфонах, ноутбуках та вбудованих чипах — без передачі даних на хмарний сервер. Для авторів, які прагнуть швидшого, приватного та локального інференсу у своїх робочих процесах, це суттєвий архітектурний зсув.
Більшість мультимодальних моделей розроблені для GPU у центрах обробки даних і доступні через API. Моделі d1 від Liquid AI побудовані навколо іншого пріоритету: виконання повного циклу прийняття рішень — сприйняття вхідних даних, міркування, формування результату — на обладнанні з жорсткими обмеженнями пам'яті та обчислювальних ресурсів. Згідно з публікацією в блозі Hugging Face, сімейство d1 використовує власну архітектуру Liquid AI (похідну від Liquid Neural Networks), а не стандартний трансформерний бекбон, що частково й забезпечує менший обсяг використання пам'яті.
Практичний результат: автор, який використовує локальне налаштування ComfyUI або Automatic1111, міг би, в принципі, вбудувати модель d1 у вузол робочого процесу, що приймає рішення щодо маршрутизації зображень або їх підписування — без звернення до зовнішнього API та без затримок хмари.

Відкриті моделі d1 від Liquid AI обробляють текст, зображення та структуровані дані в одному проході інференсу на периферійному обладнанні.
Зображення: Hugging Face Blog
Відкриті ваги — ось ключове слово. Ви завантажуєте ваги один раз, запускаєте їх на власному обладнанні та не платите нічого за кожен інференс. Для автора, який пакетно обробляє сотні зображень — генерує підписи, маршрутизує результати за типом вмісту або виконує автоматизовані перевірки якості — усунення плати за кожен виклик API швидко дає відчутну економію. Порівняйте це з доступом до моделей за підпискою, що став поширеним деінде: Google нещодавно обмежив безкоштовних користувачів Gemini найлегшим рівнем Flash Lite, як описано в нашому матеріалі про зміни безкоштовного плану Google.
Дотренування також є можливим. Оскільки ваги відкриті, автор, що працює у певній ніші — архітектурна візуалізація, генерація аркушів персонажів, предметна фотографія — може дотренувати модель d1 на специфічних для домену даних, щоб зробити її рішення щодо маршрутизації або підписування точнішими саме для цього випадку використання.
Уявіть автора, що створює арт персонажів, генерує 200 зображень у пакеті та потребує автоматичного сортування результатів за рівнем якості перед апскейлінгом. Сьогодні це зазвичай означає або ручний перегляд, або виклик API до моделі комп'ютерного зору для кожного зображення. Локально запущена модель d1 могла б виконувати цей крок класифікації на тій самій машині, що й генерацію — без мережевого переходу, без вартості за зображення, без витоку даних зі студії.
Налаштування ще не є простим у використанні. Вам потрібно буде завантажити ваги з Hugging Face, переконатися, що ваше обладнання відповідає вимогам до пам'яті, які вказує Liquid AI, та вручну інтегрувати модель у свій конвеєр. Якщо ви вже звикли завантажувати моделі з Hub та запускати скрипти інференсу, складнощів буде мало. Якщо ви новачок у локальному розгортанні моделей, посібники Charmloop охоплюють основи запуску відкритих вагових моделей локально.
Випуск d1 є раннім етапом. Порівняльні показники з аналогічними периферійними моделями — власними моделями Apple, стеком периферійного AI від Qualcomm або серією Phi від Microsoft — ще не широко доступні для прямого порівняння. Архітектура Liquid AI також менш перевірена у творчих конвеєрах, ніж трансформерні моделі, навколо яких роками формувалися інструменти спільноти. Очікуйте певних труднощів з інтеграцією, поки ширші спільноти ComfyUI та Automatic1111 не створять для неї стандартизовані вузли.
Проте відкриті вагові мультимодальні моделі, оптимізовані для периферійного обладнання, все ще достатньо рідкісні, щоб сімейство d1 заповнило реальну прогалину — особливо для авторів, які чекали на локально запускуваний варіант, що обробляє більше, ніж просто текст. Досліджуйте доступні можливості для власних робочих процесів генерації зображень, поки інструменти спільноти наздоганяють.