Fontes
Veja em ação
Explore os modelos e estilos por trás de histórias como esta — conta gratuita e galeria na hora.
Explorar o catálogoConverse sobre isso com
Escolha um companheiro e veja o que ele acha dessa história

Theo transforma as notícias de IA em coisas para você testar ainda hoje à noite.
Explore os modelos e estilos por trás de histórias como esta — conta gratuita e galeria na hora.
Explorar o catálogoEscolha um companheiro e veja o que ele acha dessa história
A Liquid AI publicou modelos de decisão d1 com pesos abertos, projetados para executar inferência multimodal diretamente em hardware de borda — celulares, laptops e chips embarcados — sem enviar dados a um servidor na nuvem. Para criadores que desejam inferência local mais rápida e privada em seus fluxos de trabalho, trata-se de uma mudança arquitetural significativa.
A maioria dos modelos multimodais é projetada para GPUs de data center e acessada por meio de uma API. Os modelos d1 da Liquid AI são construídos em torno de uma prioridade diferente: executar um ciclo completo de decisão — perceber entradas, raciocinar, produzir uma saída — em hardware com orçamentos restritos de memória e processamento. De acordo com a publicação no blog do Hugging Face, a família d1 utiliza a arquitetura proprietária da Liquid AI (derivada das Liquid Neural Networks) em vez de um backbone transformer padrão, o que contribui para seu menor consumo de memória.
A consequência prática: um criador que utiliza uma configuração local de ComfyUI ou Automatic1111 poderia, em princípio, inserir um modelo d1 em um nó de fluxo de trabalho que toma decisões de roteamento ou legendagem de imagens — sem que essa etapa acesse uma API externa ou adicione latência de nuvem.

Os modelos d1 abertos da Liquid AI processam texto, imagem e dados estruturados em uma única passagem de inferência em hardware de borda.
Imagem: Hugging Face Blog
Pesos abertos é a expressão-chave aqui. Você baixa os pesos uma vez, os executa em seu próprio hardware e não paga nada por inferência. Para um criador que processa centenas de imagens em lote — gerando legendas, roteando saídas por tipo de conteúdo ou executando verificações automáticas de qualidade — eliminar as taxas de API por chamada faz uma diferença considerável. Compare isso com o acesso a modelos restrito por assinatura que se tornou comum em outros lugares: o Google recentemente limitou os usuários gratuitos do Gemini ao seu nível mais leve, o Flash Lite, conforme abordado em nosso relatório sobre as mudanças no plano gratuito do Google.
O ajuste fino também é uma opção. Como os pesos são abertos, um criador que trabalha em um nicho específico — visualização arquitetônica, geração de fichas de personagens, fotografia de produtos — poderia ajustar um modelo d1 com dados específicos do domínio para tornar suas decisões de roteamento ou legendagem mais precisas para aquele caso de uso exato.
Considere um criador de arte de personagens que gera 200 imagens em um lote e precisa classificar automaticamente as saídas por nível de qualidade antes do upscaling. Hoje, isso geralmente significa revisão manual ou uma chamada de API a um modelo de visão para cada imagem. Um modelo d1 executado localmente poderia lidar com essa etapa de classificação na mesma máquina que realiza a geração — sem salto de rede, sem custo por imagem, sem dados saindo do estúdio.
A configuração ainda não é plug-and-play. Você precisará baixar os pesos do Hugging Face, confirmar que seu hardware atende aos requisitos de memória especificados pela Liquid AI e integrar o modelo ao seu pipeline manualmente. Se você já tem experiência em baixar modelos do Hub e executar scripts de inferência, o atrito é baixo. Se você é mais novo na implantação local de modelos, os guias da Charmloop cobrem os fundamentos para colocar modelos com pesos abertos em funcionamento localmente.
O lançamento do d1 está em estágio inicial. Números de benchmark em comparação com modelos de borda similares — os modelos on-device da Apple, a stack de IA de borda da Qualcomm ou a série Phi da Microsoft — ainda não estão amplamente disponíveis para comparação direta. A arquitetura da Liquid AI também é menos testada em pipelines criativas do que modelos baseados em transformer, que contam com anos de ferramentas desenvolvidas pela comunidade. Espere alguma dificuldade de integração antes que as comunidades mais amplas de ComfyUI e Automatic1111 construam nós padronizados para ela.
Dito isso, modelos multimodais com pesos abertos otimizados para hardware de borda ainda são escassos o suficiente para que a família d1 preencha uma lacuna real — especialmente para criadores que aguardavam uma opção executável localmente que lide com mais do que apenas texto. Explore o que está disponível para seus próprios fluxos de trabalho de geração de imagens enquanto as ferramentas da comunidade se desenvolvem.