Sources
Voyez-le à l’œuvre
Parcourez les modèles et les styles derrière des histoires comme celle-ci — compte gratuit, galerie immédiate.
Explorer le catalogueEn discuter avec
Choisissez un compagnon et découvrez son avis sur cette histoire
Iris couvre la rencontre entre l'art IA et la culture : le style, la paternité des œuvres et les images qui comptent.
Parcourez les modèles et les styles derrière des histoires comme celle-ci — compte gratuit, galerie immédiate.
Explorer le catalogueChoisissez un compagnon et découvrez son avis sur cette histoire
LFM2.5-DSpark de Liquid AI atteint une inférence jusqu'à 3,2x plus rapide que le modèle LFM2.5 de base sur le matériel Apple Silicon, selon le blog Hugging Face — sans dégradation signalée de la qualité des sorties.

LFM2.5-DSpark de Liquid AI, la variante à décodage spéculatif de LFM2.5, publiée sur Hugging Face.
Image : Hugging Face Blog
Le gain de vitesse n'est pas un tour de compression. DSpark utilise le décodage spéculatif : un modèle brouillon compact propose une séquence de tokens, et le modèle LFM2.5 complet les vérifie en une seule passe avant. Lorsque le brouillon est correct — ce qui est le cas la plupart du temps — le système court-circuite la lente boucle de génération token par token. Le résultat est un nombre réduit d'étapes séquentielles pour produire la même sortie, ce qui explique pourquoi la qualité reste intacte tandis que le temps réel s'effondre.
Pour quiconque exécute des pipelines de sous-titrage d'images, des workflows d'expansion de prompts ou de génération de dialogues de personnages en local sur un Mac de la série M, cet écart n'est pas théorique. Une accélération de 3,2x sur une tâche qui prenait auparavant huit secondes la ramène à moins de trois. Des boucles d'itération qui semblaient laborieuses deviennent suffisamment réactives pour rester dans le flux créatif.

Les benchmarks de latence BFCL montrent que LFM2.5-DSpark affiche des temps de réponse nettement inférieurs à ceux du modèle de base sur le matériel Apple Silicon.
Image : Hugging Face Blog
Les chiffres de benchmark sont liés à Apple Silicon. Les puces de la série M gèrent particulièrement bien les exigences en bande passante mémoire du décodage spéculatif — l'architecture à mémoire unifiée signifie que les modèles brouillon et vérificateur partagent le même pool sans le goulot d'étranglement PCIe qui peut émousser les gains sur les configurations GPU discrets. Les créateurs utilisant des rigs CUDA devraient considérer le chiffre de 3,2x comme une limite supérieure, non comme une garantie ; les données publiées par Liquid AI ne revendiquent pas des gains équivalents sur le matériel NVIDIA.
Cet ancrage prioritaire dans l'écosystème Apple est lui-même un signal. Une part croissante de la communauté d'inférence locale tourne sur des MacBook Pros et des Mac Studios — des machines qui ont historiquement été en retrait par rapport à NVIDIA en débit brut, mais qui hébergent désormais un écosystème sérieux de modèles quantifiés et optimisés. DSpark est une offensive directe vers ce public.
L'avantage pratique va au-delà de la vitesse brute. Une génération de tokens plus rapide signifie que les cycles de raffinement des prompts — les allers-retours pour ajuster une description de personnage ou un brief de scène avant de l'envoyer à un générateur d'images — se compriment de minutes en secondes. Les créateurs qui utilisent des LLM comme couche de premier passage avant d'atteindre un modèle d'image dans leur workflow de génération d'images IA ressentiront immédiatement la différence.
Le décodage spéculatif tend également à préserver le registre stylistique du modèle, car c'est le vérificateur, et non le brouillon, qui a le dernier mot sur chaque token. Le modèle brouillon peut se tromper ; le grand modèle le corrige. Cette asymétrie explique pourquoi Liquid AI peut légitimement affirmer qu'il n'y a aucune perte de qualité — l'architecture l'impose structurellement, et non par un ajustement après coup.
L'optimisation de l'inférence en poids ouverts s'est fortement accélérée cette année, de petits laboratoires trouvant des marges que les fournisseurs d'API fermées publient rarement. Explorer le catalogue de modèles pour des options exécutables en local est de plus en plus viable pour les créateurs qui veulent de la vitesse sans facture cloud. DSpark est l'un des exemples les plus nets de cette tendance : une véritable amélioration d'ingénierie, disponible dès maintenant, avec des benchmarks à l'appui.