Fonti
Guardalo in azione
Esplora i modelli e gli stili dietro storie come questa: account gratuito e galleria al volo.
Esplora il catalogoParlane con
Scegli un compagno e scopri cosa ne pensa di questa storia
Iris racconta dove l'arte IA incontra la cultura: stile, paternità delle opere e le immagini che contano.
Esplora i modelli e gli stili dietro storie come questa: account gratuito e galleria al volo.
Esplora il catalogoScegli un compagno e scopri cosa ne pensa di questa storia
LFM2.5-DSpark di Liquid AI raggiunge un'inferenza fino a 3,2 volte più veloce rispetto al modello base LFM2.5 su hardware Apple Silicon, secondo il blog di Hugging Face — senza alcuna degradazione riportata nella qualità dell'output.

LFM2.5-DSpark di Liquid AI, la variante con speculative decoding di LFM2.5, rilasciata su Hugging Face.
Immagine: Hugging Face Blog
Il guadagno in velocità non è un trucco di compressione. DSpark utilizza lo speculative decoding: un modello draft compatto propone una sequenza di token e il modello LFM2.5 completo li verifica in un singolo forward pass. Quando il draft è corretto — il che accade nella maggior parte dei casi — il sistema salta il lento ciclo di generazione token per token. Il risultato è un numero inferiore di passaggi sequenziali per produrre lo stesso output, motivo per cui la qualità rimane intatta mentre il tempo effettivo crolla.
Per chiunque esegua pipeline di image-captioning, workflow di prompt-expansion o generazione di dialoghi tra personaggi in locale su un Mac con chip serie M, questo divario non è teorico. Un'accelerazione di 3,2x su un task che in precedenza richiedeva otto secondi ora ne richiede meno di tre. I cicli di iterazione che sembravano lenti diventano abbastanza reattivi da mantenere il flusso creativo.

I benchmark di latenza BFCL mostrano LFM2.5-DSpark con tempi di risposta sostanzialmente inferiori rispetto al modello base su hardware Apple Silicon.
Immagine: Hugging Face Blog
I valori di benchmark sono legati ad Apple Silicon. I chip della serie M gestiscono particolarmente bene le esigenze di larghezza di banda della memoria richieste dallo speculative decoding — l'architettura a memoria unificata significa che i modelli draft e verifier condividono lo stesso pool senza il collo di bottiglia PCIe che può smorzare i guadagni su configurazioni con GPU discrete. I creator che utilizzano rig basati su CUDA dovrebbero considerare il valore di 3,2x come un limite superiore, non una garanzia; i dati pubblicati da Liquid AI non rivendicano guadagni equivalenti su hardware NVIDIA.
Questo posizionamento Apple-first è di per sé un segnale. Una fetta crescente della comunità di inferenza locale lavora su MacBook Pro e Mac Studio — macchine che storicamente sono rimaste indietro rispetto a NVIDIA in termini di throughput grezzo, ma che ora ospitano un ecosistema serio di modelli quantizzati e ottimizzati. DSpark è una mossa diretta verso quel pubblico.
Il vantaggio pratico va oltre la velocità grezza. Una generazione di token più rapida significa che i cicli di raffinamento dei prompt — il continuo aggiustamento di una descrizione di un personaggio o di un brief di scena prima di passare a un generatore di immagini — si comprimono da minuti a secondi. I creator che utilizzano gli LLM come primo livello prima di passare a un modello di immagini nel loro workflow di generazione di immagini AI sentiranno immediatamente la differenza.
Lo speculative decoding tende anche a preservare il registro stilistico del modello perché il verifier, non il draft, ha l'ultima parola su ogni token. Il modello draft può sbagliare; il modello grande lo corregge. Questa asimmetria è il motivo per cui Liquid AI può credibilmente affermare l'assenza di perdita di qualità — l'architettura la garantisce strutturalmente, non attraverso una messa a punto a posteriori.
L'ottimizzazione dell'inferenza open-weight ha accelerato notevolmente quest'anno, con lab più piccoli che trovano margini di miglioramento che i provider di API chiuse raramente pubblicano. Esplorare il catalogo dei modelli per opzioni eseguibili in locale è sempre più praticabile per i creator che vogliono velocità senza costi cloud. DSpark è uno degli esempi più chiari di questa tendenza: un genuino miglioramento ingegneristico, disponibile ora, con benchmark allegati.