Bronnen
Leer het vak
Stapsgewijze gidsen over prompts, stijlen en hoe je het meeste uit AI-beeldgeneratie haalt.
Lees de gidsenBespreek dit met
Kies een companion en ontdek wat die van dit verhaal vindt

Elias legt het onderzoek achter de koppen uit in gewone taal.
Stapsgewijze gidsen over prompts, stijlen en hoe je het meeste uit AI-beeldgeneratie haalt.
Lees de gidsenKies een companion en ontdek wat die van dit verhaal vindt
Liquid AI heeft een nieuw vision-language-model gepubliceerd genaamd LFM2.5-VL-DSpark, dat afbeeldingen en tekst samen verwerkt tot drie keer sneller dan vergelijkbare modellen op standaard Hugging Face-inferentiehardware — een snelheidswinst die de wachttijden voor creators die VLM's gebruiken om gegenereerde afbeeldingen te ondertitelen, beschrijven of analyseren in hun workflows aanzienlijk kan verkorten.
DSpark is Liquid AI's inferentieversnellingstechniek — beschouw het als een optimalisatie op compilerniveau die herstructureert hoe het model tokens verwerkt, zodat meer berekeningen parallel plaatsvinden op dezelfde GPU. Het resultaat is een hogere doorvoer: meer afbeeldingen geanalyseerd per seconde, of snellere responstijden bij enkelvoudige query's, zonder het onderliggende model opnieuw te trainen of het aantal parameters te verkleinen.
Dat onderscheid is belangrijk. Veel snelheidsverbeteringen in de VLM-ruimte komen voort uit kwantisatie — het verminderen van numerieke precisie om geheugen te besparen en snelheid te winnen, wat fijne details in afbeeldingsbeschrijvingen kan vervagen. DSpark werkt op het niveau van inferentieplanning, zodat de modelgewichten intact blijven en de uitvoerkwaliteit behouden blijft.

Liquid AI's DSpark-Vision-inferentie-optimalisatielaag herstructureert tokenverwerking voor hogere GPU-parallellisme.
Afbeelding: Hugging Face Blog
Voor de meeste AI-kunstcreators duikt een VLM op in een paar specifieke situaties: het automatisch ondertitelen van datasets voor fine-tuning, het uitvoeren van image-to-text-prompts om een stijl te reverse-engineeren, of het bouwen van geautomatiseerde kwaliteitscontroles op batchgeneraties. In alle drie de gevallen is de bottleneck hoeveel afbeeldingen het model per minuut kan verwerken, niet het ruwe aantal parameters.
Een 3× hogere doorvoer op dezelfde hardware vertaalt zich direct naar kosten. Als een creator een ondertitelingstaak uitvoert op 10.000 afbeeldingen en per rekentijd betaalt, betekent drie keer de doorvoer ruwweg een derde van de rekening — of dezelfde rekening met drie keer de output. Voor iedereen die experimenteert met AI-beeldgeneratie op schaal is die rekensom de moeite waard om op te letten.

Benchmarkresultaten tonen dat LFM2.5-VL-DSpark tot 3× hogere doorvoer behaalt ten opzichte van het basismodel op identieke Hugging Face-hardware.
Afbeelding: Hugging Face Blog
Liquid AI's eigen benchmarks tonen nauwkeurigheidspariteit met de niet-DSpark LFM2.5-VL. De eerlijke kanttekening: die cijfers zijn afkomstig van Liquid AI zelf, en onafhankelijke evaluaties door derden zijn nog niet verschenen. Het model is open genoeg om te testen op Hugging Face, dus community-benchmarks zouden snel moeten volgen — maar creators die gegarandeerde nauwkeurigheid nodig hebben voor productie-ondertitelingspipelines, moeten hun eigen steekproeven uitvoeren voordat ze zich vastleggen.

Liquid AI's gepubliceerde resultaten tonen geen nauwkeurigheidsachteruitgang naast de doorvoerwinsten — hoewel onafhankelijke verificatie nog in behandeling is.
Afbeelding: Hugging Face Blog
De release valt ook samen met een moment waarop het bredere Hugging Face-ecosysteem zijn ondersteuning voor geoptimaliseerde modelformaten uitbreidt. Hugging Face heeft onlangs native GGUF-gekwantiseerde modelondersteuning toegevoegd aan de Transformers-bibliotheek, wat een bredere beweging signaleert om efficiënte inferentie tot een eersteklas prioriteit op het platform te maken in plaats van een bijzaak.
Het model laadt via de standaard Hugging Face Transformers-pipeline, zodat elke creator die al VLM-inferentie lokaal of via Hugging Face Inference Endpoints uitvoert, LFM2.5-VL-DSpark kan inwisselen met minimale codewijzigingen. Liquid AI's blogpost bevat voorbeeldcode voor inferentie. Voor creators die nieuw zijn met vision-language-modellen behandelen de Charmloop-handleidingen hoe VLM's passen in image-generatieworkflows — specifiek voor ondertiteling en prompt-inversietaken.
De praktische volgende stap voor iedereen die al een ondertitelings- of beeldanalysestap in zijn pipeline uitvoert: haal het model op, voer het uit op je bestaande testset en meet de werkelijke doorvoer op je hardware. Gepubliceerde cijfers zijn een startpunt, geen garantie — maar een 3× kop bij behouden nauwkeurigheid is een sterk genoeg signaal om die test een middag waard te maken.