Quellen
Lerne das Handwerk
Schritt-für-Schritt-Anleitungen zu Prompts, Stilen und dem Maximum aus der KI-Bildgenerierung.
Anleitungen lesenDarüber sprechen mit
Wähle einen Companion und erfahre seine Meinung zu dieser Story

Elias erklärt die Forschung hinter den Schlagzeilen in klarer Sprache.
Schritt-für-Schritt-Anleitungen zu Prompts, Stilen und dem Maximum aus der KI-Bildgenerierung.
Anleitungen lesenWähle einen Companion und erfahre seine Meinung zu dieser Story
Liquid AI hat ein neues Vision-Language-Modell namens LFM2.5-VL-DSpark veröffentlicht, das Bilder und Text gemeinsam bis zu dreimal schneller verarbeitet als vergleichbare Modelle auf Standard-Hugging-Face-Inferenz-Hardware – ein Geschwindigkeitsvorteil, der die Wartezeiten für Ersteller, die VLMs zum Beschriften, Beschreiben oder Analysieren generierter Bilder in ihren Workflows nutzen, spürbar verkürzen könnte.
DSpark ist Liquid AIs Inferenz-Beschleunigungstechnik – man kann es sich als eine Optimierung auf Compiler-Ebene vorstellen, die umstrukturiert, wie das Modell Tokens verarbeitet, sodass mehr Berechnungen parallel auf derselben GPU stattfinden. Das Ergebnis ist ein höherer Durchsatz: mehr analysierte Bilder pro Sekunde oder schnellere Antwortzeiten bei einzelnen Anfragen – ohne das zugrunde liegende Modell neu zu trainieren oder seine Parameteranzahl zu reduzieren.
Dieser Unterschied ist wichtig. Viele Geschwindigkeitsverbesserungen im VLM-Bereich entstehen durch Quantisierung – die Reduzierung der numerischen Präzision, um Speicher zu sparen und Geschwindigkeit zu gewinnen, was feine Details in Bildbeschreibungen verwischen kann. DSpark arbeitet auf der Ebene der Inferenz-Planung, sodass die Modellgewichte intakt bleiben und die Ausgabequalität erhalten bleibt.

Liquid AIs DSpark-Vision-Inferenz-Optimierungslayer strukturiert die Token-Verarbeitung für höhere GPU-Parallelität um.
Bild: Hugging Face Blog
Für die meisten KI-Kunst-Ersteller taucht ein VLM an einigen spezifischen Stellen auf: beim automatischen Beschriften von Datensätzen für das Fine-Tuning, beim Ausführen von Bild-zu-Text-Prompts zur Rückentwicklung eines Stils oder beim Aufbau automatisierter Qualitätsprüfungen für Batch-Generierungen. In allen drei Fällen ist der Engpass, wie viele Bilder das Modell pro Minute verarbeiten kann, und nicht die rohe Parameteranzahl.
Eine 3-fache Durchsatzsteigerung auf derselben Hardware schlägt sich direkt in den Kosten nieder. Wenn ein Ersteller einen Beschriftungsauftrag für 10.000 Bilder ausführt und pro Rechenstunde bezahlt, bedeutet der dreifache Durchsatz ungefähr ein Drittel der Rechnung – oder dieselbe Rechnung mit der dreifachen Ausgabe. Für alle, die KI-Bildgenerierung im großen Maßstab ausprobieren, lohnt es sich, diese Rechnung im Blick zu behalten.

Benchmark-Ergebnisse zeigen, dass LFM2.5-VL-DSpark auf identischer Hugging-Face-Hardware einen bis zu 3-fachen Durchsatz gegenüber dem Basismodell erzielt.
Bild: Hugging Face Blog
Liquid AIs eigene Benchmarks zeigen Genauigkeitsparität mit dem Nicht-DSpark-LFM2.5-VL. Der ehrliche Vorbehalt: Diese Zahlen stammen von Liquid AI selbst, und unabhängige Drittanbieter-Evaluierungen sind noch nicht aufgetaucht. Das Modell ist offen genug, um es auf Hugging Face zu testen, sodass Community-Benchmarks schnell folgen sollten – aber Ersteller, die für Produktions-Beschriftungs-Pipelines garantierte Genauigkeit benötigen, sollten eigene Stichproben durchführen, bevor sie sich festlegen.

Liquid AIs veröffentlichte Ergebnisse zeigen keine Genauigkeitsverschlechterung neben den Durchsatzgewinnen – obwohl eine unabhängige Überprüfung noch aussteht.
Bild: Hugging Face Blog
Die Veröffentlichung fällt auch in einen Moment, in dem das breitere Hugging-Face-Ökosystem seine Unterstützung für optimierte Modellformate ausbaut. Hugging Face hat kürzlich native GGUF-Quantisierungsmodell-Unterstützung zur Transformers-Bibliothek hinzugefügt, was auf einen breiteren Vorstoß hindeutet, effiziente Inferenz auf der Plattform zu einem erstklassigen Anliegen zu machen und nicht zu einem Nachgedanken.
Das Modell lädt über die Standard-Hugging-Face-Transformers-Pipeline, sodass jeder Ersteller, der bereits VLM-Inferenz lokal oder über Hugging Face Inference Endpoints ausführt, LFM2.5-VL-DSpark mit minimalen Code-Änderungen einsetzen kann. Liquid AIs Blogbeitrag enthält Beispiel-Inferenzcode. Für Ersteller, die neu bei Vision-Language-Modellen sind, erläutern die Charmloop-Guides, wie VLMs in Bildgenerierungs-Workflows passen – speziell für Beschriftungs- und Prompt-Inversions-Aufgaben.
Der praktische nächste Schritt für alle, die bereits einen Beschriftungs- oder Bildanalyse-Schritt in ihrer Pipeline ausführen: das Modell laden, es gegen den vorhandenen Testdatensatz laufen lassen und den tatsächlichen Durchsatz auf der eigenen Hardware messen. Veröffentlichte Zahlen sind ein Ausgangspunkt, keine Garantie – aber ein 3-facher Spitzenwert bei beibehaltener Genauigkeit ist ein starkes genug Signal, um diesen Test einen Nachmittag lang zu rechtfertigen.