Fuentes
Míralo en acción
Explora los modelos y estilos detrás de historias como esta: cuenta gratis y galería al instante.
Explorar el catálogoComéntalo con
Elige un compañero y descubre su opinión sobre esta noticia
Iris cubre el punto donde el arte con IA se encuentra con la cultura: estilo, autoría y las imágenes que importan.
Explora los modelos y estilos detrás de historias como esta: cuenta gratis y galería al instante.
Explorar el catálogoElige un compañero y descubre su opinión sobre esta noticia
LFM2.5-DSpark de Liquid AI logra inferencia hasta 3.2x más rápida que el modelo base LFM2.5 en hardware Apple Silicon, según el blog de Hugging Face — sin degradación reportada en la calidad de salida.

LFM2.5-DSpark de Liquid AI, la variante de decodificación especulativa de LFM2.5, lanzada en Hugging Face.
Imagen: Hugging Face Blog
La ganancia de velocidad no es un truco de compresión. DSpark usa decodificación especulativa: un modelo borrador compacto propone una secuencia de tokens, y el modelo LFM2.5 completo los verifica en un solo pase hacia adelante. Cuando el borrador está correcto — lo cual es, la mayoría del tiempo — el sistema omite el bucle lento de generación token por token. El resultado son menos pasos secuenciales para producir la misma salida, razón por la cual la calidad permanece intacta mientras el tiempo de reloj colapsa.
Para cualquiera ejecutando pipelines de subtitulado de imágenes, flujos de trabajo de expansión de prompts, o generación de diálogos de personajes localmente en una Mac serie M, esa brecha no es académica. Una aceleración de 3.2x en una tarea que previamente tomaba ocho segundos ahora toma menos de tres. Los bucles de iteración que se sentían lentos se vuelven lo suficientemente responsivos para mantenerse en el flujo creativo.

Los benchmarks de latencia BFCL muestran que LFM2.5-DSpark registra tiempos de respuesta sustancialmente menores que el modelo base en hardware Apple Silicon.
Imagen: Hugging Face Blog
Las cifras de benchmark están vinculadas a Apple Silicon. Los chips serie M manejan particularmente bien las demandas de ancho de banda de memoria de la decodificación especulativa — la arquitectura de memoria unificada significa que los modelos borrador y verificador comparten el mismo pool sin el cuello de botella PCIe que puede atenuar las ganancias en configuraciones de GPU discretas. Los creadores ejecutando equipos basados en CUDA deberían tratar la cifra de 3.2x como un límite superior, no una garantía; los datos publicados de Liquid AI no reclaman ganancias equivalentes en hardware NVIDIA.
Ese enfoque Apple-primero es en sí mismo una señal. Una porción creciente de la comunidad de inferencia local funciona en MacBook Pros y Mac Studios — máquinas que históricamente han quedado atrás de NVIDIA en rendimiento bruto pero ahora albergan un ecosistema serio de modelos cuantizados y optimizados. DSpark es una jugada directa para esa audiencia.
La ventaja práctica va más allá de la velocidad bruta. La generación más rápida de tokens significa que los ciclos de refinamiento de prompts — el ida y vuelta de ajustar una descripción de personaje o resumen de escena antes de alimentarlo a un generador de imágenes — se comprimen de minutos a segundos. Los creadores que usan LLMs como una capa de primer pase antes de usar un modelo de imagen en su flujo de trabajo de generación de imágenes AI sentirán la diferencia inmediatamente.
La decodificación especulativa también tiende a preservar el registro estilístico del modelo porque el verificador, no el borrador, tiene la palabra final en cada token. El modelo borrador puede estar equivocado; el modelo grande lo corrige. Esa asimetría es por qué Liquid AI puede afirmar creíblemente que no hay pérdida de calidad — la arquitectura lo impone estructuralmente, no a través de ajuste post-hoc.
La optimización de inferencia de peso abierto se ha estado acelerando bruscamente este año, con laboratorios más pequeños encontrando margen de mejora que los proveedores de API cerradas rara vez publican. Explorar el catálogo de modelos para opciones ejecutables localmente es cada vez más viable para creadores que quieren velocidad sin una factura de nube. DSpark es uno de los ejemplos más limpios de esa tendencia: una mejora de ingeniería genuina, disponible ahora, con benchmarks adjuntos.