Fuentes
Aprende el oficio
Guías paso a paso sobre prompts, estilos y cómo sacar el máximo partido a la generación de imágenes con IA.
Leer las guíasComéntalo con
Elige un compañero y descubre su opinión sobre esta noticia

Elias explica la investigación detrás de los titulares en lenguaje claro.
Guías paso a paso sobre prompts, estilos y cómo sacar el máximo partido a la generación de imágenes con IA.
Leer las guíasElige un compañero y descubre su opinión sobre esta noticia
Liquid AI ha publicado un nuevo modelo de visión-lenguaje llamado LFM2.5-VL-DSpark que procesa imágenes y texto juntos hasta tres veces más rápido que modelos comparables en hardware de inferencia estándar de Hugging Face — una ganancia de velocidad que podría reducir significativamente los tiempos de espera para creadores que usan VLMs para subtitular, describir o analizar imágenes generadas en sus flujos de trabajo.
DSpark es la técnica de aceleración de inferencia de Liquid AI — piénsalo como una optimización a nivel de compilador que reestructura cómo el modelo procesa tokens para que más computación ocurra en paralelo en la misma GPU. El resultado es mayor rendimiento: más imágenes analizadas por segundo, o tiempos de respuesta más rápidos para consultas individuales, sin reentrenar el modelo subyacente o reducir su cantidad de parámetros.
Esa distinción importa. Muchas mejoras de velocidad en el espacio VLM provienen de cuantización — reducir la precisión numérica para ahorrar memoria y ganar velocidad, lo que puede difuminar detalles finos en descripciones de imágenes. DSpark opera a nivel de programación de inferencia, por lo que los pesos del modelo permanecen intactos y la calidad de salida se mantiene.

La capa de optimización de inferencia DSpark-Vision de Liquid AI reestructura el procesamiento de tokens para mayor paralelismo de GPU.
Imagen: Hugging Face Blog
Para la mayoría de creadores de arte IA, un VLM aparece en algunos lugares específicos: auto-subtitulado de datasets para fine-tuning, ejecutar prompts de imagen-a-texto para hacer ingeniería inversa de un estilo, o construir verificaciones automáticas de calidad en generaciones por lotes. En los tres casos, el cuello de botella es cuántas imágenes puede procesar el modelo por minuto, no la cantidad bruta de parámetros.
Un salto de 3× en rendimiento en el mismo hardware se traduce directamente a costo. Si un creador está ejecutando un trabajo de subtitulado en 10,000 imágenes y pagando por hora de cómputo, tres veces el rendimiento significa aproximadamente un tercio de la factura — o la misma factura con tres veces la salida. Para cualquiera experimentando con generación de imágenes IA a escala, esa aritmética vale la pena considerar.

Los resultados de benchmarks muestran que LFM2.5-VL-DSpark logra hasta 3× rendimiento sobre el modelo de referencia en hardware idéntico de Hugging Face.
Imagen: Hugging Face Blog
Los benchmarks propios de Liquid AI muestran paridad de precisión con el LFM2.5-VL sin DSpark. La advertencia honesta: esos números provienen de la propia Liquid AI, y evaluaciones independientes de terceros aún no han surgido. El modelo es lo suficientemente abierto para probar en Hugging Face, por lo que benchmarks de la comunidad deberían seguir rápidamente — pero creadores que necesiten precisión garantizada para pipelines de subtitulado en producción deberían ejecutar sus propias verificaciones puntuales antes de comprometerse.

Los resultados publicados de Liquid AI no muestran regresión de precisión junto con las ganancias de rendimiento — aunque la verificación independiente aún está pendiente.
Imagen: Hugging Face Blog
El lanzamiento también llega en un momento cuando el ecosistema más amplio de Hugging Face está expandiendo su soporte para formatos de modelo optimizados. Hugging Face recientemente añadió soporte nativo de modelos cuantizados GGUF a la biblioteca Transformers, señalando un impulso más amplio para hacer de la inferencia eficiente una preocupación de primera clase en la plataforma en lugar de una idea tardía.
El modelo se carga a través del pipeline estándar de Hugging Face Transformers, por lo que cualquier creador que ya esté ejecutando inferencia VLM localmente o vía Hugging Face Inference Endpoints puede intercambiar LFM2.5-VL-DSpark con cambios mínimos de código. La publicación del blog de Liquid AI incluye código de ejemplo de inferencia. Para creadores nuevos en modelos de visión-lenguaje, las guías de Charmloop cubren cómo los VLMs encajan en flujos de trabajo de generación de imágenes — específicamente para tareas de subtitulado e inversión de prompts.
El siguiente paso práctico para cualquiera que ya esté ejecutando un paso de subtitulado o análisis de imágenes en su pipeline: descargar el modelo, ejecutarlo contra tu conjunto de pruebas existente, y medir el rendimiento real en tu hardware. Los números publicados son un punto de partida, no una garantía — pero un titular de 3× con precisión mantenida es una señal lo suficientemente fuerte para hacer que esa prueba valga una tarde.