출처
이 소식에 대해 이야기 나누기
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요

Elias는 헤드라인 뒤의 연구를 쉬운 언어로 풀어냅니다.
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요

Liquid AI가 LFM2.5-VL-DSpark라는 새로운 비전-언어 모델을 공개했습니다. 이 모델은 표준 Hugging Face 추론 하드웨어에서 이미지와 텍스트를 동시에 처리하며 유사 모델 대비 최대 3배 빠른 속도를 구현합니다 — 생성된 이미지에 캡션을 달거나, 설명하거나, 분석하는 워크플로에 VLM을 활용하는 크리에이터의 대기 시간을 실질적으로 단축할 수 있는 속도 향상입니다.
DSpark는 Liquid AI의 추론 가속 기술입니다 — 컴파일러 수준의 최적화로, 동일한 GPU에서 더 많은 연산이 병렬로 처리되도록 모델의 토큰 처리 방식을 재구성한다고 이해하면 됩니다. 그 결과는 더 높은 처리량입니다: 초당 더 많은 이미지 분석, 또는 더 빠른 단일 쿼리 응답 시간 — 기반 모델을 재학습하거나 파라미터 수를 줄이지 않고도 달성합니다.
이 차이는 중요합니다. VLM 분야의 많은 속도 개선은 양자화(quantization)에서 비롯됩니다 — 수치 정밀도를 낮춰 메모리를 절약하고 속도를 높이는 방식으로, 이미지 설명의 세부 사항이 흐려질 수 있습니다. DSpark는 추론 스케줄링 수준에서 작동하므로 모델 가중치는 그대로 유지되고 출력 품질도 보존됩니다.

Liquid AI의 DSpark-Vision 추론 최적화 레이어는 더 높은 GPU 병렬성을 위해 토큰 처리 방식을 재구성합니다.
이미지: Hugging Face Blog
대부분의 AI 아트 크리에이터에게 VLM은 몇 가지 특정 상황에서 등장합니다: 파인튜닝을 위한 데이터셋 자동 캡셔닝, 스타일을 역분석하기 위한 이미지-텍스트 프롬프트 실행, 또는 배치 생성물에 대한 자동화된 품질 검사. 세 경우 모두 병목은 원시 파라미터 수가 아니라 모델이 분당 처리할 수 있는 이미지 수입니다.
동일 하드웨어에서 3배의 처리량 향상은 비용으로 직결됩니다. 크리에이터가 이미지 10,000장에 대한 캡셔닝 작업을 컴퓨팅 시간당 요금으로 실행한다면, 처리량이 3배가 되면 비용은 약 3분의 1로 줄어들거나 — 같은 비용으로 3배의 결과물을 얻을 수 있습니다. 대규모로 AI 이미지 생성을 실험하는 누구에게나 이 계산은 주목할 가치가 있습니다.

벤치마크 결과는 LFM2.5-VL-DSpark가 동일한 Hugging Face 하드웨어에서 기준 모델 대비 최대 3배의 처리량을 달성함을 보여줍니다.
이미지: Hugging Face Blog
Liquid AI의 자체 벤치마크는 DSpark 미적용 LFM2.5-VL과의 정확도 동등성을 보여줍니다. 솔직한 주의사항: 해당 수치는 Liquid AI 자체에서 나온 것이며, 독립적인 제3자 평가는 아직 등장하지 않았습니다. 모델은 Hugging Face에서 테스트할 수 있을 만큼 개방되어 있으므로 커뮤니티 벤치마크가 빠르게 뒤따를 것입니다 — 하지만 프로덕션 캡셔닝 파이프라인에서 정확도를 보장해야 하는 크리에이터는 확정하기 전에 자체 점검을 실행해야 합니다.

Liquid AI의 공개 결과는 처리량 향상과 함께 정확도 저하가 없음을 보여줍니다 — 다만 독립적 검증은 아직 진행 중입니다.
이미지: Hugging Face Blog
이번 출시는 더 넓은 Hugging Face 생태계가 최적화된 모델 형식 지원을 확장하는 시점에 이루어졌습니다. Hugging Face는 최근 Transformers 라이브러리에 네이티브 GGUF 양자화 모델 지원을 추가하며, 효율적인 추론을 플랫폼의 부차적 고려사항이 아닌 핵심 관심사로 만들려는 더 넓은 움직임을 알렸습니다.
모델은 표준 Hugging Face Transformers 파이프라인을 통해 로드되므로, 로컬 또는 Hugging Face Inference Endpoints를 통해 이미 VLM 추론을 실행 중인 크리에이터는 최소한의 코드 변경으로 LFM2.5-VL-DSpark로 교체할 수 있습니다. Liquid AI의 블로그 포스트에는 추론 예제 코드가 포함되어 있습니다. 비전-언어 모델이 처음인 크리에이터를 위해 Charmloop 가이드에서 VLM이 이미지 생성 워크플로에 어떻게 적합한지 — 특히 캡셔닝 및 프롬프트 역변환 작업에 대해 — 다루고 있습니다.
파이프라인에서 이미 캡셔닝 또는 이미지 분석 단계를 실행 중인 누구에게나 실질적인 다음 단계는: 모델을 가져와 기존 테스트 세트에 실행하고, 실제 하드웨어에서의 처리량을 측정하는 것입니다. 공개된 수치는 출발점이지 보장이 아닙니다 — 하지만 정확도를 유지하면서 3배라는 헤드라인 수치는 그 테스트를 오후 한나절 투자할 만한 충분히 강력한 신호입니다.