출처
이 소식에 대해 이야기 나누기
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요
Iris는 AI 아트와 문화가 만나는 지점을 다룹니다 — 스타일, 작가성, 그리고 의미 있는 이미지들.
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요
Liquid AI의 LFM2.5-DSpark는 Hugging Face 블로그에 따르면 Apple Silicon 하드웨어에서 기본 LFM2.5 모델 대비 최대 3.2배 빠른 추론 속도를 달성하며, 출력 품질 저하는 보고되지 않았습니다.

Liquid AI의 LFM2.5-DSpark, LFM2.5의 투기적 디코딩 변형 모델이 Hugging Face에 출시되었습니다.
이미지: Hugging Face Blog
속도 향상은 압축 기법이 아닙니다. DSpark는 투기적 디코딩을 사용합니다: 소형 드래프트 모델이 토큰 시퀀스를 제안하면, 전체 LFM2.5 모델이 단일 순전파(forward pass)로 이를 검증합니다. 드래프트가 맞을 때 — 대부분의 경우 그렇습니다 — 시스템은 느린 토큰별 생성 루프를 건너뜁니다. 결과적으로 동일한 출력을 생성하는 데 필요한 순차적 단계가 줄어들기 때문에, 실제 소요 시간이 줄어드는 동안에도 품질은 유지됩니다.
M 시리즈 Mac에서 이미지 캡셔닝 파이프라인, 프롬프트 확장 워크플로, 또는 캐릭터 대화 생성을 로컬로 실행하는 사람이라면, 이 차이는 결코 이론적인 수치가 아닙니다. 이전에 8초 걸리던 작업에서 3.2배 속도 향상은 3초 미만으로 단축됩니다. 답답하게 느껴지던 반복 루프가 창작 흐름을 유지할 수 있을 만큼 빠르게 반응합니다.

BFCL 지연 시간 벤치마크에서 LFM2.5-DSpark가 Apple Silicon 하드웨어의 기본 모델보다 현저히 낮은 응답 시간을 기록했습니다.
이미지: Hugging Face Blog
벤치마크 수치는 Apple Silicon에 한정됩니다. M 시리즈 칩은 투기적 디코딩의 메모리 대역폭 요구를 특히 잘 처리합니다 — 통합 메모리 아키텍처 덕분에 드래프트 모델과 검증 모델이 동일한 메모리 풀을 공유하며, 별도 GPU 설정에서 성능 향상을 저해할 수 있는 PCIe 병목 현상이 없습니다. CUDA 기반 장비를 사용하는 크리에이터는 3.2배 수치를 보장이 아닌 상한선으로 받아들여야 합니다; Liquid AI의 공개 데이터는 NVIDIA 하드웨어에서 동등한 성능 향상을 주장하지 않습니다.
Apple 우선 접근 방식 자체가 하나의 신호입니다. 로컬 추론 커뮤니티의 상당 부분이 MacBook Pro와 Mac Studio에서 실행되고 있습니다 — 역사적으로 원시 처리량에서 NVIDIA에 뒤처졌지만, 이제는 양자화 및 최적화된 모델의 진지한 생태계를 갖춘 기기들입니다. DSpark는 바로 그 사용자층을 직접 겨냥한 모델입니다.
실질적인 이점은 단순한 속도 향상을 넘어섭니다. 더 빠른 토큰 생성은 프롬프트 정제 사이클 — 이미지 생성기에 입력하기 전에 캐릭터 설명이나 장면 개요를 조정하는 반복 과정 — 을 몇 분에서 몇 초로 압축합니다. AI 이미지 생성 워크플로에서 이미지 모델에 도달하기 전 첫 번째 레이어로 LLM을 사용하는 크리에이터는 즉시 그 차이를 체감할 것입니다.
투기적 디코딩은 또한 모델의 문체적 특성을 보존하는 경향이 있습니다. 드래프트가 아닌 검증 모델이 모든 토큰에 대해 최종 결정권을 갖기 때문입니다. 드래프트 모델이 틀릴 수 있지만, 대형 모델이 이를 수정합니다. 이러한 비대칭성이 Liquid AI가 품질 손실이 없다고 신뢰할 수 있게 주장할 수 있는 이유입니다 — 아키텍처가 사후 튜닝이 아닌 구조적으로 이를 보장합니다.
오픈 웨이트 추론 최적화는 올해 들어 급격히 가속화되고 있으며, 소규모 연구소들이 폐쇄형 API 제공업체가 거의 공개하지 않는 여유 성능을 발견하고 있습니다. 클라우드 비용 없이 속도를 원하는 크리에이터에게는 로컬 실행 가능한 옵션을 위해 모델 카탈로그를 탐색하는 것이 점점 더 현실적인 선택이 되고 있습니다. DSpark는 그러한 트렌드의 가장 명확한 사례 중 하나입니다: 벤치마크와 함께 지금 바로 이용 가능한 진정한 엔지니어링 개선입니다.