출처
이 소식에 대해 이야기 나누기
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요

Elias는 헤드라인 뒤의 연구를 쉬운 언어로 풀어냅니다.
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요

Hugging Face가 @huggingface/kernels를 공개했습니다. 이 라이브러리는 207개의 WebGPU 컴퓨트 커널 — GPU에게 수학 연산을 정확히 어떻게 실행할지 지시하는 소형 하드웨어 수준 프로그램 — 로 구성되어 있으며, AI 모델이 원격 서버에 데이터를 전송하지 않고 웹 브라우저 내에서 완전히 실행될 수 있도록 합니다.
@huggingface/kernels npm 패키지를 통해 제공되며, 행렬 곱셈부터 어텐션 레이어까지 다양한 연산을 지원합니다.커널을 GPU를 위한 레시피 카드라고 생각하면 됩니다. AI 모델이 두 개의 큰 행렬을 곱해야 할 때 — 단일 이미지 생성 패스 동안 수천 번 발생하는 작업 — 커널은 모든 GPU 코어에게 어떤 숫자를 가져올지, 어떻게 결합할지, 결과를 어디에 저장할지를 정확히 지시합니다. 최적화된 커널 없이는 해당 작업이 CPU로 폴백되거나(느림), Nvidia 또는 Apple이 제공하는 독점 런타임에 의존하게 됩니다.
Hugging Face의 커널은 WGSL(WebGPU Shading Language)로 작성되어 있으며, 이는 WebGPU를 지원하는 모든 브라우저가 실행할 수 있는 개방형 셰이더 언어입니다. 즉, 동일한 커널 파일이 M 시리즈 MacBook, AMD 카드가 장착된 Windows 노트북, 또는 Chromebook에서 실행됩니다 — 드라이버 설치나 CUDA 의존성 없이.
AI 아트 도구를 개발하는 개발자에게 가장 중요한 아키텍처적 선택은 이 커널들이 배포되는 방식입니다. 각 연산 — 예를 들어 ai.onnx.Add — 은 매니페스트, 정확성 테스트, 벤치마크 케이스, WGSL 셰이더 템플릿을 포함하는 자체 Hub 저장소에 존재합니다.
이 구조 덕분에 브라우저 기반 이미지 생성기는 필요한 커널만 가져올 수 있으며, Hugging Face는 다른 모든 것을 건드리지 않고 단일 커널에 성능 수정을 푸시할 수 있습니다. 웹 네이티브 도구 — 브라우저 내 인페인팅이나 스타일 전환 앱 — 를 개발하거나 사용하는 크리에이터에게, 이는 전체 런타임 릴리스를 기다리는 것과 하룻밤 사이에 타겟 속도 개선을 받는 것의 차이입니다.
Hugging Face 블로그에 따르면, 이 라이브러리는 이미 트랜스포머 기반 모델에 필요한 핵심 연산을 지원하며, 현대 디퓨전 및 언어 모델 아키텍처를 지배하는 어텐션 및 피드포워드 레이어를 포함합니다.
AI 아트 크리에이터에게 가장 즉각적인 영향은 경제적이고 실용적입니다. 이미지 생성을 위한 클라우드 추론은 호출당 또는 GPU 시간(초)당 요금이 청구됩니다. 이 커널을 사용하는 브라우저 사이드 파이프라인은 일회성 다운로드 비용만 발생하고, 이후에는 기기에서 무료로 무기한 실행됩니다. 프롬프트, 참조 이미지, 출력물이 기기를 떠나지 않으므로 — 제3자 서버에 전송하고 싶지 않은 클라이언트 자료나 개인 참조 이미지를 다루는 크리에이터에게 적합합니다.
트레이드오프는 분명합니다. 노트북 GPU는 클라우드 A100보다 느리며, 매우 큰 모델은 여전히 브라우저 메모리에 맞지 않습니다. 하지만 가벼운 작업 — 소형 업스케일러 실행, 스타일 조정을 위한 LoRA(파인튜닝된 모델 어댑터) 적용, 또는 빠른 반복 프롬프트 테스트 — 에는 로컬 WebGPU 추론이 중급 소비자 하드웨어에서 이미 실용적입니다.
브라우저 기반 생성을 실험해보고 싶은 크리에이터는 Charmloop의 AI 이미지 생성기를 통해 가능성을 탐색하거나, 모델 카탈로그를 둘러보며 툴링이 성숙해짐에 따라 이러한 로컬 배포에 적합한 모델 아키텍처를 확인할 수 있습니다.
207개 커널 릴리스는 천장이 아닌 토대입니다. 브라우저에서 WebGPU 도입이 확대되고 커널 라이브러리가 성장함에 따라, 클라우드 품질 생성과 완전 로컬 생성 사이의 격차는 좁아질 것이며 — Charmloop의 가이드에서 어떤 워크플로가 그 임계점을 먼저 넘는지 추적할 것입니다.