출처
이 소식에 대해 이야기 나누기
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요

Sofia는 크리에이터의 창작을 좌우하는 자본, 정책, 플랫폼을 추적합니다.
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요
Hugging Face가 S3 호환 버킷과 경량 HTTPS 프록시만을 사용해 분산 HF Jobs 전반에서 LoRA 파인튜닝을 실행하는 상세한 비동기 GRPO 학습 레시피를 공개했습니다. 이를 통해 멀티 노드 GPU 학습을 클러스터 관리의 난제로 만들던 NCCL 집합 통신 라이브러리를 완전히 제거할 수 있습니다.
표준 분산 GRPO 학습은 NCCL — NVIDIA의 집합 통신 라이브러리 — 에 의존해 높은 대역폭으로 GPU 간 그래디언트와 모델 가중치를 동기화합니다. 이는 긴밀하게 결합된 온프레미스 클러스터에서는 잘 작동하지만, 클라우드 스팟 인스턴스, 가용 영역 간, 또는 NCCL이 요구하는 저지연 패브릭을 지원하지 않는 네트워크 환경에서는 작동하지 않거나 지나치게 복잡해집니다. 현실적인 예산으로 강화학습 파인튜닝을 실행하려는 팀들은 역사적으로 이 장벽에 크게 부딪혀 왔습니다.
Hugging Face의 접근 방식은 이 문제를 완전히 우회합니다. GPU 간에 텐서를 피어 투 피어로 브로드캐스트하는 대신, 학습된 LoRA 어댑터 — 전체 모델이 아닌 소규모 저랭크 가중치 행렬 세트 — 가 각 학습 스텝 후 마운트된 S3 호환 버킷에 기록됩니다. 추론 레플리카는 동일한 버킷 마운트에서 업데이트된 어댑터를 읽습니다. 조율 레이어는 단순히 HTTPS이며, TRL이 로컬호스트를 통해 통신하는 소규모 프록시 프로세스가 이를 처리합니다.
Hugging Face 블로그에 따르면, 시스템은 세 개의 조율된 HF Jobs로 실행됩니다: TRL GRPO 트레이너, vLLM 추론 레플리카 풀, 그리고 HTTPS 프록시입니다. 트레이너는 프롬프트 배치를 생성하고, vLLM 레플리카는 현재 LoRA 어댑터를 사용해 롤아웃을 생성하며, 트레이너는 보상 신호를 바탕으로 어댑터 가중치를 업데이트합니다. 동기화가 블로킹 집합 연산이 아닌 버킷을 통해 이루어지기 때문에, 추론 레플리카는 트레이너가 전체 동기화 라운드를 완료할 때까지 기다릴 필요 없이 비동기적으로 롤아웃을 계속 생성할 수 있어, 동기식 GRPO 설정에서 발생하는 GPU 유휴 시간이 줄어듭니다.
AI 아트 및 캐릭터 생성 워크플로우에 있어 실질적인 시사점은 직접적입니다: 특정 시각적 스타일, 캐릭터 일관성, 또는 프롬프트 준수 동작을 선호하도록 보상 모델을 파인튜닝하는 것 — 많은 이미지 품질 개선의 배경에 있는 선호도 튜닝의 일종 — 이 예약된 멀티 GPU 노드를 요구하는 대신 클라우드 스팟 인스턴스나 소규모 관리형 컴퓨팅 예산으로도 가능해집니다. LoRA의 소규모 어댑터 풋프린트 덕분에 버킷 동기화 오버헤드는 합리적인 학습 주기에서도 낮게 유지됩니다.
이 설정은 S3 호환 오브젝트 스토어(AWS S3, Cloudflare R2 및 유사 서비스 모두 해당), HF Jobs 접근 권한이 있는 Hugging Face 계정, 그리고 TRL 및 vLLM 구성에 대한 숙련도를 필요로 합니다. 원클릭 솔루션은 아닙니다. 그러나 NCCL을 필수 의존성에서 제거함으로써 인프라 진입 장벽이 의미 있게 낮아집니다 — Stability AI가 2023년 자체 분산 학습을 확장할 당시, NCCL 잘못된 구성은 학습 실행이 조용히 발산하거나 완전히 멈추는 반복적인 원인이었습니다.
LoRA 파인튜닝을 이미 실험하고 있는 크리에이터 — 스타일 일관성, 캐릭터 LoRA, 또는 프롬프트 준수 튜닝을 위해 — 는 Charmloop의 가이드에서 기반 기술을 찾아보고 카탈로그에서 파인튜닝된 모델 스타일을 탐색할 수 있습니다. Hugging Face 레시피는 해당 사용자층 중 기술적으로 자신 있는 쪽을 겨냥합니다: 호스팅된 모델을 사용하는 것이 아니라 자체 GRPO 보상 튜닝 루프를 직접 실행하고자 하는 사람들입니다.
Hugging Face는 이 접근 방식과 관련된 가격 변경을 발표하지 않았습니다. HF Jobs 청구는 기존 컴퓨팅 요금을 따릅니다. 다음으로 주목해야 할 구체적인 의존성은 네이티브 비동기 GRPO 지원에 대한 TRL의 로드맵입니다 — 현재 레시피는 향후 TRL 릴리스가 라이브러리에 직접 흡수할 수 있는 수동 오케스트레이션을 필요로 합니다.