출처
이 소식에 대해 이야기 나누기
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요

Elias는 헤드라인 뒤의 연구를 쉬운 언어로 풀어냅니다.
컴패니언을 선택하고 이 소식에 대한 생각을 들어보세요

Nvidia가 Personal AI Router(PAIR)를 출시했습니다. 이 무료 오픈소스 소프트웨어 도구는 홈 네트워크에 연결된 여러 컴퓨터를 공유 로컬 추론 풀로 묶어, 단일 기기만으로는 처리하기 어려운 대형 언어 및 이미지 모델을 실행할 수 있게 해줍니다.
PAIR는 로컬 오케스트레이션 레이어 역할을 합니다. 즉, 모델 실행 도구(Ollama, LM Studio 또는 호환 API 엔드포인트)와 모델 사이에 위치하는 소프트웨어입니다. 프롬프트를 전송하면 PAIR는 연결된 기기 중 가용 컴퓨팅 자원이 있는 곳을 확인해 작업을 라우팅하거나, 모델이 지원하는 경우 여러 노드에 분산합니다. 홈 네트워크의 유휴 GPU 사이클을 위한 교통 정리자라고 생각하면 됩니다.
AI 아트 크리에이터 입장에서 실질적인 의미가 큽니다. 현재 700억 파라미터 텍스트 모델을 로컬에서 실행하려면 VRAM이 40GB 이상인 단일 GPU — 고가의 하드웨어 — 가 필요하거나, 느린 CPU 전용 생성을 감수해야 합니다. PAIR를 사용하면 예를 들어 RTX 4070 데스크톱과 구형 RTX 3060 노트북을 보유한 크리에이터가 두 기기의 VRAM을 합산해, 클라우드 API 비용 없이 기존에는 실행 불가능했던 모델 크기를 사용할 수 있게 됩니다.

연결된 가정용 기기와 활성 추론 라우팅을 표시하는 Nvidia PAIR의 그래픽 인터페이스.
Ollama와 LM Studio는 모두 로컬 OpenAI 호환 API 엔드포인트를 노출합니다. 이는 많은 이미지 생성 파이프라인과 프롬프트 도구가 이미 통신할 수 있는 표준화된 인터페이스입니다. PAIR는 동일한 레이어에 삽입되므로, 기존에 로컬 Ollama 서버를 가리키던 워크플로우는 프롬프트를 재작성하거나 모델 설정을 변경하지 않고도 PAIR를 앞단에 두고 그대로 작동해야 합니다. 전환은 워크플로우 전면 개편이 아닌 설정 변경에 가깝습니다.

PAIR를 통해 Hermes 모델로 라우팅된 프롬프트로, 도구가 추론 작업을 분산하는 방식을 보여줍니다.
프롬프트 확장이나 캡션 정제를 위해 로컬 LLM을 사용하는 이미지 생성 파이프라인을 운영하는 크리에이터 — ComfyUI 워크플로우에서 흔한 패턴 — 에게는 해당 전처리 단계의 처리 속도가 빨라질 수 있습니다. 두 번째 기기의 GPU가 이를 처리하는 동안 주 GPU는 디퓨전에 집중할 수 있기 때문입니다.
The Verge에 따르면, PAIR는 MacBook도 노드로 지원하므로, 크리에이터가 이미 보유하고 있어 클러스터에 기여할 수 있는 기기의 범위가 더욱 넓어집니다.

데스크톱, 노트북 및 기타 기기가 통합된 로컬 컴퓨팅 풀을 형성하는 방식을 보여주는 Nvidia PAIR의 아키텍처.
Nvidia는 당연히 자사 RTX GPU에 맞게 PAIR의 스케줄링을 최적화합니다 — 올해 초 Nvidia DLSS 5 출시에서 다룬 것과 동일한 하드웨어 제품군입니다. RTX 카드는 CUDA 가속 추론의 혜택을 받으므로, CPU 전용 노드보다 와트당 토큰 및 레이턴트를 더 빠르게 처리합니다. 그렇다고 CPU 전용 기기가 배제되는 것은 아닙니다. 이들은 낮은 우선순위의 기여자로 풀에 참여하며, 소규모 전처리 작업을 오프로드하는 데 유용합니다.
AMD 및 Intel GPU 사용자의 상황은 다소 불분명합니다. PAIR의 오픈소스 특성상 ROCm 또는 OpenCL용 커뮤니티 드라이버가 등장할 수 있지만, Nvidia는 출시 시점에 경쟁 GPU 아키텍처에 대한 공식 지원을 확인하지 않았습니다.
Charmloop 가이드를 통해 이미 로컬 모델 실행을 탐색 중인 크리에이터에게 PAIR는 새 하드웨어 구매 없이 규모를 확장할 수 있는 구체적인 경로를 제시합니다. 로컬에서 실행할 수 있는 한계가 방금 높아졌습니다 — 얼마나 높아졌는지는 네트워크에 유휴 상태로 있는 기기가 몇 대인지에 달려 있습니다.