NVIDIA PAIR 설치하는 법

NVIDIA Personal AI Router(PAIR)는 집 LAN의 머신에 로컬 추론 요청을 나눠 보내는 라우터다. v0.1.1 설치기부터 Ollama·LM Studio·Endpoints·PIN 페어링까지 공식 Getting Started만 따라가는 검색형 가이드다.

NVIDIA PAIR 설치하는 법

핵심 요약 (TL;DR)

NVIDIA PAIR 설치하는 법 가이드 표지
NVIDIA PAIR 설치하는 법 가이드 표지.

NVIDIA Personal AI Router(PAIR)는 같은 집 LAN에 있는 머신끼리 로컬 추론 요청을 나눠 보내는 라우터다. VRAM을 합치거나 한 요청을 GPU 여러 장에 쪼개지 않는다. 요청 하나를 받을 수 있는 노드 하나로 보낸다.

이 글은 공식 Getting Started·README·릴리스 기준으로 설치 → 엔진·모델 → 엔드포인트 → 첫 요청 → (선택) 클러스터 페어링만 따라간다. 글을 쓰는 시점의 최신 데스크톱 릴리스는 v0.1.1(2026-08-28)이다. 모델별 VRAM GiB는 PAIR 문서에 없으면 추정하지 않는다.

배경 및 맥락

NVIDIA Personal-AI-Router GitHub 소셜 프리뷰
Personal-AI-Router GitHub 소셜 프리뷰. 출처: GitHub

집·작업실에 RTX PC, DGX Spark, Mac이 섞여 있으면 보통 앱마다 Ollama·LM Studio 주소를 따로 잡는다. PAIR는 그 앞에 앉아 내 머신 루프백 주소 하나로 받고, 클러스터 안에서 엔진·모델·부하를 보고 노드를 고른다. NVIDIA 제품 페이지는 공개 베타로 소개하고, 저장소 라이선스는 Apache-2.0이다.

공식 README가 분명히 적는다. PAIR가 돌고 있다고 해서 그 머신에서 엔진·모델이 자동으로 되는 것은 아니다. 엔진·GPU·드라이버·메모리 요구는 Ollama·LM Studio와 각 모델 쪽 문서가 기준이다.

이걸로 할 수 있는 일

PAIR Overview에서 두 노드로 라우팅되는 데모 프레임
PAIR Overview 데모 프레임 — 요청이 노드로 라우팅되는 모습. 출처: NVIDIA/Personal-AI-Router assets/pair-demo.gif
  • 로컬 추론 엔드포인트를 하나 쓰기 — 앱·에이전트는 PAIR 프록시에 붙고, 실제 서빙은 클러스터의 적격 노드가 한다.
  • Ollama·LM Studio를 PAIR가 설치·기동 — 첫 실행 설정에서 고르거나, Overview 노드 카드의 Engine settings에서 설치·시작한다.
  • 같은 LAN의 Windows·Linux·macOS를 페어링 — 6자리 PIN으로 클러스터에 넣고, OS가 달라도 노드끼리 묶을 수 있다고 README에 있다.
  • GPU 없는 노트북에서도 요청 보내기 — 그 머신에 PAIR만 두고 클러스터에 넣으면, 로컬 엔드포인트가 다른 노드로 라우팅한다. (엔드포인트 자체는 그 머신 루프백만 받는다.)
  • 동시 독립 요청을 노드에 분산 — 멀티 에이전트처럼 요청이 여러 개일 때. 한 요청을 여러 노드에 나누지는 않는다.

필요한 것

항목공식 근거메모
최신 릴리스GitHub Releasesv0.1.1 (기능상 v0.1.0과 동일, 빌드 툴체인 수정)
설치 파일ReleasesWindows .exe, Linux .deb(amd64/arm64), macOS .dmg(x64/arm64)
OSREADME / NVIDIA 페이지README: Windows 11, Linux, macOS (x64·arm64). 제품 페이지 표기: Windows 11, DGX OS, Ubuntu 14.04, macOS Tahoe
검증 GPU·칩 (제품 페이지)nvidia.com PAIRGeForce RTX 20 시리즈 이상, DGX Spark/GB10, Mac M4 이상
RAM / 디스크 (제품 페이지)Validated ConfigurationsRAM 8GB 이상 / 디스크 권장 20GB 이상
추론 엔진README현재 Ollama, LM Studio
네트워크Getting Started한 대만으로도 로컬 추론 가능. 라우팅 체험은 같은 LAN에 2대+
인터넷제품 페이지동작 자체는 불필요. 모델 다운로드 시 필요
라이선스READMEApache-2.0 (엔진·모델은 각자 별도 약관)

PAIR 자체는 지원 OS에서 돌 수 있어도, 특정 모델이 그 노드에 올라갈지는 엔진·모델 요구사항이다. VRAM 숫자는 이 글에서 만들지 않는다.

단계: 설치

  1. GitHub Releases 최신에서 OS·아키텍처에 맞는 파일을 받는다. 이 글 기준 태그는 v0.1.1.
  2. Windows — 설치기를 실행한 뒤 Start 메뉴에서 NVIDIA Personal AI Router를 연다. 설치기가 방화벽 규칙도 넣는다고 README에 있다.
  3. macOS — .dmg를 열고 NVIDIA Personal AI Router를 Applications로 드래그한 뒤 실행한다.
  4. Linux (Debian/Ubuntu 계열) — 받은 디렉터리에서:
sudo apt install ./NVPAIR-Setup-*.deb

패키지가 여러 개면 와일드카드 대신 원하는 파일 전체 이름을 쓴다. 예: sudo apt install ./NVPAIR-Setup-0.1.1-amd64.deb. 그다음 애플리케이션 메뉴에서 실행한다.

헤드리스(데스크톱 없는) 머신은 데스크톱 앱 대신 릴리스의 service binaries + 터미널 인터페이스 경로를 쓴다. Getting Started가 그 문서로 보낸다.

소스에서 빠르게 띄우려면(공식 Quick Start):

git clone https://github.com/NVIDIA/Personal-AI-Router.git
cd Personal-AI-Router/desktop
npm install
npm start

npm start가 형제 ../services의 Go 서비스를 빌드하고 데스크톱을 연다고 문서에 있다. 일상 사용은 서명된 릴리스 설치기를 권장한다.

단계: 첫 실행 · 엔진 · 모델

PAIR가 Ollama 엔진을 설치하는 화면
첫 실행·엔진 설치 화면(Ollama 다운로드 진행). 출처: NVIDIA PAIR docs assets
  1. 첫 실행 설정 창에서 설치할 엔진을 고른다. 플랫폼에서 가능하면 Ollama가 기본 선택이다. 이미 따로 쓰는 엔진이 있으면 설치를 건너뛰고 PAIR가 감지한 쪽을 쓸 수 있다.
  2. Overview가 이 머신 노드를 보여줄 때까지 기다린다. 수 분 지나도 Loading이면 Settings → Service 상태를 본다.
  3. 노드 카드에서 Engine settings → 엔진 시작 스위치를 켠다.
  4. Add model로 모델을 받고, 엔진이 명시적 로드를 요구하면 로드한다. README 예시는 qwen4:12b이며, 원하는 모델로 바꿔도 된다.
PAIR 노드 카드에서 모델 추가·다운로드
노드 카드에서 모델 추가·다운로드. 출처: NVIDIA PAIR docs assets

단계: 엔드포인트 · 첫 요청

  1. 상단 툴바 Endpoints를 연다. 엔진마다 http://127.0.0.1:<port> URL이 있다. 기억한 포트 대신 여기 값을 복사한다.
  2. 기본 프록시 포트(문서 표): Ollama 호환 11434, LM Studio / OpenAI 호환 1234. PAIR가 그 포트를 가져가면 엔진 본체는 보통 Ollama 11435+, LM Studio 1235+로 밀린다.
  3. OpenAI 스타일 요청은 두 엔진 모두에서 통한다고 문서가 적는다. 예(README, Ollama 기본 포트·예시 모델):
curl http://127.0.0.1:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"qwen4:12b","messages":[{"role":"user","content":"In one sentence, what does a router do?"}]}'

포트를 바꿨거나 LM Studio면 Endpoints의 URL을 그대로 쓴다. OpenAI 호환 클라이언트가 /v1을 붙이는 방식이면 base URL에 /v1을 포함할지 앱 설정에 맞춘다. Ollama 네이티브 /api/chat은 Ollama 엔드포인트에만 해당한다.

  1. 앱·에이전트는 요청을 보내는 그 머신에 PAIR를 두고, 그 로컬 엔드포인트만 가리킨다. 다른 PC의 IP로 http://다른노드:11434를 열면 PAIR는 루프백만 받도록 설계되어 있고, 네트워크에서 오면 403이라고 Getting Started가 적는다.
  2. 라우팅 확인: Overview → 왼쪽 Jobs 필터 → 카드의 Ran on / Running on. 앱 없이 보려면 Settings → Service의 Test(약 60초 합성 트래픽)를 쓴다.
PAIR Test 트래픽으로 Jobs가 돌아가는 Overview
Settings → Service Test 중 Overview Jobs. 출처: NVIDIA PAIR docs assets

단계(선택): 클러스터 페어링

PAIR 6자리 페어링 PIN과 초대 모달
초대 측 6자리 PIN과 피초대 측 Cluster invitation. 출처: NVIDIA PAIR docs assets
  1. 참여할 모든 머신에 PAIR를 설치·실행하고 같은 로컬 네트워크인지 확인한다.
  2. 초대 측에서 Add node(또는 Settings → Cluster → Available nodes)로 발견된 노드를 고른다. 발견이 안 되면 IP로 추가한다.
  3. 초대 측에 뜨는 6자리 PIN을 피초대 측 모달에 입력한다.
  4. Settings → Cluster의 Connected nodes, 또는 Overview 노드 목록으로 연결을 확인한다.
  5. 서빙할 노드마다 엔진을 켜고, 라우팅 테스트용으로 같은 모델을 여러 노드에 준비한다. 모델이 한 노드에만 있어도 요청은 그 노드로 갈 수 있다.

PIN은 임시 부트스트랩 코드다. 공유·비신뢰 네트워크에서는 공식 SECURITY 정책을 먼저 본다.

노드 간 통신에 쓰는 포트(앱이 직접 치는 주소는 아님). Windows 설치기는 규칙을 넣고, 엄격한 Linux 방화벽이면 수동 허용이 필요할 수 있다.

포트용도(문서)
5353/udpLAN 노드 발견(mDNS)
14318하드웨어·모델 인벤토리
14319서비스 오류 동기화
14320워크로드 전파
14321페어링·멤버십
14322피어에 모델 목록 제공
14323클러스터 원격 엔진 제어

막히는 지점 / 표

증상문서 근거대응
Overview가 Loading에 멈춤Getting StartedSettings → Service 상태·로그. 백그라운드 서비스가 안 뜬 경우
Connection refusedVerify / troubleshootingEndpoints 포트·서비스 기동 확인
502 no active nodeGetting Started라우팅 가능한 엔진 노드가 없음 → 엔진 시작
502 model not advertisedGetting Started해당 모델을 노드에 준비하고 인벤토리 갱신 대기
요청은 되는데 Jobs가 비어 있음Troubleshooting 링크프록시 포트를 다른 프로세스가 점유했을 수 있음
다른 PC에서 노드 IP:11434로 접속Getting Started의도된 동작 아님. 루프백만. PAIR를 앱이 도는 머신에 설치
VRAM을 합쳐 큰 모델을 올리고 싶음README 경고PAIR는 하지 않음. 요청 단위 라우팅만
클러스터 버전 섞임Keeping PAIR Up to Date모든 노드를 같은 PAIR 버전으로. 혼용은 미지원으로 안내

문서가 스스로 말하는 한계

제품·문서 톤은 “집 LAN의 유휴 머신을 에이전트 워크로드에 붙인다”에 맞춰져 있다. 스케줄러는 큐와 거친 GPU 사용률 신호를 쓰고, GPU 모델·여유 메모리·모델 워밍·요청 비용까지는 아직 안 본다고 README의 “Where PAIR is going”에 적혀 있다. 이질적인 하드웨어 클러스터보다 비슷한 머신 묶음에 더 맞다는 자기 평가다.

마치며

NVIDIA PAIR 설치하는 법은 짧다. Releases에서 OS별 설치기를 받아 열고, Ollama 또는 LM Studio를 켠 뒤 모델을 받고, Endpoints URL로 첫 /v1/chat/completions를 보낸다. 두 대 이상이면 PIN으로 페어링한다. VRAM 풀링이 아니고, 엔드포인트는 요청을 보내는 머신 로컬이다. 숫자·포트·명령은 공식 Getting Started와 README를 기준으로 두자.

이 글은 AI가 작성하여 자동 발행된 콘텐츠입니다.