NVIDIA PAIR 설치하는 법
NVIDIA Personal AI Router(PAIR)는 집 LAN의 머신에 로컬 추론 요청을 나눠 보내는 라우터다. v0.1.1 설치기부터 Ollama·LM Studio·Endpoints·PIN 페어링까지 공식 Getting Started만 따라가는 검색형 가이드다.
핵심 요약 (TL;DR)

NVIDIA Personal AI Router(PAIR)는 같은 집 LAN에 있는 머신끼리 로컬 추론 요청을 나눠 보내는 라우터다. VRAM을 합치거나 한 요청을 GPU 여러 장에 쪼개지 않는다. 요청 하나를 받을 수 있는 노드 하나로 보낸다.
이 글은 공식 Getting Started·README·릴리스 기준으로 설치 → 엔진·모델 → 엔드포인트 → 첫 요청 → (선택) 클러스터 페어링만 따라간다. 글을 쓰는 시점의 최신 데스크톱 릴리스는 v0.1.1(2026-08-28)이다. 모델별 VRAM GiB는 PAIR 문서에 없으면 추정하지 않는다.
배경 및 맥락

집·작업실에 RTX PC, DGX Spark, Mac이 섞여 있으면 보통 앱마다 Ollama·LM Studio 주소를 따로 잡는다. PAIR는 그 앞에 앉아 내 머신 루프백 주소 하나로 받고, 클러스터 안에서 엔진·모델·부하를 보고 노드를 고른다. NVIDIA 제품 페이지는 공개 베타로 소개하고, 저장소 라이선스는 Apache-2.0이다.
공식 README가 분명히 적는다. PAIR가 돌고 있다고 해서 그 머신에서 엔진·모델이 자동으로 되는 것은 아니다. 엔진·GPU·드라이버·메모리 요구는 Ollama·LM Studio와 각 모델 쪽 문서가 기준이다.
이걸로 할 수 있는 일

- 로컬 추론 엔드포인트를 하나 쓰기 — 앱·에이전트는 PAIR 프록시에 붙고, 실제 서빙은 클러스터의 적격 노드가 한다.
- Ollama·LM Studio를 PAIR가 설치·기동 — 첫 실행 설정에서 고르거나, Overview 노드 카드의 Engine settings에서 설치·시작한다.
- 같은 LAN의 Windows·Linux·macOS를 페어링 — 6자리 PIN으로 클러스터에 넣고, OS가 달라도 노드끼리 묶을 수 있다고 README에 있다.
- GPU 없는 노트북에서도 요청 보내기 — 그 머신에 PAIR만 두고 클러스터에 넣으면, 로컬 엔드포인트가 다른 노드로 라우팅한다. (엔드포인트 자체는 그 머신 루프백만 받는다.)
- 동시 독립 요청을 노드에 분산 — 멀티 에이전트처럼 요청이 여러 개일 때. 한 요청을 여러 노드에 나누지는 않는다.
필요한 것
| 항목 | 공식 근거 | 메모 |
|---|---|---|
| 최신 릴리스 | GitHub Releases | v0.1.1 (기능상 v0.1.0과 동일, 빌드 툴체인 수정) |
| 설치 파일 | Releases | Windows .exe, Linux .deb(amd64/arm64), macOS .dmg(x64/arm64) |
| OS | README / NVIDIA 페이지 | README: Windows 11, Linux, macOS (x64·arm64). 제품 페이지 표기: Windows 11, DGX OS, Ubuntu 14.04, macOS Tahoe |
| 검증 GPU·칩 (제품 페이지) | nvidia.com PAIR | GeForce RTX 20 시리즈 이상, DGX Spark/GB10, Mac M4 이상 |
| RAM / 디스크 (제품 페이지) | Validated Configurations | RAM 8GB 이상 / 디스크 권장 20GB 이상 |
| 추론 엔진 | README | 현재 Ollama, LM Studio |
| 네트워크 | Getting Started | 한 대만으로도 로컬 추론 가능. 라우팅 체험은 같은 LAN에 2대+ |
| 인터넷 | 제품 페이지 | 동작 자체는 불필요. 모델 다운로드 시 필요 |
| 라이선스 | README | Apache-2.0 (엔진·모델은 각자 별도 약관) |
PAIR 자체는 지원 OS에서 돌 수 있어도, 특정 모델이 그 노드에 올라갈지는 엔진·모델 요구사항이다. VRAM 숫자는 이 글에서 만들지 않는다.
단계: 설치
- GitHub Releases 최신에서 OS·아키텍처에 맞는 파일을 받는다. 이 글 기준 태그는 v0.1.1.
- Windows — 설치기를 실행한 뒤 Start 메뉴에서 NVIDIA Personal AI Router를 연다. 설치기가 방화벽 규칙도 넣는다고 README에 있다.
- macOS —
.dmg를 열고 NVIDIA Personal AI Router를 Applications로 드래그한 뒤 실행한다. - Linux (Debian/Ubuntu 계열) — 받은 디렉터리에서:
sudo apt install ./NVPAIR-Setup-*.deb
패키지가 여러 개면 와일드카드 대신 원하는 파일 전체 이름을 쓴다. 예: sudo apt install ./NVPAIR-Setup-0.1.1-amd64.deb. 그다음 애플리케이션 메뉴에서 실행한다.
헤드리스(데스크톱 없는) 머신은 데스크톱 앱 대신 릴리스의 service binaries + 터미널 인터페이스 경로를 쓴다. Getting Started가 그 문서로 보낸다.
소스에서 빠르게 띄우려면(공식 Quick Start):
git clone https://github.com/NVIDIA/Personal-AI-Router.git
cd Personal-AI-Router/desktop
npm install
npm start
npm start가 형제 ../services의 Go 서비스를 빌드하고 데스크톱을 연다고 문서에 있다. 일상 사용은 서명된 릴리스 설치기를 권장한다.
단계: 첫 실행 · 엔진 · 모델

- 첫 실행 설정 창에서 설치할 엔진을 고른다. 플랫폼에서 가능하면 Ollama가 기본 선택이다. 이미 따로 쓰는 엔진이 있으면 설치를 건너뛰고 PAIR가 감지한 쪽을 쓸 수 있다.
- Overview가 이 머신 노드를 보여줄 때까지 기다린다. 수 분 지나도 Loading이면 Settings → Service 상태를 본다.
- 노드 카드에서 Engine settings → 엔진 시작 스위치를 켠다.
- Add model로 모델을 받고, 엔진이 명시적 로드를 요구하면 로드한다. README 예시는
qwen4:12b이며, 원하는 모델로 바꿔도 된다.

단계: 엔드포인트 · 첫 요청
- 상단 툴바 Endpoints를 연다. 엔진마다
http://127.0.0.1:<port>URL이 있다. 기억한 포트 대신 여기 값을 복사한다. - 기본 프록시 포트(문서 표): Ollama 호환 11434, LM Studio / OpenAI 호환 1234. PAIR가 그 포트를 가져가면 엔진 본체는 보통 Ollama
11435+, LM Studio1235+로 밀린다. - OpenAI 스타일 요청은 두 엔진 모두에서 통한다고 문서가 적는다. 예(README, Ollama 기본 포트·예시 모델):
curl http://127.0.0.1:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"qwen4:12b","messages":[{"role":"user","content":"In one sentence, what does a router do?"}]}'
포트를 바꿨거나 LM Studio면 Endpoints의 URL을 그대로 쓴다. OpenAI 호환 클라이언트가 /v1을 붙이는 방식이면 base URL에 /v1을 포함할지 앱 설정에 맞춘다. Ollama 네이티브 /api/chat은 Ollama 엔드포인트에만 해당한다.
- 앱·에이전트는 요청을 보내는 그 머신에 PAIR를 두고, 그 로컬 엔드포인트만 가리킨다. 다른 PC의 IP로
http://다른노드:11434를 열면 PAIR는 루프백만 받도록 설계되어 있고, 네트워크에서 오면403이라고 Getting Started가 적는다. - 라우팅 확인: Overview → 왼쪽 Jobs 필터 → 카드의 Ran on / Running on. 앱 없이 보려면 Settings → Service의 Test(약 60초 합성 트래픽)를 쓴다.

단계(선택): 클러스터 페어링

- 참여할 모든 머신에 PAIR를 설치·실행하고 같은 로컬 네트워크인지 확인한다.
- 초대 측에서 Add node(또는 Settings → Cluster → Available nodes)로 발견된 노드를 고른다. 발견이 안 되면 IP로 추가한다.
- 초대 측에 뜨는 6자리 PIN을 피초대 측 모달에 입력한다.
- Settings → Cluster의 Connected nodes, 또는 Overview 노드 목록으로 연결을 확인한다.
- 서빙할 노드마다 엔진을 켜고, 라우팅 테스트용으로 같은 모델을 여러 노드에 준비한다. 모델이 한 노드에만 있어도 요청은 그 노드로 갈 수 있다.
PIN은 임시 부트스트랩 코드다. 공유·비신뢰 네트워크에서는 공식 SECURITY 정책을 먼저 본다.
노드 간 통신에 쓰는 포트(앱이 직접 치는 주소는 아님). Windows 설치기는 규칙을 넣고, 엄격한 Linux 방화벽이면 수동 허용이 필요할 수 있다.
| 포트 | 용도(문서) |
|---|---|
| 5353/udp | LAN 노드 발견(mDNS) |
| 14318 | 하드웨어·모델 인벤토리 |
| 14319 | 서비스 오류 동기화 |
| 14320 | 워크로드 전파 |
| 14321 | 페어링·멤버십 |
| 14322 | 피어에 모델 목록 제공 |
| 14323 | 클러스터 원격 엔진 제어 |
막히는 지점 / 표
| 증상 | 문서 근거 | 대응 |
|---|---|---|
| Overview가 Loading에 멈춤 | Getting Started | Settings → Service 상태·로그. 백그라운드 서비스가 안 뜬 경우 |
| Connection refused | Verify / troubleshooting | Endpoints 포트·서비스 기동 확인 |
| 502 no active node | Getting Started | 라우팅 가능한 엔진 노드가 없음 → 엔진 시작 |
| 502 model not advertised | Getting Started | 해당 모델을 노드에 준비하고 인벤토리 갱신 대기 |
| 요청은 되는데 Jobs가 비어 있음 | Troubleshooting 링크 | 프록시 포트를 다른 프로세스가 점유했을 수 있음 |
| 다른 PC에서 노드 IP:11434로 접속 | Getting Started | 의도된 동작 아님. 루프백만. PAIR를 앱이 도는 머신에 설치 |
| VRAM을 합쳐 큰 모델을 올리고 싶음 | README 경고 | PAIR는 하지 않음. 요청 단위 라우팅만 |
| 클러스터 버전 섞임 | Keeping PAIR Up to Date | 모든 노드를 같은 PAIR 버전으로. 혼용은 미지원으로 안내 |
문서가 스스로 말하는 한계
제품·문서 톤은 “집 LAN의 유휴 머신을 에이전트 워크로드에 붙인다”에 맞춰져 있다. 스케줄러는 큐와 거친 GPU 사용률 신호를 쓰고, GPU 모델·여유 메모리·모델 워밍·요청 비용까지는 아직 안 본다고 README의 “Where PAIR is going”에 적혀 있다. 이질적인 하드웨어 클러스터보다 비슷한 머신 묶음에 더 맞다는 자기 평가다.
마치며
NVIDIA PAIR 설치하는 법은 짧다. Releases에서 OS별 설치기를 받아 열고, Ollama 또는 LM Studio를 켠 뒤 모델을 받고, Endpoints URL로 첫 /v1/chat/completions를 보낸다. 두 대 이상이면 PIN으로 페어링한다. VRAM 풀링이 아니고, 엔드포인트는 요청을 보내는 머신 로컬이다. 숫자·포트·명령은 공식 Getting Started와 README를 기준으로 두자.
이 글은 AI가 작성하여 자동 발행된 콘텐츠입니다.