第 1 课
安装 PAIR、准备引擎模型并用 curl 打通本地端点
从 GitHub Releases 安装 PAIR,完成首启与模型下载,复制 Endpoints 地址,用 OpenAI 兼容 curl 验证推理成功。
学习位置仅保存在当前浏览器,有效期 180 天。
图文讲义
NVIDIA Personal AI Router(PAIR)是本地多机推理路由器:在局域网发现并配对兼容电脑,对外提供 Ollama 兼容与 OpenAI 兼容的本机代理端点。它按引擎可用性、模型是否在位、当前负载,把彼此独立的请求送到有能力服务的那一台。
本课按官方 Playbook / Getting Started 走最短链路:安装 → 首启 → 引擎与模型 → 复制 Endpoints → curl 验证。
安全边界:PAIR 把每个请求路由到一台机器。它不会合并多卡显存,不会把多块 GPU 拼成更大逻辑 GPU,也不会把同一模型或同一次推理拆到多机。
官方来源
步骤 1:确认硬件与软件前提
目标:对照官方支持矩阵,至少准备一台可安装 PAIR 的系统。
操作
平台速查(字段名:值):
DGX Spark
- 系统:DGX OS(Linux)
- 多机:可入集群
GeForce RTX / RTX PRO
- 硬件:GeForce RTX 20 系及以上;RTX PRO(Turing+)
- 系统:Windows 11 或 Linux
- 多机:可入集群
兼容节点
- 系统:Win11 / Linux / macOS(x64、arm64;Win on ARM 实验性)
- 多机:可互配
软件与网络:
- 从 GitHub Releases 下载安装包(
.exe/.deb/.dmg) - Ollama 或 LM Studio 至少在一台「出活」机器上可用;首启也可让 PAIR 代装引擎
- 多机时设备须在同一 受信局域网;六位 PIN 是短期引导码,不是长期口令
安全边界:不要在同一台机器同时跑桌面版 PAIR 与终端界面(
nvpair),二者会抢端口与配置。无桌面或 SSH 场景改用 Terminal setup。
预期结果
- 已选定目标 OS / 安装包架构
- 预计耗时约 10 分钟,外加引擎与模型下载(官方 Time & risk)
排错
- 不确定架构:在系统信息里确认 x64 / arm64 后再下载对应包
步骤 2:安装 PAIR
目标:完成安装并成功打开 PAIR(或 nvpair)。
Windows
操作
- 下载与架构匹配的 Windows 安装包
- 运行安装程序,批准系统与防火墙提示(安装器会写入 PAIR 规则)
- 从开始菜单打开 NVIDIA Personal AI Router
Debian / Ubuntu
操作
在下载目录执行(把 VERSION / ARCH 换成实际文件名,或用通配符):
sudo apt install \
"./NVPAIR-Setup-VERSION-ARCH.deb"
# 目录里只有一个包时:
sudo apt install ./NVPAIR-Setup-*.deb
然后从应用菜单启动 NVIDIA Personal AI Router。
macOS
操作
- 打开下载的
.dmg - 把 NVIDIA Personal AI Router 拖进 Applications
- 从 Applications 启动
无桌面环境时可直接运行:
nvpair
预期结果
- 标题变为
broker ready v…表示已连上服务 - 若一直停在
connecting to broker...,到 Logs 检查服务输出
排错
- Linux 权限不足:确认使用
sudo apt install ./…指向本地.deb - macOS 拦截:在系统设置中允许来自已识别开发者的应用后重试
步骤 3:完成首启并启动引擎
目标:结束向导,至少让一个推理引擎显示为 running。
操作
- 首次打开时,查看可安装的推理引擎列表;平台可用时 默认勾选 Ollama
- 选择要安装的引擎;若你已单独管理 Ollama / LM Studio,可跳过安装,让 PAIR 检测现有实例
- 结束向导,等待所选引擎显示为 running
之后可在 Overview 点选节点卡片回到引擎设置;Settings → Cluster 可随时配对。

看哪里:Overview 节点卡片与引擎状态;预期看到引擎为 running,而不是长期 Loading。
预期结果
- Overview 不再长期停留在 Loading...
- 至少一个引擎为 running
排错
- 超过一两分钟仍 Loading:打开 Settings → Service,再看 Troubleshooting(官方 Getting Started)
步骤 4:添加并加载一个模型
目标:保证本机节点「在线 + 引擎运行 + 本地已有请求模型」。
操作
在每台将要服务该模型的机器上重复:
- Overview 选中本机节点,打开引擎设置
- 如需则安装引擎,用开关 启动 引擎
- 展开引擎,点 Add model
- 下载模型,等待完成
- 若引擎要求单独 Load,再执行加载
终端界面(nvpair):Engines(第 6 页签)→ i 安装、s 启动、p 拉取模型(如输入 llama3.2 后回车)。
本课先保证 本机 有一个可用模型;下一课再在第二台放同一模型做路由。
预期结果
- 引擎下可见已下载模型
- 需要 Load 的引擎已完成加载
排错
- 下载很慢:属正常;保持窗口打开直至完成
- 模型名不一致:下一课跨机路由时,两台必须使用完全相同的模型名字符串
步骤 5:复制本机 Endpoints
目标:拿到本机环回代理地址;不要手写端口。
安全边界:应用必须连到 运行应用的那台机器上的 PAIR 代理,而不是直接连引擎,也不是连远端节点。请从 Endpoints 复制 URL。
操作
- 点顶栏 Endpoints
- 在 API endpoints 窗口找到你准备好的引擎
- 复制代理地址。形如(端口以界面为准):
http://127.0.0.1:<port>
若提示 No engines are running,回到步骤 4 启动引擎。只要集群里 任意节点 上该引擎在跑,Endpoints 就会列出对应代理——应用侧地址不随「实际干活的机器」变化。
端口惯例(仍以 Endpoints 复制值为准):
- Ollama 兼容代理 —
11434 - PAIR 背后的 Ollama —
11435起 - LM Studio / OpenAI 代理 —
1234 - PAIR 背后的 LM Studio —
1235起

看哪里:Endpoints 窗口中的本机环回 URL;预期可一键复制,而不是手写 11434。
预期结果
- 剪贴板中有
http://127.0.0.1:…形式地址 - 下文用
{PAIR_BASE_URL}指代该地址
排错
- 没有条目:先保证引擎 running,再刷新 Endpoints
步骤 6:用 curl 发送第一次测试请求
目标:经 PAIR 代理打通聊天补全,并在 Jobs 看到任务。
操作
把命令里的 {PAIR_BASE_URL} 换成步骤 5 复制的地址,{MODEL_NAME} 换成步骤 4 的精确模型名。
PAIR 不改写请求体,按引擎原样转发。推荐先用 OpenAI 风格(两种引擎都可用):
curl {PAIR_BASE_URL}/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "{MODEL_NAME}",
"messages": [
{
"role": "user",
"content": "Tell me a short story about a dog who learns to skateboard."
}
]
}'
仅在使用 Ollama 端点时,也可用原生接口(-N 便于看流式输出):
curl -N {PAIR_BASE_URL}/api/chat \
-H "Content-Type: application/json" \
-d '{
"model": "{MODEL_NAME}",
"messages": [
{
"role": "user",
"content": "Tell me a short story about a dog who learns to skateboard."
}
]
}'
引擎能力速查:
- Ollama — OpenAI
/v1/chat/completions:可用;Ollama/api/chat:可用 - LM Studio — OpenAI
/v1/chat/completions:可用;Ollama/api/chat:不可用
列出集群模型清单:
curl {PAIR_BASE_URL}/v1/models
预期结果
- 终端返回 JSON,含助手回复(OpenAI 风格常见于
choices[0].message.content) - Overview 切到 Jobs,任务卡片上可见 Ran on / Running on
排错
- 连接拒绝:确认
{PAIR_BASE_URL}来自 Endpoints,PAIR 仍在运行 - 模型未找到:
/v1/models核对精确名称后重试 - LM Studio 误用
/api/chat:改回/v1/chat/completions
步骤 7:本课检查清单
- PAIR 已安装,Overview 不再长期 Loading
- 至少一个引擎为 running,并已下载可用模型
- 已从 Endpoints 复制本机环回代理地址
-
curl聊天请求返回正常内容,Jobs 中出现对应任务
下一课:配对第二台机器、观察跨节点路由,并按官方安全约束把应用接到本机环回端点。
配图来自 NVIDIA Personal AI Router 官方文档(Overview / Endpoints),版权归 NVIDIA;课程封面使用产品页官方 OG 图。官方演示动图见 Personal-AI-Router 仓库 assets。
