1

安装 PAIR、准备引擎模型并用 curl 打通本地端点

从 GitHub Releases 安装 PAIR,完成首启与模型下载,复制 Endpoints 地址,用 OpenAI 兼容 curl 验证推理成功。

图文20 分钟NVIDIA PAIR 官方文档 ↗

课程目录1 / 2

学习位置仅保存在当前浏览器,有效期 180 天。

01 / 图文教材

图文讲义

NVIDIA Personal AI Router(PAIR)是本地多机推理路由器:在局域网发现并配对兼容电脑,对外提供 Ollama 兼容OpenAI 兼容的本机代理端点。它按引擎可用性、模型是否在位、当前负载,把彼此独立的请求送到有能力服务的那一台。

本课按官方 Playbook / Getting Started 走最短链路:安装 → 首启 → 引擎与模型 → 复制 Endpoints → curl 验证

安全边界:PAIR 把每个请求路由到一台机器。它不会合并多卡显存,不会把多块 GPU 拼成更大逻辑 GPU,也不会把同一模型或同一次推理拆到多机。

官方来源

步骤 1:确认硬件与软件前提

目标:对照官方支持矩阵,至少准备一台可安装 PAIR 的系统。

操作

平台速查(字段名:值):

DGX Spark

  • 系统:DGX OS(Linux)
  • 多机:可入集群

GeForce RTX / RTX PRO

  • 硬件:GeForce RTX 20 系及以上;RTX PRO(Turing+)
  • 系统:Windows 11 或 Linux
  • 多机:可入集群

兼容节点

  • 系统:Win11 / Linux / macOS(x64、arm64;Win on ARM 实验性)
  • 多机:可互配

软件与网络:

  • GitHub Releases 下载安装包(.exe / .deb / .dmg
  • OllamaLM Studio 至少在一台「出活」机器上可用;首启也可让 PAIR 代装引擎
  • 多机时设备须在同一 受信局域网;六位 PIN 是短期引导码,不是长期口令

安全边界:不要在同一台机器同时跑桌面版 PAIR 与终端界面(nvpair),二者会抢端口与配置。无桌面或 SSH 场景改用 Terminal setup

预期结果

  • 已选定目标 OS / 安装包架构
  • 预计耗时约 10 分钟,外加引擎与模型下载(官方 Time & risk)

排错

  • 不确定架构:在系统信息里确认 x64 / arm64 后再下载对应包

步骤 2:安装 PAIR

目标:完成安装并成功打开 PAIR(或 nvpair)。

Windows

操作

  1. 下载与架构匹配的 Windows 安装包
  2. 运行安装程序,批准系统与防火墙提示(安装器会写入 PAIR 规则)
  3. 从开始菜单打开 NVIDIA Personal AI Router

Debian / Ubuntu

操作

在下载目录执行(把 VERSION / ARCH 换成实际文件名,或用通配符):

sudo apt install \
  "./NVPAIR-Setup-VERSION-ARCH.deb"

# 目录里只有一个包时:
sudo apt install ./NVPAIR-Setup-*.deb

然后从应用菜单启动 NVIDIA Personal AI Router

macOS

操作

  1. 打开下载的 .dmg
  2. NVIDIA Personal AI Router 拖进 Applications
  3. 从 Applications 启动

无桌面环境时可直接运行:

nvpair

预期结果

  • 标题变为 broker ready v… 表示已连上服务
  • 若一直停在 connecting to broker...,到 Logs 检查服务输出

排错

  • Linux 权限不足:确认使用 sudo apt install ./… 指向本地 .deb
  • macOS 拦截:在系统设置中允许来自已识别开发者的应用后重试

步骤 3:完成首启并启动引擎

目标:结束向导,至少让一个推理引擎显示为 running

操作

  1. 首次打开时,查看可安装的推理引擎列表;平台可用时 默认勾选 Ollama
  2. 选择要安装的引擎;若你已单独管理 Ollama / LM Studio,可跳过安装,让 PAIR 检测现有实例
  3. 结束向导,等待所选引擎显示为 running

之后可在 Overview 点选节点卡片回到引擎设置;Settings → Cluster 可随时配对。

PAIR Overview 单节点(官方文档截图)

看哪里:Overview 节点卡片与引擎状态;预期看到引擎为 running,而不是长期 Loading。

预期结果

  • Overview 不再长期停留在 Loading...
  • 至少一个引擎为 running

排错

  • 超过一两分钟仍 Loading:打开 Settings → Service,再看 Troubleshooting(官方 Getting Started)

步骤 4:添加并加载一个模型

目标:保证本机节点「在线 + 引擎运行 + 本地已有请求模型」。

操作

在每台将要服务该模型的机器上重复:

  1. Overview 选中本机节点,打开引擎设置
  2. 如需则安装引擎,用开关 启动 引擎
  3. 展开引擎,点 Add model
  4. 下载模型,等待完成
  5. 若引擎要求单独 Load,再执行加载

终端界面nvpair):Engines(第 6 页签)→ i 安装、s 启动、p 拉取模型(如输入 llama3.2 后回车)。

本课先保证 本机 有一个可用模型;下一课再在第二台放同一模型做路由。

预期结果

  • 引擎下可见已下载模型
  • 需要 Load 的引擎已完成加载

排错

  • 下载很慢:属正常;保持窗口打开直至完成
  • 模型名不一致:下一课跨机路由时,两台必须使用完全相同的模型名字符串

步骤 5:复制本机 Endpoints

目标:拿到本机环回代理地址;不要手写端口

安全边界:应用必须连到 运行应用的那台机器上的 PAIR 代理,而不是直接连引擎,也不是连远端节点。请从 Endpoints 复制 URL。

操作

  1. 点顶栏 Endpoints
  2. 在 API endpoints 窗口找到你准备好的引擎
  3. 复制代理地址。形如(端口以界面为准):
http://127.0.0.1:<port>

若提示 No engines are running,回到步骤 4 启动引擎。只要集群里 任意节点 上该引擎在跑,Endpoints 就会列出对应代理——应用侧地址不随「实际干活的机器」变化。

端口惯例(仍以 Endpoints 复制值为准):

  • Ollama 兼容代理 — 11434
  • PAIR 背后的 Ollama — 11435
  • LM Studio / OpenAI 代理 — 1234
  • PAIR 背后的 LM Studio — 1235

API Endpoints(官方文档截图)

看哪里:Endpoints 窗口中的本机环回 URL;预期可一键复制,而不是手写 11434。

预期结果

  • 剪贴板中有 http://127.0.0.1:… 形式地址
  • 下文用 {PAIR_BASE_URL} 指代该地址

排错

  • 没有条目:先保证引擎 running,再刷新 Endpoints

步骤 6:用 curl 发送第一次测试请求

目标:经 PAIR 代理打通聊天补全,并在 Jobs 看到任务。

操作

把命令里的 {PAIR_BASE_URL} 换成步骤 5 复制的地址,{MODEL_NAME} 换成步骤 4 的精确模型名

PAIR 不改写请求体,按引擎原样转发。推荐先用 OpenAI 风格(两种引擎都可用):

curl {PAIR_BASE_URL}/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "{MODEL_NAME}",
    "messages": [
      {
        "role": "user",
        "content": "Tell me a short story about a dog who learns to skateboard."
      }
    ]
  }'

仅在使用 Ollama 端点时,也可用原生接口(-N 便于看流式输出):

curl -N {PAIR_BASE_URL}/api/chat \
  -H "Content-Type: application/json" \
  -d '{
    "model": "{MODEL_NAME}",
    "messages": [
      {
        "role": "user",
        "content": "Tell me a short story about a dog who learns to skateboard."
      }
    ]
  }'

引擎能力速查:

  • Ollama — OpenAI /v1/chat/completions:可用;Ollama /api/chat:可用
  • LM Studio — OpenAI /v1/chat/completions:可用;Ollama /api/chat:不可用

列出集群模型清单:

curl {PAIR_BASE_URL}/v1/models

预期结果

  1. 终端返回 JSON,含助手回复(OpenAI 风格常见于 choices[0].message.content
  2. Overview 切到 Jobs,任务卡片上可见 Ran on / Running on

排错

  • 连接拒绝:确认 {PAIR_BASE_URL} 来自 Endpoints,PAIR 仍在运行
  • 模型未找到:/v1/models 核对精确名称后重试
  • LM Studio 误用 /api/chat:改回 /v1/chat/completions

步骤 7:本课检查清单

  • PAIR 已安装,Overview 不再长期 Loading
  • 至少一个引擎为 running,并已下载可用模型
  • 已从 Endpoints 复制本机环回代理地址
  • curl 聊天请求返回正常内容,Jobs 中出现对应任务

下一课:配对第二台机器、观察跨节点路由,并按官方安全约束把应用接到本机环回端点。

配图来自 NVIDIA Personal AI Router 官方文档(Overview / Endpoints),版权归 NVIDIA;课程封面使用产品页官方 OG 图。官方演示动图见 Personal-AI-Router 仓库 assets