Deployment Plan · 2026-08

3090 服务器 LLM 部署方案

在 Windows Server 2019 + 多卡 RTX 3090 上部署开源大模型,并通过 Tailscale 接入 OpenClaw。分四个阶段:验证 → 基础部署 → 组网接入 → 性能升级。

硬件条件

GPU≥3× RTX 3090每张 24GB,共 ≥72GB 显存;是否有第 4 张待 nvidia-smi 确认
内存256 GB可兜住超出显存的 MoE 大模型
CPU2× Xeon Silver 421632 核 64 线程,够用不出彩
系统Windows Server 2019多卡工具链弱于 Linux,必要时上 WSL2
这套配置能跑 100B+ 级开源模型,能力对标 Claude Sonnet 档(估计值),远超 16GB Mac 的 8B 档位。

P0部署前验证

在服务器 PowerShell 里依次执行,任何一步异常先解决再继续:

# 1. 确认 GPU 数量、驱动、CUDA 版本(报"不是命令"= 驱动未装好)
nvidia-smi

# 2. 确认磁盘空闲空间(模型文件需要 150GB+,选最空的盘)
wmic logicaldisk get caption,freespace,size

# 3. 确认当前账号有管理员权限(装软件、开防火墙需要)

P1基础部署:Ollama

先用 Ollama 起步——Windows 原生支持多卡自动切分,一小时内能出结果。验证价值后再考虑升级 vLLM(见 P4)。

1. 安装

ollama.com/download/windows 下载安装包,正常安装。

2. 配置环境变量

# 允许局域网/Tailscale 访问(默认只监听 127.0.0.1)
setx OLLAMA_HOST "0.0.0.0:11434" /M

# 模型存到空间大的盘(按实际盘符改)
setx OLLAMA_MODELS "D:\ollama-models" /M

# 模型加载后常驻内存 1 小时,避免每次请求重新加载大模型
setx OLLAMA_KEEP_ALIVE "1h" /M

# 开启 Flash Attention,省显存
setx OLLAMA_FLASH_ATTENTION "1" /M

设置后重启 Ollama 服务(任务栏图标退出再启动,或注销重登)。

3. 开防火墙端口

New-NetFirewallRule -DisplayName "Ollama" -Direction Inbound -Protocol TCP -LocalPort 11434 -Action Allow

4. 拉取模型(按顺序验证)

模型大小定位对标(估计)
qwen3:30b-a3b~19GB先跑通流程 + 测速的验证模型,本身也是极快的日常 workerHaiku+ 档
gpt-oss:120b~65GB主力推荐3 张卡即可全进显存,速度快,推理能力强接近 Sonnet
qwen3:235b-a22b~140GB能力上限。显存装不下的部分自动放内存,速度会明显下降(粗估 5–15 tok/s,需实测)Sonnet 档
ollama pull qwen3:30b-a3b
ollama run qwen3:30b-a3b   # 对话测试,跑通后再拉大的
ollama pull gpt-oss:120b

5. 验证多卡与速度

# 推理时另开窗口看显存占用是否分布到了多张卡
nvidia-smi

# 看加载详情(CPU/GPU 分配比例)
ollama ps
速度均为估计值:gpt-oss:120b 预期 30–60 tok/s,qwen3:30b-a3b 预期 80+ tok/s。实测低太多的话,先查是否有卡插在 x1/x4 的慢 PCIe 槽上(nvidia-smi -q 可看链路宽度)。

P2组网:Tailscale 接入

目标:Mac 和跑 OpenClaw 的 Air 都能安全访问这台服务器,且不暴露公网

  1. 服务器上安装 Tailscale for Windows,登录你现有的 Tailnet(和 Mac/Air 同一账号)。
  2. 在 Mac 上验证连通:ping win-o6o0ldu2n1u(或 Tailscale 分配的 100.x IP)。
  3. 验证 API 可达:
    curl http://<服务器TS地址>:11434/v1/models
安全红线:Ollama 没有任何鉴权。绝对不要把 11434 端口映射到公网,只通过 Tailscale 内网访问。同理 RDP 也建议只走 Tailscale。

P3接入 OpenClaw

Ollama 暴露 OpenAI 兼容 API(http://<TS地址>:11434/v1),OpenClaw 支持自定义 OpenAI 兼容 provider,原理上就是加一个 provider 配置。

P4性能升级(可选,先跑 P1–P3)

方案适用场景代价
继续用 Ollama单人使用、后台任务,当前速度够用
WSL2 + vLLM需要高并发(多个 agent 同时调用)、更高吞吐;tensor parallel 真正并行用满多卡配置复杂度高一档;WSL2 下 GPU 直通需驱动配合
llama.cpp server 直跑想精细控制 MoE 专家层的 CPU/GPU 分配,把 qwen3:235b 速度榨到最高手动编译/调参

3090 支持 NVLink(仅成对),推理场景收益有限,不必强求。

已知风险

下一步清单

  1. 跑 P0 两条命令,把 nvidia-smi 输出发回来(确认卡数和驱动)
  2. 装 Ollama + 环境变量 + 防火墙(P1.1–1.3)
  3. qwen3:30b-a3b 测通,再拉 gpt-oss:120b
  4. 装 Tailscale,Mac 上 curl 通 API
  5. 回来一起看 OpenClaw 的 provider 配置