Deployment Plan · 2026-08
在 Windows Server 2019 + 多卡 RTX 3090 上部署开源大模型,并通过 Tailscale 接入 OpenClaw。分四个阶段:验证 → 基础部署 → 组网接入 → 性能升级。
在服务器 PowerShell 里依次执行,任何一步异常先解决再继续:
# 1. 确认 GPU 数量、驱动、CUDA 版本(报"不是命令"= 驱动未装好)
nvidia-smi
# 2. 确认磁盘空闲空间(模型文件需要 150GB+,选最空的盘)
wmic logicaldisk get caption,freespace,size
# 3. 确认当前账号有管理员权限(装软件、开防火墙需要)
先用 Ollama 起步——Windows 原生支持多卡自动切分,一小时内能出结果。验证价值后再考虑升级 vLLM(见 P4)。
从 ollama.com/download/windows 下载安装包,正常安装。
# 允许局域网/Tailscale 访问(默认只监听 127.0.0.1)
setx OLLAMA_HOST "0.0.0.0:11434" /M
# 模型存到空间大的盘(按实际盘符改)
setx OLLAMA_MODELS "D:\ollama-models" /M
# 模型加载后常驻内存 1 小时,避免每次请求重新加载大模型
setx OLLAMA_KEEP_ALIVE "1h" /M
# 开启 Flash Attention,省显存
setx OLLAMA_FLASH_ATTENTION "1" /M
设置后重启 Ollama 服务(任务栏图标退出再启动,或注销重登)。
New-NetFirewallRule -DisplayName "Ollama" -Direction Inbound -Protocol TCP -LocalPort 11434 -Action Allow
| 模型 | 大小 | 定位 | 对标(估计) |
|---|---|---|---|
qwen3:30b-a3b | ~19GB | 先跑通流程 + 测速的验证模型,本身也是极快的日常 worker | Haiku+ 档 |
gpt-oss:120b | ~65GB | 主力推荐3 张卡即可全进显存,速度快,推理能力强 | 接近 Sonnet |
qwen3:235b-a22b | ~140GB | 能力上限。显存装不下的部分自动放内存,速度会明显下降(粗估 5–15 tok/s,需实测) | Sonnet 档 |
ollama pull qwen3:30b-a3b
ollama run qwen3:30b-a3b # 对话测试,跑通后再拉大的
ollama pull gpt-oss:120b
# 推理时另开窗口看显存占用是否分布到了多张卡
nvidia-smi
# 看加载详情(CPU/GPU 分配比例)
ollama ps
目标:Mac 和跑 OpenClaw 的 Air 都能安全访问这台服务器,且不暴露公网。
ping win-o6o0ldu2n1u(或 Tailscale 分配的 100.x IP)。curl http://<服务器TS地址>:11434/v1/modelsOllama 暴露 OpenAI 兼容 API(http://<TS地址>:11434/v1),OpenClaw 支持自定义 OpenAI 兼容 provider,原理上就是加一个 provider 配置。
| 方案 | 适用场景 | 代价 |
|---|---|---|
| 继续用 Ollama | 单人使用、后台任务,当前速度够用 | 无 |
| WSL2 + vLLM | 需要高并发(多个 agent 同时调用)、更高吞吐;tensor parallel 真正并行用满多卡 | 配置复杂度高一档;WSL2 下 GPU 直通需驱动配合 |
| llama.cpp server 直跑 | 想精细控制 MoE 专家层的 CPU/GPU 分配,把 qwen3:235b 速度榨到最高 | 手动编译/调参 |
3090 支持 NVLink(仅成对),推理场景收益有限,不必强求。
nvidia-smi 输出发回来(确认卡数和驱动)qwen3:30b-a3b 测通,再拉 gpt-oss:120b