WSL2 本地部署 Qwen 35B 大模型终极指南
WSL2 本地部署 Qwen 35B 大模型终极指南
本文档基于 Windows 11 + WSL2 Ubuntu + NVIDIA RTX 5060 Ti 16GB 环境实测闭坑编译。按照本指南操作,可实现本地流畅运行 35B 参数级别的通义千问最新 MoE 模型,支持纯文本聊天、图文理解及 OpenAI 兼容 API 服务。经过专属参数优化,生成速度可达 30+ tokens/s。
硬件与软件前置要求
| 项目 | 推荐配置 | 备注说明 |
|---|---|---|
| 显卡 | NVIDIA RTX 30系及以上 | 本文针对 16G 显存优化。若为 12G 显存,建议后续选择 IQ3_M 量化版本 |
| CPU | 6核 12线程及以上 | 演示环境使用 AMD Ryzen 7 9700X |
| 内存 | 16GB 及以上 | 推荐 32GB 体验更佳 |
| 硬盘 | 至少 20GB 可用空间 | 模型及组件文件约占用 18GB 空间 |
| 系统 | Win 11 (22H2+) / Win 10 (21H2+) | Windows 端需安装最新 NVIDIA 驱动(WSL 内无需单独装显卡驱动) |
一、 安装 WSL2 与配置 Ubuntu 基础环境
1. 一键安装 Ubuntu
以管理员身份打开 Windows PowerShell,执行以下命令:
1 | # 检查 WSL 版本,确保是 WSL2 |
提示:安装过程中会提示您输入自定义的 Linux 用户名和密码。完成后建议重启一次电脑。
2. 验证 GPU 共享
打开刚刚装好的 Ubuntu 终端,执行:
1 | nvidia-smi |
如果能正确输出你的显卡型号(如 RTX 5060 Ti)和 CUDA 版本,说明 WSL2 已经成功共享了 Windows 的显卡驱动。
3. 换源与安装基础编译依赖
为了拒绝下载龟速,先切换为国内镜像源,然后安装编译所需的基础工具(此处已剔除重复的 huggingface 依赖):
1 | # 切换国内高速源(按提示选择阿里云或腾讯云即可) |
二、 安装 WSL2 专用 CUDA Toolkit 13.3
1. 配置 NVIDIA 官方 WSL 仓库
1 | # 设置仓库优先级,防止系统包冲突 |
2. 安装 CUDA 并配置环境变量
1 | # 刷新源并安装 CUDA 工具包 |
验证安装:执行
nvcc -V,若输出包含release 13.3即代表 CUDA 部署成功。
三、 编译最新版 llama.cpp(开启 CUDA 加速)
llama.cpp 是目前本地运行大模型性能最好的轻量级推理框架。
1 | # 克隆源码 |
配置全局全局变量
为了方便以后在任何目录下直接输入命令调用,建议将二进制工具路径加入系统环境:
1 | echo 'export PATH="$HOME/llama.cpp/build/bin:$PATH"' >> ~/.bashrc |
四、 独立环境下载 Qwen 35B 量化模型
我们选择 IQ4_NL 量化版本。它针对 llama.cpp 进行了深度优化,比传统的 Q4_K_M 格式能省下约 10% 的显存,同时几乎不损失模型智商,让 16G 显存吃得刚好。
1. 使用 pipx 安装最新官方下载工具
为了避免 Ubuntu 自带的组件版本过旧,我们使用 pipx 虚拟隔离环境来安装最新版的 huggingface_hub:
1 | # 安装 pipx |
⚠️ 重要步骤:执行完上面两行命令后,请关闭当前终端,重新打开一个新的 Ubuntu 窗口,然后再执行下面的安装命令:
1 | # 安装最新版 huggingface 下载客户端 |
2. 下载模型与视觉组件
1 | # 创建统一的模型存放目录 |
五、 优化运行模型与 API 服务
这里为你精简掉了原文档中重复混乱的命令。你可以根据需要,选择在“终端直接聊天”或“启动 Web/API 服务”。
选项 A:纯文本交互式终端聊天(速度最快)
直接在 Linux 终端里进行高速度的对话:
1 | llama-cli \ |
核心优化参数释义:
-ngl 999:将所有大模型层完整扔进显存(16G 刚好完美容纳)。-ncmoe 16:告诉框架这是个 16 专家的 MoE 架构,激发其最大性能。--flash-attn on:开启闪烁注意力机制,大幅降低显存压力并提速。
选项 B:一键启动多模态(图文)API 服务(最推荐 ⭐)
这种方式不仅会为你提供一个精美的网页聊天室,还可以作为一个完全兼容 OpenAI 接口标准的后端服务,用来对接类似 Page Assist、Cherry Studio、AnythingLLM 等各类精美的前端软件。
1 | llama-server \ |
服务启动后,你可以通过以下三种方式访问它:
- 自带 Web 界面:直接在 Windows 浏览器中输入
http://localhost:8080,即可进行文本/图片聊天、参数调优。 - OpenAI 兼容接口:API 地址为
http://localhost:8080/v1/chat/completions。 - 局域网内其他设备访问:在终端通过
ip addr查看 WSL 的内网 IP,其他设备输入http://<WSL_IP>:8080即可连通。
六、 常见问题快速排查
- 显存溢出(OOM)或推理时突然卡死:RTX 5060 Ti 16G 虽能吃下该模型,但当上下文过长时容易探顶。如果遇到该问题,请将启动命令中的上下文窗口
-c 16384缩小为-c 8192。 nvidia-smi报错找不到显卡:请去 NVIDIA 官网将 Windows 端的显卡驱动更新到最新版。- 编译
llama.cpp报错:大概率是系统没读到 CUDA 路径。请确保运行了source ~/.bashrc,或者直接输入nvcc -V检查有没有版本输出。




