目录

本地部署Ollama与Qwen/Gemma

misaraty 更新 | 2026-08-15
前言
本文记录在Ubuntu + NVIDIA RTX 5090环境下安装Ollama,并部署Qwen3.6Gemma4本地大语言模型的完整流程。

1. 检查NVIDIA GPU

首先确认NVIDIA驱动和GPU工作正常:

1
nvidia-smi

如果能够正常显示RTX 5090、驱动版本、CUDA版本和显存信息,即可继续安装Ollama

2. 安装Ollama

使用官方安装脚本:

1
curl -fsSL https://ollama.com/install.sh | sh

安装完成后,将Ollama设置为立即启动并随系统自动启动:

1
sudo systemctl enable --now ollama

以后Ubuntu重启后,Ollama会自动启动,不需要再次执行该命令。

可以检查服务状态:

1
systemctl status ollama

3. 下载中文模型Qwen3.6

下载模型:

1
ollama pull qwen3.6:27b-q4_K_M

如果ollama pull下载速度明显变慢,可以按Ctrl+C终止当前下载,然后重新执行同一个ollama pull命令,通常会继续复用已下载的数据并恢复较高下载速度。

4. 下载英文模型Gemma4

下载模型:

1
ollama pull gemma4:31b-it-q4_K_M

5. 查看已安装模型

执行:

1
ollama list

正常情况下可以看到已经下载的Qwen3.6Gemma4,例如:

1
2
qwen3.6:27b-q4_K_M
gemma4:31b-it-q4_K_M

需要注意:

  • ollama list:查看已经安装在磁盘中的模型
  • ollama ps:查看当前已经加载到内存或显存中的模型

6. 测试中文模型

运行:

1
ollama run qwen3.6:27b-q4_K_M

进入交互模式后,可以输入中文进行测试,例如:

1
请简要介绍密度泛函理论。

7. 测试英文模型

运行:

1
ollama run gemma4:31b-it-q4_K_M

例如输入:

1
Explain density functional theory in concise academic English.

确认英文生成正常即可。

8. 检查是否使用RTX 5090 GPU

模型运行后,在另一个终端执行:

1
ollama ps

重点查看PROCESSOR一栏。

如果显示:

1
100% GPU

说明模型已经完整加载到GPU上运行。

9. 完整安装命令汇总

如果只需要快速完成整个安装流程,可以依次执行:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
nvidia-smi

curl -fsSL https://ollama.com/install.sh | sh

sudo systemctl enable --now ollama

ollama pull qwen3.6:27b-q4_K_M

ollama pull gemma4:31b-it-q4_K_M

ollama list

中文模型测试:

1
ollama run qwen3.6:27b-q4_K_M

英文模型测试:

1
ollama run gemma4:31b-it-q4_K_M

检查 GPU:

1
ollama ps

如果模型运行时显示:

1
100% GPU

则说明Ubuntu + Ollama + RTX 5090 + 本地大语言模型的基本环境已经配置完成。

10. 日常使用

Ubuntu重启后通常不需要重新启动Ollama服务,也不需要重新下载模型。

直接运行:

1
ollama run qwen3.6:27b-q4_K_M

或者:

1
ollama run gemma4:31b-it-q4_K_M

即可。

如果需要确认Ollama服务是否已经启动:

1
systemctl is-active ollama

正常应返回:

1
active

检查是否设置为开机启动:

1
systemctl is-enabled ollama

正常应返回:

1
enabled

至此,本地Ollama双模型环境配置完成。