本地部署Ollama与Qwen/Gemma
目录
前言
本文记录在
Ubuntu + NVIDIA RTX 5090环境下安装Ollama,并部署Qwen3.6与Gemma4本地大语言模型的完整流程。1. 检查NVIDIA GPU
首先确认NVIDIA驱动和GPU工作正常:
|
|
如果能够正常显示RTX 5090、驱动版本、CUDA版本和显存信息,即可继续安装Ollama。
2. 安装Ollama
使用官方安装脚本:
|
|
安装完成后,将Ollama设置为立即启动并随系统自动启动:
|
|
以后Ubuntu重启后,Ollama会自动启动,不需要再次执行该命令。
可以检查服务状态:
|
|
3. 下载中文模型Qwen3.6
下载模型:
|
|
如果
ollama pull下载速度明显变慢,可以按Ctrl+C终止当前下载,然后重新执行同一个ollama pull命令,通常会继续复用已下载的数据并恢复较高下载速度。
4. 下载英文模型Gemma4
下载模型:
|
|
5. 查看已安装模型
执行:
|
|
正常情况下可以看到已经下载的Qwen3.6和Gemma4,例如:
|
|
需要注意:
ollama list:查看已经安装在磁盘中的模型ollama ps:查看当前已经加载到内存或显存中的模型
6. 测试中文模型
运行:
|
|
进入交互模式后,可以输入中文进行测试,例如:
|
|
7. 测试英文模型
运行:
|
|
例如输入:
|
|
确认英文生成正常即可。
8. 检查是否使用RTX 5090 GPU
模型运行后,在另一个终端执行:
|
|
重点查看PROCESSOR一栏。
如果显示:
|
|
说明模型已经完整加载到GPU上运行。
9. 完整安装命令汇总
如果只需要快速完成整个安装流程,可以依次执行:
|
|
中文模型测试:
|
|
英文模型测试:
|
|
检查 GPU:
|
|
如果模型运行时显示:
|
|
则说明Ubuntu + Ollama + RTX 5090 + 本地大语言模型的基本环境已经配置完成。
10. 日常使用
Ubuntu重启后通常不需要重新启动Ollama服务,也不需要重新下载模型。
直接运行:
|
|
或者:
|
|
即可。
如果需要确认Ollama服务是否已经启动:
|
|
正常应返回:
|
|
检查是否设置为开机启动:
|
|
正常应返回:
|
|
至此,本地Ollama双模型环境配置完成。