简介:面向需要在类Unix操作系统(如Linux、macOS)中部署Ollama的用户,这份安装资源包以“安装”为主线,系统梳理了从环境准备、脚本执行到配置验证的完整流程,避免用户在搜索零散教程时来回折腾。资源内容既涵盖Ollama基本功能与适用场景的介绍,也详细说明了安装前的系统要求、依赖检查、权限设置等关键环节,并对执行过程中可能遇到的典型错误给出排错思路,整体上兼顾了新手按步骤操作和运维人员快速参考两种需求。压缩包共3个文件,包含一个Shell安装脚本、一个PHP获取脚本和一份TXT说明文档,三者配合可完成自动获取安装包、运行安装过程及阅读详细使用说明,整个包体仅13KB,轻量而实用。目前已有434人学习下载,对于希望快速搭建Ollama运行环境的人来说,是一份值得收藏的实用工具。 最近又折腾了一轮本地大模型部署,前前后后试过llama.cpp、vLLM、LM Studio,最后还是踏踏实实回到Ollama。说真的,ollama install这件事本身不复杂,但网上教程十有八九只讲到“下一步下一步”,一遇到下载慢、想装到D盘、模型拉不下来就卡住了。这篇把我在Windows和Linux上实际安装、部署、接API时踩过的坑和验证过的方案完整写一遍,从安装预检到模型下载,再到和CherryStudio、Claude Code这类工具的对接,适合第一次接触Ollama本地部署的新手,也适合想换机器重新部署的老手对照避雷。
1. Ollama是什么,为什么值得本地跑
1.1 一句话理解Ollama
Ollama是一个开源的本地大模型运行时,底层用Go语言编写,把模型下载、服务启动、GPU/CPU推理、API暴露这一整个链路全部封装成了简单的命令行指令。官方维护了一个模型库,常见的Llama 3.1、Qwen2.5、Mistral、Phi、DeepSeek都能直接拉取。你不需要懂PyTorch、不需要配置Python环境、不需要处理CUDA兼容的各种版本地狱,一个安装包加几个命令就能把大模型跑起来。
它本质上做的是这么一件事:把开源模型变成“本地服务”。启动之后默认监听127.0.0.1:11434,对外暴露的是兼容OpenAI格式的HTTP接口。这意味着任何能调用OpenAI API的程序,改一行base_url就能切到本地模型,这是它能在开发者圈子里快速流行起来的最重要原因。
1.2 本地部署解决了哪些真实问题
我为什么建议有条件的场景优先考虑Ollama?核心有三点:
第一是隐私。用在线API时,你的代码、日志、文档片段都会经过第三方服务器。做内部工具、处理敏感数据时,这是硬伤。Ollama完全本机运行,数据不出内网,这一点对企业和个人开发者都是刚需。
第二是成本。只要有一张8GB显存的显卡,就能流畅跑7B量化模型。相比按Token计费的商业API,长期高频调用本地推理几乎是零边际成本。即使没有NVIDIA显卡,纯CPU推理速度慢一些,但对一些不需要实时响应的批处理任务也能接受。
第三是可控。模型版本、量化级别、停止词、上下文长度、系统提示词全都自己说了算。配合Modelfile模板文件,你可以像Dockerfile定制镜像一样定制自己的模型版本,这在做垂直场景应用时非常重要。
1.3 它和其他部署方式的区别
很多人纠结于Ollama、llama.cpp、vLLM、LM Studio到底选哪个。我给一个容易理解的判断:llama.cpp是底层推理引擎,性能极致但使用门槛高,适合跑benchmark或者二次开发;vLLM面向高并发生产环境,吞吐量大,但要配Python环境、要处理依赖;LM Studio偏图形界面,适合完全不想碰命令行的人。Ollama恰好卡在中间层,既能命令行操作、又有API接口、还有简单的服务管理,是最适合“个人开发者和中小团队做本地应用”的起点。
2. 安装前的预检与关键选型
2.1 硬件与系统要求
很多人下载了安装包装不上,或者装上之后启动就报错,其实是没看官方要求。
| 平台 | 系统版本要求 | 硬件备注 |
|---|---|---|
| Windows | Windows 10 22H2及以上,或Windows 11 | 建议8GB内存起步,显卡有NVIDIA CUDA支持最好 |
| Linux | 主流发行版(Ubuntu/Debian/CentOS/Rocky等) | x86_64或arm64,带GLIBC_2.17以上 |
| macOS | macOS 13及以上,Apple Silicon优先 | Intel版本能跑但性能一般 |
| Windows 7 | 不支持 | 官方没有任何安装渠道,不用折腾 |
这里要专门说一句:网上不少人在问“ollama win7能不能装”,实测结论是不行。Ollama依赖的操作系统底层能力和Win7差距太大,官方连32位系统的支持都没有。如果你的生产环境还停留在Win7,建议要么升级系统,要么改用Linux虚拟机方式运行。
显卡方面,Ollama会优先使用NVIDIA的CUDA,其次是Apple的Metal。AMD显卡通过ROCm也有支持,但配置相对麻烦。如果你用什么显卡都没有,CPU推理也能跑,只是速度慢,7B模型大概每秒几个Token,做实验够了,扛生产就会急死人。
2.2 Windows下原生安装与WSL2的选择
很多搜“ollama安装教程”的人会搜到旧文章,告诉你必须装WSL2,然后用Linux版Ollama。这是早期版本的限制,现在Windows已经有原生安装包OllamaSetup.exe,装完就是一个Windows原生服务,不再强制依赖WSL2。
但这不代表WSL2方案没有意义。如果你整体的开发环境就在WSL2里,比如你跑DB-GPT、各种Python框架都在Ubuntu里,那在WSL2的Linux环境里直接安装Linux版Ollama,后续模型文件和调用链会更统一。我的建议是:
- 只用来跑本地对话、接API做小工具:直接装Windows版,简单省事。
- Linux工具链已经跑在WSL2里:把Ollama也装进WSL2,模型文件随Linux环境管理。
- 注意两条路不要混着来,否则会出现两个Ollama实例抢端口。
2.3 磁盘规划:先想好模型放哪里
这是新手最容易忽略的一步。Ollama默认把模型存在用户目录下,Windows是C:\Users\你的用户名\.ollama\models,Linux是~/.ollama/models。一个7B的Q4量化模型大概4~5GB,13B大概8~9GB,如果你打算装四五个模型,C盘一下就满了。
所以强烈建议在安装之前,先定好模型盘。Windows用户可以直接设置一个叫OLLAMA_MODELS的系统环境变量指向D盘目录;Linux用户如果想改位置,也是同样的环境变量。这个变量必须在启动Ollama服务之前生效,否则模型目录不会迁移。改完之后,以后所有ollama pull下载的内容都会进这个新目录。
3. 分平台完整安装实操
3.1 Windows:从下载到验证
Windows安装的完整流程我整理成下面这几步:
- 前往官网下载
OllamaSetup.exe,或者在GitHub Releases页面拿最新版安装包。 - 双击安装包,不需要什么配置,一路默认即可,安装过程会注册一个后台服务。
- 安装完成后,打开一个新的CMD或PowerShell窗口,输入
ollama -v,能看到版本号说明命令可用。 - 输入
ollama list查看当前已安装的模型,初次使用应该是空列表。 - 确认服务是否在跑,可以访问
http://127.0.0.1:11434,如果返回Ollama is running就说明一切正常。托盘区也会出现一个羊驼图标,右键可以退出或打开日志。
这里有个细节:装完如果ollama命令提示找不到,基本是PATH没有刷新,新开一个终端窗口就行。如果新窗口还是找不到,去“系统属性 -> 环境变量”里确认安装目录(默认是C:\Users\你的用户名\AppData\Local\Programs\Ollama)有没有在PATH里,没有就手动加。
3.2 重点:怎么把Ollama装到D盘
“ollama怎么安装在d盘”这个问题被问得非常多,分两部分说清楚。
如果是安装包本身想装到D盘,老实说,官方Windows安装包没有提供选择目录的图形选项,默认必须装到用户目录。不想装C盘的话,可以在安装后用mklink /J做目录符号链接,把C:\Users\你的用户名\.ollama整个链接到D盘,这样模型数据落到D盘,C盘只留一个不到几十MB的程序文件。
如果是想“模型数据放D盘”,最简单的方式是先设置环境变量再启动Ollama:
- 在D盘创建一个目录,比如
D:\ollama\models。 - 打开系统环境变量设置,新建一个用户变量:
- 变量名:
OLLAMA_MODELS - 变量值:
D:\ollama\models
- 变量名:
- 保存后,完全退出Ollama托盘图标,重新启动,拉取模型时检查这个目录有没有新增文件即可。
实测下来,设置了这个变量之后,ollama pull下载的所有blob文件都会进入D盘指定目录。如果你的Ollama已经装完并且下载过模型了,最好把旧的.ollama\models目录整个剪切到新位置,再重启服务,这样省得二次下载。
3.3 Linux和macOS的安装
Linux安装最简单的方式是官方一行命令:
curl -fsSL https://ollama.com/install.sh | sh脚本会帮你下载二进制、创建ollama用户、注册systemd服务。装完输入systemctl status ollama看服务状态,默认监听本机11434端口。
如果你所在环境访问ollama.com不稳定,可以直接去GitHub Releases下载预编译的ollama-linux-amd64.tgz,解压后把ollama二进制放到/usr/local/bin,然后手动注册systemd服务。下面是一个我自己实测可用的systemd unit:
[Unit] Description=Ollama Service After=network-online.target [Service] ExecStart=/usr/local/bin/ollama serve User=ollama Group=ollama Restart=always RestartSec=3 Environment="OLLAMA_HOST=0.0.0.0:11434" [Install] WantedBy=default.target注意这个配置里我把监听地址设成了0.0.0.0,这样局域网里其他机器也能访问。如果只是本机用,保持127.0.0.1更安全。
macOS用户就简单了,下载dmg安装包,把Ollama拖进Applications目录。首次运行时如果系统提示“无法验证开发者”,去“系统设置 -> 隐私与安全性”里点击允许即可。
3.4 安装包下载太慢怎么办
“ollama下载太慢”分成两种情况:一种是安装包本身下不动,另一种是模型下不动。
安装包通常只有几十到一百多MB,但GitHub Releases的直连速度在国内经常不稳定。我自己常用的办法是找一个局域网里知道的GitHub加速镜像,或者让云服务器帮忙先wget下来再传回来。注意不要随便在网上下载来路不明的“破解版”“一键安装版”,Ollama是开源软件,正版就很好用,没必要冒安全风险。
模型下载慢是更普遍的问题,这个在第4节专门讲。
4. 模型下载与私有大模型部署
4.1 拉取模型:ollama pull与run
安装完成后,最核心的操作就是拉模型。最简单的命令是:
ollama run qwen2.5:7b这条命令会做两件事:先检查本地有没有qwen2.5:7b,没有就自动下载,下载完成后进入交互式对话界面。如果你不想进对话,只想先下载,就用:
ollama pull qwen2.5:7b模型名后面的7b是参数规模标识。常见的选择:
| 模型名 | 显存要求 | 适合场景 |
|---|---|---|
| qwen2.5:0.5b / 1.5b | 无需独立显卡 | 常见问答、文本分类、轻量任务 |
| qwen2.5:7b | 约6~8GB显存/运行内存 | 日常对话、代码补全 |
| llama3.1:8b | 约8GB显存 | 英文任务综合能力强 |
| qwen2.5:14b / 32b | 16GB以上显存 | 复杂推理、中文高质量输出 |
| deepseek-r1:7b / 14b | 8GB以上显存 | 思维链推理、数学逻辑题 |
注意ollama run第一次跑模型时,会先做一次加载和预热,感觉上像卡住了,其实是正常的。模型加载完成需要几秒到几十秒,看硬盘速度和内存大小。
4.2 国内加速:用Modelfile从GGUF导入模型
模型仓库默认源是Ollama官方,国内网络拉大模型动不动就几百MB一个分片,失败率高。我实测最稳的方案是绕开官方源,从ModelScope魔搭社区下载GGUF格式的模型文件,再用Modelfile导入Ollama。
具体流程:
- 在魔搭社区搜索你要的模型,例如搜索“Qwen2.5-7B-Instruct-GGUF”。
- 下载q4_k_m量化版本,这种格式在体积和效果之间平衡最好,单个文件即可。
- 在本地写一个
Modelfile(无后缀名):
FROM D:/models/qwen2.5-7b-instruct-q4_k_m.gguf TEMPLATE """<|im_start|>system {{ .System }}<|im_end|> <|im_start|>user {{ .Prompt }}<|im_end|> <|im_start|>assistant """ PARAMETER stop "<|im_start|>" PARAMETER stop "<|im_end|>"- 执行导入:
ollama create qwen2.5:7b-local -f Modelfile- 验证:
ollama list ollama run qwen2.5:7b-local这个方法完全绕开了Ollama官方模型的下载链路,速度取决于魔搭的下载速度,一般来说国内跑满千兆都正常。导入之后的使用方式、API调用方式都和平常拉下来的模型一样,没有区别。这个技巧解决了很多人的模型下载焦虑,我强烈建议模型一直拉不下来的朋友试试。
4.3 模型管理命令
日常用的管理命令就那几个:
ollama list:查看本地已有模型。ollama show 模型名:查看模型的参数、模板、上下文长度等信息。ollama rm 模型名:删除某个模型,清理磁盘空间。ollama cp:复制模型,常用于基于现有模型创建自定义版本。ollama ps:查看当前内存里正在运行的模型。
这里提醒一句,多次ollama run不同模型时,如果报内存不足或卡死,多半是之前加载的模型还在内存里驻留。执行一下ollama ps看看,或者重启Ollama服务释放内存。
4.4 用API把模型接出去
Ollama默认暴露的11434端口就是核心价值所在。它提供两类接口:一是Ollama原生接口/api/generate、/api/chat,二是OpenAI兼容接口/v1/chat/completions。
我一般建议所有新项目直接走OpenAI兼容接口,好处是以后想切换在线模型,只改base_url就行,代码完全不用动。一个最简单的调用示例:
curl http://127.0.0.1:11434/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "qwen2.5:7b", "messages": [{"role": "user", "content": "用一句话介绍Ollama"}], "stream": false }'如果是在Python里,更推荐用OpenAI官方SDK:
from openai import OpenAI client = OpenAI( base_url="http://127.0.0.1:11434/v1", api_key="ollama" ) resp = client.chat.completions.create( model="qwen2.5:7b", messages=[{"role": "user", "content": "你好,介绍一下你自己"}] ) print(resp.choices[0].message.content)注意api_key随便填一个非空字符串就行,Ollama本地默认不做鉴权。如果想让局域网内其他机器也能调用,需要设置环境变量OLLAMA_HOST=0.0.0.0:11434,重启服务后生效。跨机器调用一定要确认防火墙放行了11434端口。
5. 典型问题排查与生态对接
5.1 安装和下载阶段的高频问题
把我在社区里看到最多的几个问题汇总成一张速查表:
| 问题现象 | 根本原因 | 解决办法 |
|---|---|---|
| 安装包下载慢或失败 | GitHub Releases直连不稳 | 用GitHub加速镜像,或云服务器中转下载再拷贝 |
| 模型pull一直中断 | 官方模型源网络不稳定 | 改用魔搭下载GGUF后用Modelfile导入 |
| 装了Win7无法安装 | 系统版本过旧,官方不支持 | 升级到Win10 22H2以上,或用Linux跑 |
| 装完命令行找不到ollama | PATH未刷新 | 新开终端,或手动添加PATH |
wsl --install卡住或403 | Windows功能未启用或网络问题 | 控制面板手动启用“虚拟机平台”和“适用于Linux的Windows子系统”,或直接使用Windows原生安装版,绕开WSL2 |
| 下载了模型但C盘爆满 | 模型默认存在用户目录 | 重新设置OLLAMA_MODELS到D盘,并迁移已有models目录 |
5.2 运行时常见问题
connection refused类的报错,90%是Ollama服务没起来。Windows下检查托盘羊驼图标是否在运行;Linux下执行systemctl status ollama。如果服务起来了还是连不上,看防火墙有没有放行11434。
GPU不识别的问题也经常遇到。Windows下执行ollama --version之后,再跑一个模型,观察启动日志里有没有inference compute字样。如果没有GPU相关日志,先更新NVIDIA驱动,再用nvidia-smi确认驱动正常。这里有一个经常被忽略的细节:Ollama的GPU检测依赖CUDA运行库,驱动版本不能太老,建议直接用NVIDIA官方驱动更新工具拉最新稳定版。
还有一个很隐形的问题:修改了OLLAMA_MODELS或OLLAMA_HOST之后,界面看起来重启了,但实际后台服务没有重新读取环境变量。Windows用户可以右键托盘的羊驼图标退出,再重新从开始菜单启动;更彻底的办法是重启系统。
5.3 和其他工具的对接:CherryStudio与Claude Code
Ollama装好之后,很多人不想一直在黑窗口里对话,这时候图形界面就派上用场了。CherryStudio是目前对Ollama支持做得不错的桌面客户端,安装后进入“设置 -> 模型服务 -> Ollama”,填上本地API地址http://127.0.0.1:11434,它会自动读取本地已有的模型列表,勾选想要用的模型之后就能直接对话了。整个对接过程不需要填任何密钥,因为本地服务默认无鉴权。
另一个比较新的玩法是用cc switch这类工具把Claude Code切换到Ollama后端。Claude Code是Anthropic推出的终端编程助手,一般绑定Anthropic的API。但在一些场景下,通过cc switch切换供应商,可以把请求转发到兼容OpenAI格式的本地端点,这样就能让Claude Code借助本地Ollama里的模型跑起来。这个玩法对代码隐私敏感、又想在终端里享受AI辅助的人很有吸引力。需要注意的是,本地小参数模型的代码能力远不如在线商用模型,适合做辅助补全,别指望它能完全替代。
5.4 升级、卸载与维护
Ollama更新很勤,升级方式就是下载新版本安装包覆盖安装,或者在Linux下重新执行官方安装脚本。模型文件不会因为升级丢失。卸载时Windows去“设置 -> 应用”里卸载程序,但注意这只会删程序,.ollama目录下的模型不会自动删除,需要手动清理。
我个人的维护习惯是每月执行一次ollama list,看看哪些模型已经不用了,ollama rm掉,免得白白占着几十GB磁盘。对于高频使用的模型,尽量固定版本标签,比如qwen2.5:7b不要随手改成latest,否则某天ollama pull会把模型更新成大版本,回复风格突然变了都不知道怎么回事。
最后再分享一个实际操作里的小技巧:如果你在Windows上同时装了多个需要调用Ollama的工具,比如CherryStudio、Claude Code、ComfyUI、DB-GPT,它们默认都会往127.0.0.1:11434发请求,不会冲突。但如果你某一天发现某个工具提示连不上模型,先去浏览器打开http://127.0.0.1:11434看看返回是否正常,这个25秒就能完成的检查能帮你省下大量排查时间。本地大模型的部署没有想象中那么神秘,装好一个Ollama,你的终端、IDE、聊天客户端、绘画工具就都有了同一个“本地大脑”。
本文还有配套的精品资源,点击获取