1. 安装 Ollama
执行以下命令安装 Ollama:
curl -fsSL https://ollama.com/install.sh | sh校验是否安装成功:
ollama --version2. 配置环境变量(关键参数)
export OLLAMA_HOST=0.0.0.0:11434 export OLLAMA_MODELS=/data/ollama/models export OLLAMA_NUM_GPU=999 export OLLAMA_KEEP_ALIVE=24h export OLLAMA_NUM_PARALLEL=13. 创建目录
mkdir -p /data/ollama/models4. nohup 后台启动服务
nohup ollama serve > /data/ollama/ollama.log 2>&1 &5. 验证服务是否正常(等待 3~5 秒)
curl 127.0.0.1:11434/api/tags✅ 返回{"models":[]}代表服务正常。
6. 拉取 Qwen2.5-VL-7B Q4_K_M
ollama pull qwen2.5vl:7b-q4_K_M7. 交互式测试
ollama run qwen2.5vl:7b-q4_K_M配套常用命令
# 实时看日志 tail -f /data/ollama/ollama.log 查看进程 ps aux | grep ollama 停止 ollama、释放显存 pkill ollama⚠️ 重要提醒:当前是 Pod 内 nohup 后台,Pod 一旦重启,ollama 进程会消失,长期稳定部署需要 K8s YAML。
⚠️ 硬件:RTX3060 12G,q4_K_M 刚好适配,不要更高量化版本,容易 OOM。
已自动修正空格、标点及英文大小写,并将 Markdown 内容分割为规范的标题、段落和代码块。 end_of_last_edit