LocalAI 完整指南:三步在自己电脑上离线跑大模型、画图和语音
【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI
你想在老笔记本上跑一个 7B 大模型,别人都说得配高端显卡;公司想把合同文件喂给 AI 辅助审阅,但数据发到云端 API 又是保密红线。这两类问题,LocalAI 本地部署一次解决:装在你自己的机器上,文本聊天、图像生成、语音识别、文字转语音全部离线跑,不要求 GPU,数据不出手。
值不值得:本地跑和用云 API 的三个取舍
先给判断:如果你处理敏感数据,或者长期高频使用,本地部署更划算;如果只是偶尔调几次 API,云服务的省事可能更值。具体看这三个你最可能在意的点:
| 取舍点 | 云 API | LocalAI 本地部署 |
|---|---|---|
| 隐私 | 数据发往第三方服务器,敏感文件根本不敢传 | 数据全程不离开你的机器,适合做隐私优先的本地推理 |
| 成本 | 按 token、按张计费,越用越贵 | 拉一次镜像,之后跑多少都不花钱 |
| 可控性 | 模型版本、配额、限流由服务商定 | 模型、参数、并发数全在你手里,连推理引擎都能换 |
小设备为什么也能跑大模型
大白话结论:LocalAI 本体是个很小的“壳”,真正干活的是一堆可插拔的推理引擎,跑什么模型才拉什么引擎,用不到的完全不装。
- 你不用操心的事——格式兼容。GGUF、ONNX 这类模型格式,不同引擎、不同模型之间的差异都被统一接口抹平了,core/backend/ 目录就是这层抽象的实现。对使用端的意义是:同一套 OpenAI 兼容 API 调用所有模型,不用为每种格式学一套用法。
- 你不用担心的事——安装体积。llama.cpp、whisper.cpp、stable-diffusion、vLLM 每个后端都是独立镜像,按需拉取,这就是官方宣传的“no GPU required”之外更省资源的一点:没有显卡也能 CPU 跑,装了用不到的东西也不会拖慢启动。
- 多机怎么串起来——P2P 分布式。它能帮你省掉“必须买一台强力机器”这一步:局域网里的几台旧设备可以组成小集群,core/p2p/p2p.go 负责节点发现和任务分配,大模型任务可以拆到多台设备上跑,结果再聚合回来。
三步跑起来:从空机器到第一次对话
跟着做完这三步,你就能看到模型回复。官方推荐的安装方式是容器(Docker/Podman 均可);macOS 用户也可以直接装 DMG 应用,Linux 有静态二进制,细节在 docs/content/getting-started/。
第一步,拉镜像并启动(纯 CPU 机器用这个):
docker run -p 8080:8080 --name local-ai -ti localai/localai:latest有 NVIDIA 显卡就换对应镜像并加--gpus all:
docker run -p 8080:8080 --gpus all -ti localai/localai:latest-gpu-nvidia-cuda-12第二步,选模型。浏览器打开http://localhost:8080,在 Models 页挑一个模型点安装——它会下载模型文件,并自动拉取对应的后端引擎,这一步通常只需要等下载。
第三步,用起来。在网页 Chat 里直接对话;或者代码里把 OpenAI 客户端的 base_url 指向http://localhost:8080/v1,原来的调用代码基本不用改。
对号入座:你这台机器能跑什么
别一上来就选最大的模型。按你的档位对号入座,先跑通再升级:
| 机器档位 | 建议装的模型 | 预期体验 |
|---|---|---|
| 树莓派 / 4GB 内存小主机 | 1B–3B 量化小模型(Q4_K_M) | 短对话、分类、摘要够用,每秒几个 token |
| 8GB 内存笔记本(纯 CPU) | 3B–8B 的 Q4 量化版,外加 Whisper-base 做转写 | 聊天流畅,语音转写稍慢但能离线跑 |
| 16GB 内存 + 中端显卡 | 8B–14B 的 Q4/Q8 量化版 | 每秒二三十个 token,还能低分辨率出图 |
| 32GB / 高端显卡 | 70B 量化版、Flux 级绘图模型、多模型并存 | 接近云 API 的手感,出图秒级 |
通用规则:内存不够就选量化版本,Q4_K_M 和 Q8_0 能把体积压掉大半;具体模型参数想调(上下文大小、线程数等),可以在模型配置里改,写法见 docs/content/getting-started/customize-model.md。
跑得慢?先试这几招
先定位症状,再改对应的地方,每条都能立刻验证效果:
| 症状 | 改哪里 | 预期改善 |
|---|---|---|
| 加载就 OOM、系统卡死 | 换低精度量化(Q8_0 → Q4_K_M),或直接换更小模型 | 内存占用降三成以上,能正常加载 |
| 文本生成慢 | 提高线程数;有显卡就换 GPU 镜像(CUDA/Vulkan) | GPU 下快数倍,纯 CPU 加线程也有明显提升 |
| 长对话时内存吃紧 | 调小上下文窗口(如 4096) | 显存/内存占用下降,加载更快 |
| 多个模型来回切换 | 用模型库按需加载 + 自动卸载,别常驻 | 一台机器轮流跑多个模型不爆内存 |
| 多人共用一台机器 | 开多用户认证配额,或用 P2P 把负载分给多台设备 | 不再挤在一个入口排队 |
LocalAI 能替你干哪些活
- 聊天问答:适合多轮对话、写代码、整理笔记,以及把现有应用接到本地模型(OpenAI 兼容,改个 base_url 就行)。什么时候该用它——你不想让业务数据经过第三方服务器时。
- 图像生成:接入 Flux.1-dev 等扩散模型,输入一句描述出图。什么时候该用它——批量出素材图、做设计草稿,或者图案涉及版权、不想外传的场景。
- 语音链路:语音识别(Whisper 类模型转写录音)、文字转语音(多种音色和语言,语速可调),Talk 页面把三者串成离线语音对话。什么时候该用它——会议转写、语音录入、给视障用户或免手场景做本地语音助手。
卡住了去哪找
- 安装失败、起不来 → 查 docs/content/getting-started/troubleshooting.md,常见问题都有对应条目。
- 不知道选哪个模型、参数怎么调 → 看 docs/content/getting-started/models.md。
- 认证、Agent、分布式等功能细节 → 翻 docs/ 目录下的对应章节。
- 发现 bug 或想提代码 → 读 CONTRIBUTING.md 了解贡献流程,问题走项目 issue 渠道。
今晚就开始
先别买显卡,也别急着上 70B:拉一个镜像,从模型库里挑最小的模型,跑通第一句离线对话,再凭手感决定升不升级。LocalAI 本地部署装一次就是自己的,慢慢把能搬到本地的活一件件搬过来。
【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考