把大模型搬回家:exo 本地 AI 集群从零到上手实操指南
【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo
70B 的模型塞不进一台机器的内存,租云 GPU 又越来越贵,要是能把模型拆开,分摊到书房那台旧 Mac、工作站的笔记本上一起跑呢?exo 做的就是这件事:它把你的设备自动连成一个本地 AI 集群,让大模型跨多台设备运行,而且设备越多跑起来越快。
一句话看懂 exo
说白了,exo 是一个"组网工具":你在每台设备上装上它,设备会在同一网络里自动找到彼此,合成一个集群,不用手动填 IP、配端口。
它适合谁?手里有几台 Apple Silicon(M 系列芯片)电脑、但单台内存又跑不动大模型的人,以及想数据留在本地不出内网的人。它解决的核心问题就一个:单台机器内存不够,那就把模型权重拆到几台机器上各扛一份。
还有个卖点:它不只是"能跑"。exo 支持张量并行(多台机器同时算同一批数据),官方数据是 2 台设备最高约 1.8 倍加速,4 台约 3.2 倍。
集群是怎么找到设备、拆开模型的
核心思路一句话:先看地图,再分活。
每台设备启动 exo 后会向周围广播信号,互相自动发现。之后 exo 实时画出一张"地图":每台机器的空闲内存、每两台设备之间的带宽。再根据这张图自动决定模型怎么拆、哪一层放哪台机器,你不需要手写拆分规则。
你真正要做的只有两件事:多备几台机器,让互联尽量快。带雷雳 5(第五代雷雳接口,带宽更高)的设备还能开启 RDMA(一种大幅降低传输延迟的内存直连技术),官方演示里 4 台 M3 Ultra Mac Studio 靠它跑起了 Qwen3-235B。
四步跑起来
- 先拿到源码(macOS 用户也可以直接装官方 App)。
git clone https://gitcode.com/GitHub_Trending/exo8/exo- macOS 用户嫌编译麻烦,一条命令装官方 App。
brew install --cask exo- 集群里每台设备分别运行 exo,等它们自动发现彼此即可。
- 浏览器打开内置仪表盘(默认端口 52415),选模型、发消息、看集群负载。
官方 macOS App 需要 macOS 26.2 以上;Linux 上也能跑,但注意当前 Linux 版只用 CPU 推理,支持到什么程度可以看平台支持列表。想绕过网页用命令管理集群,参考API 接口文档。
场景和功能对号入座
| 你想做什么 | 对应能力 | 怎么启用 | 难度 |
|---|---|---|---|
| 跑单机放不下的模型 | 多设备张量/流水线分片,自动决策 | 多台设备上线即自动生效 | 低 |
| 沿用现有 OpenAI/Claude 客户端 | 兼容 OpenAI、Claude、Responses、Ollama 四套 API | 把客户端指向 52415 端口 | 低 |
| 加载 HuggingFace 自定模型 | 自定义模型卡 | 调用 /models/add 接口 | 中 |
| 跑图像生成模型 | 图像模型支持 | 设环境变量 EXO_ENABLE_IMAGE_MODELS | 中 |
| 同一办公室跑多个集群 | 集群命名空间隔离 | 设 EXO_LIBP2P_NAMESPACE | 中 |
| 对比哪种拆分最快 | exo-bench 基准测试 | 见基准测试方法说明 | 中 |
4 台 M3 Ultra Mac Studio 跑 Qwen3-235B(8-bit)的实测画面如下,可以用来对照你手里硬件的档次。
常见坑与避坑方法
Linux 上跑为什么几乎没有加速?当前 Linux 版只用 CPU 推理,GPU 支持还在开发。想要 Apple Silicon 那种加速效果,先用 Mac,Linux 用户的进度可看平台支持列表。
RDMA 开了为什么没生效?门槛不低:设备得是雷雳 5、每台设备要和其余所有设备物理互联,还要在 macOS 26.2 恢复模式里执行 rdma_ctl enable,且各台机器系统版本必须完全一致。任何一条不满足,集群照常工作,只是没有额外加速。
模型下下来会不会占满系统盘?模型默认存到用户目录(macOS 为 ~/.exo/models)。用 EXO_MODELS_DIRS 环境变量可以把下载位置指到移动硬盘,空间不足时会自动回退到其他目录。
macOS App 卸载不干净?App 内置卸载入口:菜单栏图标 → 高级 → 卸载。如果 App 已经被你删掉,可以运行独立卸载脚本,另外记得去系统设置的"登录项"里手动移除。
总结:它适合谁
exo 把"一台机器内存不够"变成了"几台机器一起扛",体验上自动发现、自动拆模型,上手成本低;但它目前主要围绕 Apple Silicon 优化,Linux 版只能算能用。
如果你手里有两台以上 M 系列 Mac,内存有点捉襟见肘,又想让大模型本地、私有地跑起来,可以认真试试它。你打算拿它解决什么问题?
【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考