ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

多台 Mac 组建成一个分布式 AI 集群:exo 多机推理加速完整指南

多台 Mac 组建成一个分布式 AI 集群:exo 多机推理加速完整指南 多台 Mac 组建成一个分布式 AI 集群exo 多机推理加速完整指南【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo想让大模型跑起来又不想为单台机器更高的内存买单exo 把这条路的成本拉低了很多。它开源的分布式 AI 集群框架让运行 exo 的设备在局域网内自动发现彼此、自动组网多台设备共享一个模型借助 Thunderbolt 5 上的 RDMA 通信设备间延迟降低 99%张量并行下 2 台设备最高提速 1.8 倍、4 台设备最高 3.2 倍。这篇指南带你从零把集群搭起来并讲清 RDMA 开启和日常跑模型的要点。上图为 4 台 M3 Ultra Mac Studio 上 Qwen3-235B8-bit的实测对比exoRDMA对 llama.cppTCP节点越多差距越大4 节点时 exo 达到 31.9 tokens/s。动手前的准备环境要求与三条安装命令系统方面需要 macOS Tahoe 26.2 或 LinuxLinux 目前跑在 CPU 上GPU 支持仍在开发。macOS 上另需准备 Xcode提供 MLX 编译所需的 Metal 工具链、uvPython 依赖管理、node构建仪表盘和 Rust 工具链。如果这些依赖已就绪实际只需要三条命令git clone https://gitcode.com/GitHub_Trending/exo8/exocd exo/dashboard npm install npm run build cd ..uv run exo启动后每台设备的http://localhost:52415都会提供仪表盘和 API这是后续所有操作的基础。3 步拉起第一个 exo 集群第一台机器执行uv run exo它就是集群的第一个节点。同一网络里的其他设备同样安装并运行 exo无需任何手动配置它们会自动发现并加入集群。打开任一节点的仪表盘确认所有节点都已出现在列表中。图中 4 台 Mac Studio 组成一个 exo 集群每个节点标注了内存、温度和功耗虚线表示节点间的通信链路。这里要提一句框架内部exo 会基于实时的拓扑视图——包括每台设备的资源和每条链路间的延迟、带宽——自动决定模型怎么拆分到各台设备上也就是所谓的拓扑感知自动并行你不需要手工规划。RDMA 开启的 6 个步骤与 3 个坑 ⚡RDMARemote Direct Memory Access绕过 CPU 直接读写远端内存的通信技术是 macOS 26.2 引入的能力适用于带 Thunderbolt 5 的机型M4 Pro Mac Mini、M4 Max MacBook Pro、M4 Max 和 M3 Ultra Mac Studio 等。每台参与 RDMA 的 Mac 都要执行一次以下操作关机长按电源键 10 秒直到出现启动菜单选择选项进入恢复模式从实用工具菜单打开终端执行下面这条命令并回车重启 Mac。rdma_ctl enable之后 exo 会自动接管 RDMA 链路。但有三个坑必须避开集群内每台设备必须直连其余所有设备全互联不要依赖交换机中转线缆必须是支持 TB5 的Mac Studio 上以太网口旁边的那个 TB5 口不能用所有设备的 macOS 版本必须完全一致连 beta 版本号都要一样否则 RDMA 端口可能互相发现不了。日常使用仪表盘为主API 为辅打开浏览器访问http://localhost:52415在右侧 INSTANCE 面板点击 LAUNCH INSTANCE选模型、选分片策略Pipeline 或 Tensor、选通信方式MLX Ring 或 MLX RDMA、设最小节点数即可启动。中间拓扑视图会实时刷新各节点状态。仪表盘展示的是 4 台 512GB M3 Ultra Mac Studio 集群同时承载 DeepSeek v3.18-bit与 Kimi-K2-Thinking4-bit聊天、拓扑、实例管理三合一。习惯命令行的话管理动作同样可以走 API。最典型的用法是发一条 OpenAI 兼容的聊天请求curl -N -X POST http://localhost:52415/v1/chat/completions \ -H Content-Type: application/json \ -d {model: mlx-community/Llama-3.2-1B-Instruct-4bit, messages: [{role: user, content: What is AI?}], stream: true}创建实例、等待实例就绪、删除实例、从 HuggingFace 加载自定义模型等其余端点都写在 docs/api.md 里。另外 Claude Messages、OpenAI Responses、Ollama 三种 API 也原生兼容现有客户端基本可以直接指向 exo 使用。调优与避坑几个值得问的问题Q张量并行和管道并行怎么选A计算密集型场景推荐张量并行把权重均匀切到多台设备同时计算这就是 2 机 1.8 倍、4 机 3.2 倍加速的来源内存放不下的场景用管道并行把模型层分布到不同设备。拿不准时可以先用/instance/previews端点列出该模型在当前集群的所有合法拆法。Q模型太大想放外部高速存储A用环境变量指过去即可EXO_MODELS_DIRS/Volumes/ExternalSSD/exo-models uv run exoQ不同规格的设备能混着用吗A可以。拓扑感知自动并行会按每台设备的实际资源和链路状况分配任务不要求机器同构。Q同一网络有多套 exo节点互相串了A设置EXO_LIBP2P_NAMESPACE环境变量给集群指定独立命名空间实现隔离。QLinux 上性能如何A目前 Linux 走 CPUGPU 加速在开发中现阶段更适合在 macOS 上玩。写在最后建议你从手头现有的两台 Mac 起步装好、跑起来先跑一个小模型熟悉流程跑通后再扩到 4 节点用仓库自带的bench/exo_bench.py测一测大模型在张量并行下的实际吞吐。RDMA 一旦启用速度的差别会比任何图表都直观。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表