Docker Swarm集群搭建与优化实战指南
1. Docker Swarm 集群初始化完全指南上周在部署微服务架构时我再次体会到 Docker Swarm 的便捷性。相比 Kubernetes 的复杂配置Swarm 模式只需几条命令就能建立生产级容器集群。本文将分享从零搭建 Swarm 集群的完整流程包含我在实际运维中积累的 7 个关键配置技巧。2. 集群规划与节点准备2.1 硬件资源配置建议根据生产环境经验建议采用奇数个管理节点3/5/7以确保 raft 共识算法的高可用性。以下是我的节点配置模板节点类型CPU内存磁盘网络要求Manager2核4GB50GB SSD稳定低延迟互联Worker4核8GB100GB SSD≥1Gbps 带宽关键提示Manager 节点务必分散在不同物理机或可用区避免单点故障导致集群脑裂。2.2 系统环境配置所有节点需统一环境# 关闭 SELinux生产环境需评估安全策略 sudo setenforce 0 sudo sed -i s/^SELINUXenforcing/SELINUXpermissive/ /etc/selinux/config # 防火墙放行必要端口 sudo firewall-cmd --permanent --add-port2377/tcp # 集群管理 sudo firewall-cmd --permanent --add-port7946/tcp # 节点通信 sudo firewall-cmd --permanent --add-port4789/udp # overlay网络 sudo firewall-cmd --reload3. Swarm 集群初始化实战3.1 主管理节点初始化在第一台 Manager 节点执行docker swarm init --advertise-addr MANAGER_IP \ --default-addr-pool 10.10.0.0/16 \ --listen-addr MANAGER_IP:2377参数解析--advertise-addr其他节点连接用的广播地址--default-addr-pool自定义 overlay 网络 IP 池避免与现有网络冲突--listen-addr指定监听端口默认2377成功后会输出 worker 和 manager 的加入命令类似Swarm initialized: current node (d3n0...) is now a manager. To add a worker to this swarm, run: docker swarm join --token SWMTKN-1-xxx MANAGER_IP:2377 To add a manager to this swarm, run: docker swarm join --token SWMTKN-1-yyy MANAGER_IP:23773.2 加入额外管理节点在其他 Manager 节点执行# 获取管理节点token MANAGER_TOKEN$(docker swarm join-token -q manager) # 加入集群 docker swarm join --token $MANAGER_TOKEN PRIMARY_MANAGER_IP:2377 \ --advertise-addr CURRENT_NODE_IP验证集群状态docker node ls正常应显示所有节点状态为 ReadyLeader 节点会有*标记。4. 集群网络优化配置4.1 创建自定义 overlay 网络默认的 ingress 网络可能不满足生产需求建议创建独立网络docker network create -d overlay \ --subnet10.20.0.0/16 \ --gateway10.20.0.1 \ --opt encryptedtrue \ my_prod_network参数说明--opt encrypted启用节点间通信加密建议为不同业务创建独立网络如 frontend_net、db_net4.2 网络性能调优修改 daemon.json 提升网络性能{ mtu: 1450, icc: false, ipv6: false, experimental: true, default-address-pools: [ {base:10.30.0.0/16,size:24} ] }重启生效sudo systemctl restart docker5. 集群安全加固方案5.1 证书自动轮换Swarm 默认证书有效期为 90 天建议提前配置自动轮换docker swarm update --cert-expiry 720h # 设置为30天查看证书状态docker swarm ca --rotate # 手动立即轮换5.2 敏感数据管理使用 Docker Secret 管理凭证# 创建secret echo db_password | docker secret create mysql_root_password - # 在服务中使用 docker service create \ --name mysql \ --secret mysql_root_password \ -e MYSQL_ROOT_PASSWORD_FILE/run/secrets/mysql_root_password \ mysql:5.76. 常见问题排查指南6.1 节点失联处理当docker node ls显示节点状态为 Down检查节点间网络连通性ping NODE_IP telnet NODE_IP 2377重启 Docker 服务sudo systemctl restart docker强制移除故障节点在管理节点执行docker node rm --force NODE_ID6.2 服务部署失败典型错误no suitable node 可能原因节点资源不足检查docker node inspect self约束条件不满足如--constraint node.roleworker端口冲突使用docker service inspect --pretty SERVICE查看7. 生产环境最佳实践标签策略为节点打业务标签docker node update --label-add zoneeast NODE_ID部署时指定约束docker service create --constraint node.labels.zoneeast ...监控方案部署 cAdvisor Prometheusdocker service create --mode global --name cadvisor \ --mount typebind,source/,target/rootfs,readonly \ --mount typebind,source/var/run,target/var/run \ --mount typebind,source/sys,target/sys,readonly \ google/cadvisor:latest日志收集统一 ELK 处理docker service create --name logspout \ --mode global \ --mount typebind,source/var/run/docker.sock,target/var/run/docker.sock \ gliderlabs/logspout \ syslogtls://logs.example.com:5148. 集群维护操作备忘8.1 版本升级步骤排空节点先 worker 后 managerdocker node update --availability drain NODE_ID升级 Docker 版本后重启sudo yum update docker-ce sudo systemctl restart docker重新激活节点docker node update --availability active NODE_ID8.2 备份恢复方案备份 raft 数据在管理节点执行sudo tar -czvf swarm_backup_$(date %s).tar.gz \ /var/lib/docker/swarm/恢复时停止 Docker 服务后替换目录即可。