RabbitMQ 自建生产集群
本目录用于在客户自己的 Kubernetes 集群中部署 RabbitMQ,不依赖云厂商消息队列服务。模板使用 RabbitMQ 官方 Cluster Operator 管理三节点集群。
该组件独立于 EasyAI 主应用的 production overlay,需先部署 RabbitMQ,再把 Operator 生成的连接凭据写入 EasyAI 配置。
架构
- 3 个 RabbitMQ 节点,分别调度到不同 Worker 节点;
- 每个 RabbitMQ Pod 使用独立的 RWO PVC;
- 优先跨可用区调度;
- 客户端通过
easyai-rabbitmq.easyai.svc.cluster.local:5672访问; - 新建的普通持久化业务队列默认使用 quorum queue;
- Operator 负责 StatefulSet、内部 Service、节点发现和滚动更新,模板额外提供
maxUnavailable: 1的 PodDisruptionBudget。
前提条件
- Kubernetes 集群至少有 3 个可调度 Worker 节点;
- 已有支持动态创建 RWO PVC 的 StorageClass;
- 已安装与客户 Kubernetes 版本兼容的 RabbitMQ Cluster Operator;
- 节点可以拉取
rabbitmq:4.3.2-management,或已将该镜像同步到客户私有仓库。
安装 Operator 前请先核对官方兼容要求:
https://www.rabbitmq.com/kubernetes/operator/install-operator
联网环境可按官方方式安装:
kubectl apply -f https://github.com/rabbitmq/cluster-operator/releases/latest/download/cluster-operator.yml
kubectl -n rabbitmq-system rollout status deploy/rabbitmq-cluster-operator --timeout=10m
生产环境建议下载并审计 Operator YAML,将其中镜像同步到客户私有仓库后再安装,避免部署时依赖公网和浮动版本。
修改模板
编辑 rabbitmq-cluster.yaml:
- 将
CHANGE_ME_RABBITMQ_STORAGE_CLASS替换为客户的 RWO StorageClass; - 根据消息量调整每个节点的
storage、CPU 和内存; - 无法访问 Docker Hub 时,将
image替换为客户私有仓库中的同版本镜像; - 如果 Worker 节点不足 3 个,先扩容节点,不要删除主机级反亲和规则后直接用于生产。
检查占位符并渲染:
grep -R -n 'CHANGE_ME' k8s/addons/rabbitmq-cluster
kubectl kustomize k8s/addons/rabbitmq-cluster > /tmp/easyai-rabbitmq.yaml
部署
先创建 EasyAI namespace,再部署 RabbitMQ:
kubectl apply -f k8s/overlays/production/namespace.yaml
kubectl apply -k k8s/addons/rabbitmq-cluster
等待集群就绪:
kubectl -n easyai wait rabbitmqcluster/easyai-rabbitmq \
--for=condition=AllReplicasReady \
--timeout=15m
kubectl -n easyai get rabbitmqcluster easyai-rabbitmq
kubectl -n easyai get pod,svc,pvc,pdb \
-l app.kubernetes.io/name=easyai-rabbitmq
配置 EasyAI
Operator 会生成 easyai-rabbitmq-default-user Secret。初次连通性验证时可读取该 Secret 中的用户名和密码:
kubectl -n easyai get secret easyai-rabbitmq-default-user \
-o jsonpath='{.data.username}' | base64 --decode
echo
kubectl -n easyai get secret easyai-rabbitmq-default-user \
-o jsonpath='{.data.password}' | base64 --decode
echo
将读取到的值写入 k8s/overlays/production/app-secret.yaml:
CONFIG_MQ_USER: Operator生成的用户名
CONFIG_MQ_PASSWORD: Operator生成的密码
Operator 生成的是集群默认管理用户。正式生产环境建议使用该用户完成初始化后,另行创建仅供 EasyAI 使用的应用用户,并只授予目标 vhost 的 configure/write/read 权限;随后将 CONFIG_MQ_USER 和 CONFIG_MQ_PASSWORD 替换为应用用户凭据。不要在多个系统之间共用默认管理用户。
修改 k8s/overlays/production/app-config.yaml:
CONFIG_MQ_PROTOCOL: amqp
CONFIG_MQ_HOST: easyai-rabbitmq.easyai.svc.cluster.local
CONFIG_MQ_PORT: "5672"
CONFIG_MQ_VHOST: /
然后按仓库根目录 README 部署 EasyAI 主应用。
验证
kubectl -n easyai exec easyai-rabbitmq-server-0 -- rabbitmq-diagnostics -q ping
kubectl -n easyai exec easyai-rabbitmq-server-0 -- rabbitmqctl cluster_status
kubectl -n easyai exec easyai-rabbitmq-server-0 -- rabbitmqctl list_queues name type durable messages consumers
预期 cluster_status 中有 3 个运行节点,EasyAI 启动后业务持久化队列的 type 为 quorum。
运维注意事项
- 不要直接修改 Operator 生成的 StatefulSet;通过
RabbitmqCluster资源修改集群。 - 不要同时重启两个 RabbitMQ 节点;维护前确认 quorum 状态正常。
- 模板保留 Operator 的默认终止宽限期,使 preStop 能在节点退出前检查 quorum 安全状态;不要为了加快删除而随意缩短。
- PVC 只解决节点重建时的数据持久化,不等同于备份。应定期导出 definitions,并结合存储快照制定恢复方案。
- 升级 RabbitMQ 或 Operator 前,先在测试环境验证队列声明、发布消费、断线重连和节点故障切换。
- 若要启用 AMQPS,应按客户证书体系配置
spec.tls,并将 EasyAI 的协议和端口调整为amqps/5671。