# RabbitMQ 自建生产集群 本目录用于在客户自己的 Kubernetes 集群中部署 RabbitMQ,不依赖云厂商消息队列服务。模板使用 RabbitMQ 官方 Cluster Operator 管理三节点集群。 该组件独立于 EasyAI 主应用的 production overlay,需先部署 RabbitMQ,再把 Operator 生成的连接凭据写入 EasyAI 配置。 ## 架构 - 3 个 RabbitMQ 节点,分别调度到不同 Worker 节点; - 每个 RabbitMQ Pod 使用独立的 RWO PVC; - 优先跨可用区调度; - 客户端通过 `easyai-rabbitmq.easyai.svc.cluster.local:5672` 访问; - 新建的普通持久化业务队列默认使用 quorum queue; - Operator 负责 StatefulSet、内部 Service、节点发现和滚动更新,模板额外提供 `maxUnavailable: 1` 的 PodDisruptionBudget。 ## 前提条件 - Kubernetes 集群至少有 3 个可调度 Worker 节点; - 已有支持动态创建 RWO PVC 的 StorageClass; - 已安装与客户 Kubernetes 版本兼容的 RabbitMQ Cluster Operator; - 节点可以拉取 `rabbitmq:4.3.2-management`,或已将该镜像同步到客户私有仓库。 安装 Operator 前请先核对官方兼容要求: 联网环境可按官方方式安装: ```bash kubectl apply -f https://github.com/rabbitmq/cluster-operator/releases/latest/download/cluster-operator.yml kubectl -n rabbitmq-system rollout status deploy/rabbitmq-cluster-operator --timeout=10m ``` 生产环境建议下载并审计 Operator YAML,将其中镜像同步到客户私有仓库后再安装,避免部署时依赖公网和浮动版本。 ## 修改模板 编辑 `rabbitmq-cluster.yaml`: 1. 将 `CHANGE_ME_RABBITMQ_STORAGE_CLASS` 替换为客户的 RWO StorageClass; 2. 根据消息量调整每个节点的 `storage`、CPU 和内存; 3. 无法访问 Docker Hub 时,将 `image` 替换为客户私有仓库中的同版本镜像; 4. 如果 Worker 节点不足 3 个,先扩容节点,不要删除主机级反亲和规则后直接用于生产。 检查占位符并渲染: ```bash grep -R -n 'CHANGE_ME' k8s/addons/rabbitmq-cluster kubectl kustomize k8s/addons/rabbitmq-cluster > /tmp/easyai-rabbitmq.yaml ``` ## 部署 先创建 EasyAI namespace,再部署 RabbitMQ: ```bash kubectl apply -f k8s/overlays/production/namespace.yaml kubectl apply -k k8s/addons/rabbitmq-cluster ``` 等待集群就绪: ```bash kubectl -n easyai wait rabbitmqcluster/easyai-rabbitmq \ --for=condition=AllReplicasReady \ --timeout=15m kubectl -n easyai get rabbitmqcluster easyai-rabbitmq kubectl -n easyai get pod,svc,pvc,pdb \ -l app.kubernetes.io/name=easyai-rabbitmq ``` ## 配置 EasyAI Operator 会生成 `easyai-rabbitmq-default-user` Secret。初次连通性验证时可读取该 Secret 中的用户名和密码: ```bash kubectl -n easyai get secret easyai-rabbitmq-default-user \ -o jsonpath='{.data.username}' | base64 --decode echo kubectl -n easyai get secret easyai-rabbitmq-default-user \ -o jsonpath='{.data.password}' | base64 --decode echo ``` 将读取到的值写入 `k8s/overlays/production/app-secret.yaml`: ```yaml CONFIG_MQ_USER: Operator生成的用户名 CONFIG_MQ_PASSWORD: Operator生成的密码 ``` Operator 生成的是集群默认管理用户。正式生产环境建议使用该用户完成初始化后,另行创建仅供 EasyAI 使用的应用用户,并只授予目标 vhost 的 configure/write/read 权限;随后将 `CONFIG_MQ_USER` 和 `CONFIG_MQ_PASSWORD` 替换为应用用户凭据。不要在多个系统之间共用默认管理用户。 修改 `k8s/overlays/production/app-config.yaml`: ```yaml CONFIG_MQ_PROTOCOL: amqp CONFIG_MQ_HOST: easyai-rabbitmq.easyai.svc.cluster.local CONFIG_MQ_PORT: "5672" CONFIG_MQ_VHOST: / ``` 然后按仓库根目录 README 部署 EasyAI 主应用。 ## 验证 ```bash kubectl -n easyai exec easyai-rabbitmq-server-0 -- rabbitmq-diagnostics -q ping kubectl -n easyai exec easyai-rabbitmq-server-0 -- rabbitmqctl cluster_status kubectl -n easyai exec easyai-rabbitmq-server-0 -- rabbitmqctl list_queues name type durable messages consumers ``` 预期 `cluster_status` 中有 3 个运行节点,EasyAI 启动后业务持久化队列的 `type` 为 `quorum`。 ## 运维注意事项 - 不要直接修改 Operator 生成的 StatefulSet;通过 `RabbitmqCluster` 资源修改集群。 - 不要同时重启两个 RabbitMQ 节点;维护前确认 quorum 状态正常。 - 模板保留 Operator 的默认终止宽限期,使 preStop 能在节点退出前检查 quorum 安全状态;不要为了加快删除而随意缩短。 - PVC 只解决节点重建时的数据持久化,不等同于备份。应定期导出 definitions,并结合存储快照制定恢复方案。 - 升级 RabbitMQ 或 Operator 前,先在测试环境验证队列声明、发布消费、断线重连和节点故障切换。 - 若要启用 AMQPS,应按客户证书体系配置 `spec.tls`,并将 EasyAI 的协议和端口调整为 `amqps`/`5671`。