wangbo
|
3aa78d3e5c
|
perf(worker): 按实例内存上限扩展异步容量
将策略推导出的集群目标与单 Worker 内存安全上限分离,避免失活实例的全部容量转移到单个 2 GiB Pod。
生产环境单实例上限和媒体物化并发设为 24;两实例正常时总容量由 16 提升至 48,后续可通过增加 Worker 节点继续扩展。新增 0093 迁移保存实例容量上限,并兼容滚动发布中的旧实例。
风险:更高媒体并发会增加 Worker 和节点内存压力,保留单实例 24 的硬边界并由持续监控观察 RSS、OOM、队列与节点余量。
验证:go test ./... -count=1;go vet ./...;真实 PostgreSQL 分配与故障转移测试;迁移安全检查;kubectl kustomize;gofmt -l;git diff --check。
|
2026-07-30 15:08:54 +08:00 |
|
wangbo
|
d810881901
|
fix(cluster): 修正 server-main 内网端口
生产 easyai-server 实际监听 3001,原 K3s 配置指向 3000 导致内部调用和任务进度回调 connection refused。将 SERVER_MAIN_BASE_URL 与回调地址修正为 WireGuard 内网 3001。\n\n当前 server-main v3.8.3 尚未实现任务进度回调路由,后续仍需 backend 配套并重放回调。验证:两节点访问 3001、kubectl kustomize、服务端 dry-run。
|
2026-07-29 19:12:27 +08:00 |
|
wangbo
|
4371e57212
|
fix(cluster): 进一步收紧媒体 Worker 并发上限
全局 48 槽在持续观察中仍导致宁波 Worker OOM。按实测内存占用将生产全局异步执行上限降至 16,双节点各 8 槽,单节点接管最多 16 槽;高并发请求继续由持久队列吸收。\n\n未开启 queue_size 生产策略。验证:kubectl kustomize、服务端 dry-run。
|
2026-07-29 18:51:26 +08:00 |
|
wangbo
|
ba01cbef53
|
fix(cluster): 限制生产异步 Worker 执行容量
切换后集中恢复积压时,单 Worker 155 槽导致数据库连接池 24/24 饱和并触发香港 Pod OOM。将集群异步执行硬上限暂定为 48,使双 Worker 正常时各分配 24 槽,与每 Pod 连接池上限对齐。\n\n未开启任何 queue_size 生产策略。验证:kubectl kustomize、服务端 dry-run。
|
2026-07-29 17:45:23 +08:00 |
|
wangbo
|
971540a2a4
|
feat(deploy): 增加三节点 K3s 高可用迁移能力
新增 WireGuard 全互联、三 server embedded-etcd K3s、CloudNativePG 双实例、Barman OSS 备份、双 NGINX、Kubernetes Secret/RBAC 与本地旧文件按严格 24 小时清理。
新增维护窗口数据迁移、digest 固定滚动发布、应用回滚、跨节点文件 E2E、节点和数据库故障演练、CNPG 恢复与 etcd 快照验收脚本;洛杉矶仅作为带 NoSchedule 污点的仲裁节点。
所有生产 Secret 只在执行时从 0600 本地环境和旧生产容器导入,仓库不保存凭据;公网入口保持人工 DNS 故障切换边界。
验证:bash -n、ShellCheck、kubectl kustomize、Node 语法检查、Secret 扫描、OSS put/head/delete 实测。
|
2026-07-28 04:37:31 +08:00 |
|