Runbooks (运维手册)¶
生产环境事故手册 — On-call 响应、Release 流程、灾难恢复、Chaos Game Day。
📚 文档清单¶
占位章节
历史 summary 中提到的 4 个 runbook 文件(oncall / release / disaster-recovery / game-day)
在仓库 infra/runbooks/ 目录下实际不存在。本节仅作为目录占位。
如需补充这些 runbook,请单独执行补写任务。可用的信息源:
- 项目内已有的 Runbook 索引(参考 runbooks/RUNBOOK-INDEX.md)
- 商业化路线图中的 SLO 定义
- Terraform multi_region 模块下的 dr_runbook.md
当前可参考: - 多区域容灾:ops/dr-multi-region.md
🚨 告警分级建议¶
| 级别 | 响应时间 | 升级路径 | 例子 |
|---|---|---|---|
| P0 | 5 分钟 | oncall → TL → CTO | 全站 500 / 数据丢失 |
| P1 | 30 分钟 | oncall → TL | 单服务 Degraded / Stripe webhook 失败 |
| P2 | 4 小时 | oncall | 性能下降 / 部分功能异常 |
| P3 | 24 小时 | 下一个工作日 | UI bug / 非关键告警 |
🛡️ 核心 Runbook 场景(规划)¶
- 🟢 ArgoCD Application Degraded → 自动 rollback 到上一个 healthy
- 🟢 API 5xx 飙升 → 检查 Image Updater / 后端日志 / 限流
- 🟢 数据库主备切换 → 检查 failover / RPO / 应用重连
- 🟢 密钥泄露 → 立即轮换 + Vault 重新注入
- 🟢 DDoS 攻击 → CloudFlare 防护 + Argo Rollouts 限流
- 🟢 Region 不可用 → DNS 切到备用 region (RTO < 5min)
📊 SLO 指标(参考)¶
| SLO | 目标 |
|---|---|
| 可用性 | 99.9% (43.2 min/月) |
| API P99 | < 500ms |
| 错误率 | < 0.1% |
| RTO | < 1h |
| RPO | < 15min |