跳转至

Runbooks (运维手册)

生产环境事故手册 — On-call 响应、Release 流程、灾难恢复、Chaos Game Day。

📚 文档清单

占位章节

历史 summary 中提到的 4 个 runbook 文件(oncall / release / disaster-recovery / game-day) 在仓库 infra/runbooks/ 目录下实际不存在。本节仅作为目录占位。

如需补充这些 runbook,请单独执行补写任务。可用的信息源: - 项目内已有的 Runbook 索引(参考 runbooks/RUNBOOK-INDEX.md) - 商业化路线图中的 SLO 定义 - Terraform multi_region 模块下的 dr_runbook.md

当前可参考: - 多区域容灾:ops/dr-multi-region.md

🚨 告警分级建议

级别 响应时间 升级路径 例子
P0 5 分钟 oncall → TL → CTO 全站 500 / 数据丢失
P1 30 分钟 oncall → TL 单服务 Degraded / Stripe webhook 失败
P2 4 小时 oncall 性能下降 / 部分功能异常
P3 24 小时 下一个工作日 UI bug / 非关键告警

🛡️ 核心 Runbook 场景(规划)

  • 🟢 ArgoCD Application Degraded → 自动 rollback 到上一个 healthy
  • 🟢 API 5xx 飙升 → 检查 Image Updater / 后端日志 / 限流
  • 🟢 数据库主备切换 → 检查 failover / RPO / 应用重连
  • 🟢 密钥泄露 → 立即轮换 + Vault 重新注入
  • 🟢 DDoS 攻击 → CloudFlare 防护 + Argo Rollouts 限流
  • 🟢 Region 不可用 → DNS 切到备用 region (RTO < 5min)

📊 SLO 指标(参考)

SLO 目标
可用性 99.9% (43.2 min/月)
API P99 < 500ms
错误率 < 0.1%
RTO < 1h
RPO < 15min

🔗 相关文档