| 原则 | 说明 |
|---|
| 谁开发谁运维 | 开发者对自己代码负责 |
| 轮值公平 | 轮值分配均衡 |
| 明确升级 | 有清晰的升级路径 |
| 事后复盘 | 每次事故都要复盘 |
| 模式 | 说明 | 适用场景 |
|---|
| 主备轮值 | 主值班+备值班 | 标准模式 |
| 跟随太阳 | 按时区轮值 | 全球团队 |
| 专项轮值 | 按领域分组 | 大型团队 |
| 弹性轮值 | 按需安排 | 小团队 |
| 装备 | 说明 |
|---|
| 告警渠道 | PagerDuty、Opsgenie |
| VPN | 远程访问生产环境 |
| Runbook | 标准操作手册 |
| 通讯工具 | 企业IM、电话 |
| 监控面板 | Grafana、Datadog |
| 级别 | 响应时间 | 说明 |
|---|
| P0 紧急 | 5分钟 | 服务完全不可用 |
| P1 高 | 15分钟 | 核心功能受损 |
| P2 中 | 1小时 | 非核心功能异常 |
| P3 低 | 4小时 | 性能轻微下降 |
| P4 信息 | 下个工作日 | 信息通知 |
| 指标 | 目标 | 说明 |
|---|
| 告警准确率 | >90% | 告警对应真实问题 |
| 告警疲劳率 | <5% | 无效告警占比 |
| 平均响应时间 | <15min | 从告警到开始处理 |
| 平均修复时间 | <1h | 从告警到问题解决 |
| 策略 | 说明 |
|---|
| 告警收敛 | 合并相关告警 |
| 动态阈值 | 基于历史数据调整 |
| 分级路由 | 不同级别走不同渠道 |
| 静默规则 | 维护期间静默 |
| 定期审查 | 季度审查告警有效性 |
1. 确认告警: 验证告警真实性
2. 评估影响: 确定影响范围和严重程度
3. 通知相关方: 通知利益相关者
4. 止血: 优先恢复服务
5. 根因分析: 找到根本原因
6. 修复: 实施修复方案
7. 验证: 确认问题已解决
8. 复盘: 总结经验教训
| 策略 | 说明 |
|---|
| 回滚 | 回退到上一个稳定版本 |
| 降级 | 关闭非核心功能 |
| 限流 | 限制请求量 |
| 扩容 | 增加服务实例 |
| 熔断 | 切断故障链路 |
| 切换 | 切换到备用系统 |
# [告警名称] 应急手册
## 告警信息
- 告警名称:
- 严重级别:
- 触发条件:
## 影响评估
- 影响范围:
- 业务影响:
## 快速止血
1. [步骤1]
2. [步骤2]
## 详细排查
1. 检查[指标A]:
2. 检查[日志B]:
## 修复方案
1. [方案1]
2. [方案2]
## 升级路径
- L1: 值班工程师
- L2: 团队负责人
- L3: 架构师
| 建议 | 说明 |
|---|
| 轮值间隔 | 至少隔一周 |
| 补偿机制 | On-Call补贴或调休 |
| 心理关怀 | 关注On-Call压力 |
| 持续改进 | 减少无效告警 |
正在生成题目...
AI 服务暂不可用,显示文档预设题目