On-Call最佳实践

3 minIntermediate2026/6/14

值班制度、告警管理、轮值策略与On-Call素养。

1. On-Call制度

1.1 On-Call原则

原则说明
谁开发谁运维开发者对自己代码负责
轮值公平轮值分配均衡
明确升级有清晰的升级路径
事后复盘每次事故都要复盘

1.2 轮值模式

模式说明适用场景
主备轮值主值班+备值班标准模式
跟随太阳按时区轮值全球团队
专项轮值按领域分组大型团队
弹性轮值按需安排小团队

1.3 值班装备

装备说明
告警渠道PagerDuty、Opsgenie
VPN远程访问生产环境
Runbook标准操作手册
通讯工具企业IM、电话
监控面板Grafana、Datadog

2. 告警管理

2.1 告警分级

级别响应时间说明
P0 紧急5分钟服务完全不可用
P1 高15分钟核心功能受损
P2 中1小时非核心功能异常
P3 低4小时性能轻微下降
P4 信息下个工作日信息通知

2.2 告警质量

指标目标说明
告警准确率>90%告警对应真实问题
告警疲劳率<5%无效告警占比
平均响应时间<15min从告警到开始处理
平均修复时间<1h从告警到问题解决

2.3 告警优化

策略说明
告警收敛合并相关告警
动态阈值基于历史数据调整
分级路由不同级别走不同渠道
静默规则维护期间静默
定期审查季度审查告警有效性

3. 应急响应

3.1 响应流程

1. 确认告警: 验证告警真实性
2. 评估影响: 确定影响范围和严重程度
3. 通知相关方: 通知利益相关者
4. 止血: 优先恢复服务
5. 根因分析: 找到根本原因
6. 修复: 实施修复方案
7. 验证: 确认问题已解决
8. 复盘: 总结经验教训

3.2 止血策略

策略说明
回滚回退到上一个稳定版本
降级关闭非核心功能
限流限制请求量
扩容增加服务实例
熔断切断故障链路
切换切换到备用系统

4. Runbook编写

4.1 Runbook模板

# [告警名称] 应急手册

## 告警信息

- 告警名称:
- 严重级别:
- 触发条件:

## 影响评估

- 影响范围:
- 业务影响:

## 快速止血

1. [步骤1]
2. [步骤2]

## 详细排查

1. 检查[指标A]:
2. 检查[日志B]:

## 修复方案

1. [方案1]
2. [方案2]

## 升级路径

- L1: 值班工程师
- L2: 团队负责人
- L3: 架构师

5. On-Call健康

建议说明
轮值间隔至少隔一周
补偿机制On-Call补贴或调休
心理关怀关注On-Call压力
持续改进减少无效告警