1.
- 停机按3定义为:香港电话服务器或SIP中继出现全面性中断,导致外呼/呼入及IVR全部不可用。
- 影响范围:影响全站电话服务或大于50%的并发呼叫能力。
- 业务影响:呼叫中心、客服热线、交易确认等核心业务暂停,造成明显财务与信誉损失。
- 目标恢复时间(RTO):优先级最高,目标RTO ≤ 1小时(可调整为30分钟视合同而定)。
- 数据一致性目标(RPO):RPO = 0(不能丢失通话记录与计费数据),必要时启用实时同步或复制。
2.
- 值班负责人(1人):接收报警并宣告“停机按3”,负责对外沟通与决策。
- 网络与运维(2人):负责网络链路、交换机、路由器和BGP多线检测与切换。
- 电话系统工程师(2人):负责SIP服务器、Asterisk/PBX、SIP Trunk对接与重启/切换。
- 安全团队(1人):评估是否为DDoS/攻击导致,触发清洗/拦截策略。
- 客服与公关(1人):准备告知客户的公告模板与外部沟通渠道。
- 每个角色需在接报后5分钟内响应并完成首次状态回报。
3.
- 自动告警:监控平台(Zabbix/Prometheus)触发Alert并推送至值班群与电话。
- 首次确认:值班人员在3分钟内确认是否为全面不可用(全VPS/主机丢失心跳或SIP 503/CONN REFUSED)。
- 初步定位:检查BGP路由、上游带宽、机房网络交换与VPS宿主机状态。
- 是否为攻击:安全团队快速检查流量峰值(流量阈值 > 1Gbps 且 SYN/UDP 爆发),若是则判定为DDoS。
- 触发升级:确认为停机按3后,启动备用机房、备份SIP Trunk与DNS切换流程。
4.
- 主用服务器示例:物理机(香港本地)CPU 8核,内存32GB,SSD 1TB,网络1Gbps BGP;操作系统:Ubuntu 20.04;虚拟化:KVM。
- 备用资源示例:异地冷备(新加坡)VPS 4核/16GB/500GB SSD,带宽500Mbps;实现Keepalived+VRRP浮动IP切换。
- 电话系统:Asterisk 16 + Kamailio 前端负载;数据库:MariaDB 主从同步;通话录音存储使用对象存储(S3兼容)异地备份。
- SIP中继冗余:至少2家不同上游运营商(优先BGP直连),通过优先级和心跳回退实现不中断切换。
- 自动切换:使用Keepalived监控SIP心跳(SIP OPTIONS)并在节点异常时触发VRRP切换,DNS采用低TTL(60s)并结合公网Anycast/智能DNS。
5.
- 并发呼叫计算依据:G.711(64kbps)+ RTP/UDP/UDP头、IP头等开销,实际每路约100kbps-120kbps。
- 目标并发:示例目标并发呼叫2000路,估算峰值带宽需求。
- 保留余量:建议保留30%余量用于控制信令/峰值抖动及录音上行。
- 下表为并发与需要带宽的示例计算(含30%冗余)。
| 并发呼叫(路) | 单路估算带宽(kbps) | 原始带宽需求(Mbps) | 含30%冗余(Mbps) |
|---|---|---|---|
| 500 | 100 | 50.0 | 65.0 |
| 1,000 | 100 | 100.0 | 130.0 |
| 2,000 | 100 | 200.0 | 260.0 |
6.
- 短期应对:一旦判定为DDoS,立即启用上游清洗/黑洞或承载商的Anti-DDoS服务,同时将攻击流量导流至清洗中心。
- 利用CDN与Anycast:对Web/门户使用Anycast CDN(如Cloudflare或国内同类),降低控制台或登录页被淹没风险。
- SIP安全:启用SIP ACL、SIP TLS和强验证,限制信令来源IP白名单并开启SIP OPTIONS频率限制。
- 流量告警阈值:设置阈值(例如流量>500Mbps或SYN包>100k/s)自动触发安全策略。
- 恢复后审计:记录攻击特征并与承运商协作更新防护规则,保证未来同类攻击能被快速识别。
7.
- 恢复步骤示例:1) 确定故障类型;2) 切换到备用机房/浮动IP;3) 切换到备份SIP Trunk;4) 验证基础呼叫与计费正常;5) 通知客户并关闭应急状态。
- 验证点:SIP REGISTER成功率>99%、100个并发呼叫无掉线、录音文件完整性校验。
- 演练频率:建议季度演练一次,包括DNS低TTL切换、VRRP漂移与SIP断链切换。
- 真实案例:某香港金融客户(示例)在一次顶级DDoS中遭遇电话中断,启动按3流程后:使用第二机房(新加坡)在38分钟内完成Keepalived浮动IP切换并接入第二运营商,RTO目标达成,后续将并发扩容至2,000路并签署99.95% SLA。
- 文档与复盘:每次按3事件必须在72小时内完成事件报告、根因分析与改进计划,列出资源升级项与供货商考核评分。
8.
- 内部通知:首次通报需包含事件级别(3级)、估计影响、初步RTO与负责人联系方式。
- 客户公告模板:简洁说明影响范围、恢复进度与补救措施(例如提供临时免费呼叫额度)。
- SLA建议条款:明确RTO、可用率目标(建议99.95%)、赔偿计算方法与例外条款(如大规模DDoS需证明)。
- 第三方沟通:与上游运营商、清洗厂商、云服务商建立24/7联动清单与应急联系电话。
- 合同与演练要求:在供应商合同内写入演练频次与罚则,确保在按3事件时能优先响应。
9.
- 立即行动:为电话系统部署至少两地冗余、双运营商SIP中继、低TTL DNS与Keepalived浮动IP。
- 定期演练:每季度开展按3级停机演练,校验RTO与RPO。
- 技术优化:使用Kamailio做前端负载,Asterisk后端处理媒体,数据库主从+异地备份,录音S3异地存储。
- 安全投入:签订Anti-DDoS服务,配置流量告警与自动导流到清洗。
- 文档化:建立一页纸应急卡片(包含步骤、联系人、备用IP和登录凭证)以便快速执行。