回答:首先评估业务对可用性的目标(SLA、RTO/RPO),并基于此进行容量与冗余分级。物理层面要保证电力冗余(UPS + 发电机,推荐N+1或2N)、制冷与机架布局、以及合规与安防(例如符合新加坡相关法规与PDPA数据保护要求)。位置选择应考虑地理分散度与运营便捷性:选择不同机房机架或不同机房楼层来避免单点故障。网络上要接入多运营商、多出口链路并启用BGP或SD-WAN以实现链路冗余。最后在设计阶段就要确定故障域(fault domain)与blast radius,采用分层架构把关键组件分散到不同故障域。
回答:物理上采取多路径供电(双路供电、双电表)、独立UPS与自动切换发电机,并对关键设备采用热备份(双路网卡、双PDU)。网络层面采用至少两家电信运营商的光纤接入,启用BGP多宿主策略或部署SDN/SD-WAN实现智能路由切换。机房内部采用冗余交换机、分层交换架构(接入-汇聚-核心),并做链路聚合与LACP配置。对外使用全局负载均衡(GLB)或DNS负载分配结合健康检查,保证链路或机房故障时能快速流量切换,降低RTO。
回答:推荐采用微服务与无状态服务优先策略,配合会话粘滞或外部会话存储(Redis、Memcached)。应用层可采用Active-Active或Active-Passive部署,Active-Active结合全局负载均衡提升利用率与可用性;数据库层根据业务选择同步复制(提高一致性)或异步复制(降低延迟),常见方案有主从复制、组复制(Galera、MySQL Group Replication)、基于Raft的分布式KV(etcd、Consul)或分布式数据库(Cockroach、TiDB)。存储层使用分布式存储(Ceph、Gluster)并开启副本策略或跨机房复制。重要是设计无单点(SPOF),实现服务发现与自动故障转移(keepalived、HAProxy、Kubernetes + operator)。
回答:首先定义业务分级,确定哪些服务必须做到RTO几秒级、RPO秒级,哪些可以接受分钟到小时级。关键数据采用地理冗余复制:同步复制用于强一致性但会影响延迟,仅用于关键小量数据;大容量或非强一致数据采用异步复制并定期校验。实施多活策略时注意冲突解决与全局唯一ID方案(UUID、雪花算法)。容灾演练要覆盖数据恢复(恢复点验证)、DNS切换、证书与秘钥管理、以及回滚路径。建议建立分区化恢复计划(冷备、温备、热备),并把自动化Runbook与脚本纳入CI/CD管道。
回答:构建覆盖基础设施、网络、应用与业务指标的统一监控平台(Prometheus + Grafana、ELK/EFK),对关键指标设置分级告警并接入On-call系统。实现自动化健康检查与自愈(重启、迁移、缩放),并把故障检测与故障转移逻辑纳入编排层(Kubernetes + HPA/PodDisruptionBudget)。定期进行容量预测、压力测试与混沌工程(Chaos Monkey、GREMLIN)验证系统弹性。每次演练后要做事后复盘(Postmortem),更新SOP与Runbook,确保运维团队熟悉故障处理流程与跨机房协调机制。