服务治理¶
服务治理是分布式系统工程实践的核心,目标是保障服务在复杂环境下的高可用、可观测和可演进。本章从以下两个维度展开:
稳定性 — 确保系统在故障、流量突增等异常场景下仍能提供可接受的服务:
- 服务降级、熔断、限流
- 超时与重试策略
- 负载均衡与故障隔离
- 灰度发布与变更管控
- 异地多活与容灾设计
可观测性 — 从系统的外部输出推断其内部状态,快速定位和解决问题:
- 日志采集与结构化分析
- Metrics 指标监控(Prometheus / Grafana)
- Trace 分布式链路追踪(OpenTelemetry)
- 告警体系与 On-Call 机制