Три стовпи observability
- Metrics — числові показники за час: RPS, latency p99, error rate, CPU. Prometheus + Grafana — стандарт
- Logs — структуровані записи подій. Централізований збір: ELK Stack (Elasticsearch, Logstash, Kibana), Loki
- Traces — відстеження шляху запиту через кілька сервісів. Jaeger, Zipkin, OpenTelemetry
Золоті сигнали (Google SRE)
Latency, Traffic, Errors, Saturation — чотири метрики, що описують здоров'я будь-якого сервісу. Алертинг на них покриє 80% інцидентів.