Глосарій

SLI, SLO, SLA

Три концепти з практики SRE (Site Reliability Engineering) для вимірювання і узгодження надійності сервісу між командами та клієнтами.

SLI — Service Level Indicator

Числова метрика, що описує стан сервісу. Приклади: відсоток успішних запитів, latency p99, uptime. «Що вимірюємо»

SLO — Service Level Objective

Внутрішня ціль для SLI. «Яку планку ставимо собі». Приклад: 99.9% запитів виконуються за < 500 мс. SLO суворіший за SLA — «буфер» для команди.

SLA — Service Level Agreement

Юридичний договір з клієнтом. «Що обіцяємо назовні». Порушення SLA — фінансові санкції. Тому SLA завжди м'якший за SLO.

Error Budget

SLO 99.9% = 0.1% дозволених помилок на місяць ≈ 43 хвилини downtime. Error budget показує, скільки «балансу надійності» залишилось. Якщо бюджет вичерпано — зупиняємо нові деплої.