Глоссарий

SLI, SLO, SLA

Три концепта из практики SRE (Site Reliability Engineering) для измерения и согласования надёжности сервиса между командами и клиентами.

SLI — Service Level Indicator

Числовая метрика, описывающая состояние сервиса. Примеры: процент успешных запросов, latency p99, uptime. «Что измеряем»

SLO — Service Level Objective

Внутренняя цель для SLI. «Какую планку ставим себе». Пример: 99.9% запросов выполняются за < 500 мс. SLO строже SLA — «буфер» для команды.

SLA — Service Level Agreement

Юридический договор с клиентом. «Что обещаем вовне». Нарушение SLA — финансовые санкции. Поэтому SLA всегда мягче SLO.

Error Budget

SLO 99.9% = 0.1% допустимых ошибок в месяц ≈ 43 минуты downtime. Error budget показывает, сколько «баланса надёжности» осталось. Если бюджет исчерпан — останавливаем новые деплои.