Принципы
- Определите «стационарное состояние» — нормальное поведение системы (RPS, latency, error rate)
- Сформулируйте гипотезу: «если убить один Pod — система продолжит работу»
- Введите сбой в контролируемых условиях (начинайте со staging)
- Сравните реальное состояние с гипотезой
Типичные эксперименты
- Отключить один из микросервисов
- Увеличить latency к внешнему API на 2 секунды
- Симулировать полный сбой БД
- Заполнить диск на 95%
Инструменты
Chaos Monkey (Netflix), LitmusChaos (Kubernetes), Gremlin, AWS Fault Injection Simulator.