Принципи
- Визначте "стаціонарний стан" — нормальна поведінка системи (RPS, latency, error rate)
- Сформулюйте гіпотезу: "якщо вбити один Pod — система продовжить роботу"
- Введіть збій у контрольованих умовах (спочатку на staging)
- Порівняйте реальний стан з гіпотезою
Типові експерименти
- Відключити один з мікросервісів
- Збільшити latency до зовнішнього API на 2 секунди
- Симулювати повний збій БД
- Заповнити диск на 95%
Інструменти
Chaos Monkey (Netflix), LitmusChaos (Kubernetes), Gremlin, AWS Fault Injection Simulator.