Собрали в одном месте самые важные ссылкии сделали Тренажер IT-инцидентов для DevOps/SRE
Возьмём интернет-магазин, API или внутреннюю корпоративную систему. Нагрузка постепенно растёт, но загрузка процессора ещё не достигла критического уровня, поэтому система мониторинга пока не подаёт сигнал. Через 20–30 минут процессор уже загружен на 80–90%, увеличивается время отклика, часть запросов начинает завершаться с ошибками, а автоматическое масштабирование только в этот момент начинает добавлять вычислительные ресурсы.