Практически каждый инженер, который хотя бы несколько лет занимается эксплуатацией инфраструктуры, может вспомнить несколько историй, начинающихся одинаково: "Да это изменение на пять минут", "Мы уже сто раз так делали", "Там вообще нечему ломаться". Удивительно, но именно такие фразы зачастую становятся прологом к очередному многочасовому созвону, десяткам сообщений в аварийном чате и вопросам руководства о том, почему пользователи снова не могут воспользоваться сервисом. В этот момент выясняется, что простое обновление Helm-чарта неожиданно затронуло сетевые политики, автомасштабирование начало создавать новые экземпляры приложения в неподходящих зонах доступности, система мониторинга не прислала критическое оповещение, а документация по откату последний раз обновлялась ещё во времена, когда Kubernetes считался экзотикой.