Практически каждый инженер, который хотя бы несколько лет занимается эксплуатацией инфраструктуры, может вспомнить несколько историй, начинающихся одинаково: "Да это изменение на пять минут", "Мы уже сто раз так делали", "Там вообще нечему ломаться". Удивительно, но именно такие фразы зачастую становятся прологом к очередному многочасовому созвону, десяткам сообщений в аварийном чате и вопросам руководства о том, почему пользователи снова не могут воспользоваться сервисом. В этот момент выясняется, что простое обновление Helm-чарта неожиданно затронуло сетевые политики, автомасштабирование начало создавать новые экземпляры приложения в неподходящих зонах доступности, система мониторинга не прислала критическое оповещение, а документация по откату последний раз обновлялась ещё во времена, когда Kubernetes считался экзотикой.
Как я подбираю людей в инфраструктурную команду. Или почему Kubernetes не чинит токсичных идиотов
Есть одна мысль, которую многие компании почему-то осознают только после третьего массового увольнения, пятого выгорания команды и седьмого “а почему у нас опять все легло ночью”.
Инфраструктура - это не про технологии.
Инфраструктура - это про людей.