Loki победил ELK в Kubernetes, но Elasticsearch всё ещё не собирается умирать

История инфраструктурных технологий редко развивается по сценарию, в котором одна система внезапно оказывается "плохой", а другая приходит ей на смену в роли безусловного победителя. Обычно всё происходит значительно интереснее. Технологии появляются как ответ на конкретные ограничения своего времени, прекрасно решают поставленные перед ними задачи, постепенно становятся отраслевым стандартом, а затем сталкиваются с изменением окружающей среды. В этот момент выясняется, что проблема заключается вовсе не в качестве инженерных решений. Просто мир, для которого они создавались, перестал существовать в прежнем виде.

Мониторинг

Читать дальше

Kubernetes встречает ФСТЭК: как на самом деле живут системы К1-К4

Когда в компании впервые звучит фраза: «Нам нужно определить класс защищённости», в переговорной обычно разворачивается небольшой спектакль в трёх действиях. Специалист по информационной безопасности открывает несколько десятков вкладок с приказами, методиками и разъяснениями регуляторов. DevOps-инженер незаметно пытается вспомнить, сколько серверов работают на версиях операционных систем, которые давно сняты с поддержки, и какие именно сервисы никто не обновлял последние три года, потому что "трогать страшно - вдруг перестанет работать". Бизнес, как правило, задаёт самый прагматичный вопрос:

А можно всё это сделать подешевле? И желательно без остановки сервисов?!

Информационная безопасность

Читать дальше

Terraform становится тесным: как Pulumi превращает инфраструктуру в программный продукт

Есть две стадии взросления инфраструктурного инженера. И если вы достаточно долго работаете в эксплуатации, разработке платформ или DevOps, велика вероятность, что через обе вы уже проходили. Первая стадия выглядит удивительно безобидно. Человек получает доступ к серверу, открывает терминал и думает: "Сейчас я быстро всё настрою через SSH и пару shell-скриптов. Тут работы минут на двадцать". В этот момент он искренне верит, что инфраструктура - это набор машин, несколько конфигурационных файлов и немного Bash-магии. Скрипты складываются в папку scripts, пароли временно живут в заметках, а документация существует преимущественно в голове человека, который всё это написал.

Разработка

Читать дальше

Когда логов уже недостаточно: почему OpenTelemetry стал новым стандартом наблюдаемости

Когда приложение состоит из одного app.py, жизнь кажется удивительно простой. Открываешь терминал, запускаешь tail -f, смотришь несколько строк логов и довольно быстро понимаешь, что происходит. Ошибка подключения к базе данных выглядит как ошибка подключения к базе данных. Исключение в коде находится ровно в том месте, где его выбросили. Если что-то сломалось, виновник обычно обнаруживается быстрее, чем успевает остыть кофе. Именно поэтому многие инженеры годами живут с ощущением, что логов достаточно для любых задач наблюдаемости.

А потом приложение начинает расти.

Мониторинг

Читать дальше

Когда не открывается IBM.com: автоматизируем развёртывание Hysteria2 через Ansible

Интернет задумывался как глобальная сеть, в которой любой компьютер может связаться с любым другим компьютером. На практике всё давно работает немного иначе. Где-то провайдер режет определённые сервисы, где-то появляются ограничения на отдельные протоколы, где-то плохо работает международная маршрутизация, а иногда нужный ресурс оказывается недоступен просто потому, что находится за пределами привычного маршрута вашего трафика. В результате даже опытный инженер периодически сталкивается с ситуацией, когда нужная документация не открывается, очередной релиз на GitHub скачивается со скоростью почтового голубя, пакеты PyPi становятся недоступными, Telemost начинает заикаться в голосовых каналах, а какой-нибудь зарубежный сервис внезапно оказывается недоступен из-за особенностей маршрутизации или региональной политики доступа.

Инфраструктура

Читать дальше

Тимлид в инфраструктуре: человек, которого подозревают в безделье, пока не падает прод

Одной из причин, почему роль инфраструктурного тимлида регулярно становится объектом шуток внутри технических команд, является различие в природе результатов труда. Работа инженера предельно осязаема. Если DevOps-инженер автоматизировал разворачивание окружений через Terraform, результат можно увидеть в репозитории, протестировать и использовать. Если специалист по эксплуатации внедрил систему наблюдаемости, то через несколько часов в Grafana появляются новые панели мониторинга, а в Alertmanager - уведомления о сбоях. Если команда внедрила GitOps-подход и перевела развёртывание сервисов под управление Argo CD, это отражается на скорости доставки изменений и снижении количества ошибок при релизах. Результаты инженерной работы фиксируются в коде, конфигурациях, метриках и работающих сервисах. Они измеримы, воспроизводимы и заметны окружающим.

Я - ТимЛид

Читать дальше

IDM в крупном Техе: почему управление идентификацией давно стало фундаментом инфраструктуры

Когда человек впервые слышит аббревиатуру IDM, обычно происходит одна из двух вещей.

Разработчик делает умное лицо и произносит: "А, Identity Management...". Инфраструктурщик же тяжело вздыхает, потому что мгновенно вспоминает очередной ночной инцидент, в ходе которого выяснилось, что бывший сотрудник, уволившийся ещё несколько месяцев назад, по-прежнему может подключиться к production через старый VPN. А если повезёт особенно сильно, то у него ещё обнаружится действующий Jenkins token, забытый kubeconfig и сервисный аккаунт, который когда-то создавался "буквально на пару дней".

И именно в этот момент становится понятно, что IDM - это не про логин и пароль.

Информационная безопасность

Читать дальше