Пятнадцать лет строю и масштабирую распределённые системы — застал переход индустрии от bare-metal серверов и монолитов к cloud-native, Kubernetes и GitOps. Берусь за то, что команды откладывают: технический долг, выкладка релизов с нуля и удержание систем в рабочем состоянии.
Шесть переходов, которые сегодня продают готовыми решениями. Я проходил их, когда готовых решений не существовало.
Реагирование на инциденты
Process / Observability — Grafana, Alertmanager, Ansible, Git, Linux
Референсная архитектура. Клиентский код под NDA, поэтому страница описывает устройство системы и логику решений, а не конкретное внедрение.
Дежурства построены вокруг владения сервисом: кто выпускает сервис, тот его и носит — единственная схема, которая надёжно повышает надёжность. Ротации укомплектованы так, чтобы дежурство было спокойным большинство недель, а не налогом, вокруг которого люди планируют жизнь.
Runbook лежат рядом с кодом и открываются на учениях, потому что runbook, который никто не проходил с момента написания, — это художественная литература. Постмортемы безобвинительные и дают отслеживаемые действия: инцидент, который ничего не изменил, повторится точно по расписанию.