Узнаёте о сбое последним
Сайт лежит сорок минут, пока кто-то не напишет в поддержку. Или не напишет вовсе — просто уйдёт.
Ставлю постоянные проверки и уведомления, чтобы о сбое сообщала система.
Настраиваю мониторинг, закрываю лишний доступ к серверу и привожу выкатку в порядок. Задача — чтобы о проблеме вам сообщала система, а не пользователи.
Разбираю задачу до начала работ. Если проблемы нет — так и скажу.
Знакомо?
Сайт лежит сорок минут, пока кто-то не напишет в поддержку. Или не напишет вовсе — просто уйдёт.
Ставлю постоянные проверки и уведомления, чтобы о сбое сообщала система.
Когда система шлёт двадцать сообщений в час, смотреть перестают — и пропускают то самое.
Настраиваю группировку и подавление: на один сбой одно сообщение.
Настраивал подрядчик два года назад, дописывали по ходу дела. Трогать страшно.
Письменный разбор того, что у вас есть, и план — что чинить первым.
Услуги
Формулировки от результата: вы покупаете «узнаю о сбое первым», а не название инструмента.
Узнаёте о проблеме раньше клиентов.
Слабые места находятся до того, как приведут к сбою.
Причина сбоя, а не перезапуск сервиса.
Приложение запускается одинаково на любом сервере.
Выпуск без ручного копирования файлов, с откатом.
Копия, из которой проверено, что можно восстановиться.
Kafka с нуля или стабилизация существующего контура.
Повторяемые ручные действия уходят из работы.
Доказательства
Всё сделано на собственной инфраструктуре, которую я веду как продакшн. Цифры — измеренные, детали, по которым можно найти серверы, убраны намеренно.
Системные журналы заняли 4 ГБ и продолжали расти.
4,0 ГБ → 31 МБ, рост остановлен
Разбор
Метрик нет, логи разбросаны, о состоянии судили по тому, открывается сайт.
Ни одного нового порта наружу
Разбор
Наблюдатель потерял связь и объявил упавшими пять работающих сайтов.
Разбор собственной ошибки
Разбор
Что вы получите на руки
После работы остаётся документ: что найдено, что сделано, чем проверено и что осталось. Его можно прочитать через полгода и понять, почему сделано именно так.
Кто это делает
Дмитрий Савичев
SRE/DevOps-инженер
Три года поддерживаю инфраструктуру и микросервисы в финтехе. Параллельно веду собственный контур из девяти сервисов на двух серверах — с метриками, логами, алертами и автоматической выкаткой.
Опишите в двух словах, что у вас за инфраструктура и что беспокоит. Этого достаточно, чтобы понять, могу ли я помочь.