Kaizen Official Group

Ваш сервер падает, а вы узнаёте об этом от клиентов

Настраиваю мониторинг, закрываю лишний доступ к серверу и привожу выкатку в порядок. Задача — чтобы о проблеме вам сообщала система, а не пользователи.

Разбираю задачу до начала работ. Если проблемы нет — так и скажу.

Знакомо?

Три ситуации, с которыми обращаются чаще всего

Узнаёте о сбое последним

Сайт лежит сорок минут, пока кто-то не напишет в поддержку. Или не напишет вовсе — просто уйдёт.

Ставлю постоянные проверки и уведомления, чтобы о сбое сообщала система.

Уведомлений столько, что вы их не читаете

Когда система шлёт двадцать сообщений в час, смотреть перестают — и пропускают то самое.

Настраиваю группировку и подавление: на один сбой одно сообщение.

Никто не знает, как всё устроено

Настраивал подрядчик два года назад, дописывали по ходу дела. Трогать страшно.

Письменный разбор того, что у вас есть, и план — что чинить первым.

Услуги

Восемь направлений

Формулировки от результата: вы покупаете «узнаю о сбое первым», а не название инструмента.

Мониторинг, логи и алерты

Узнаёте о проблеме раньше клиентов.

Аудит сервера и доступов

Слабые места находятся до того, как приведут к сбою.

Диагностика инцидентов

Причина сбоя, а не перезапуск сервиса.

Docker и окружение

Приложение запускается одинаково на любом сервере.

Развёртывание и CI/CD

Выпуск без ручного копирования файлов, с откатом.

Бэкапы и восстановление

Копия, из которой проверено, что можно восстановиться.

Kafka и очереди

Kafka с нуля или стабилизация существующего контура.

Боты и автоматизация

Повторяемые ручные действия уходят из работы.

Что входит и чего не входит в каждую — на странице услуг

Доказательства

Разборы работы

Всё сделано на собственной инфраструктуре, которую я веду как продакшн. Цифры — измеренные, детали, по которым можно найти серверы, убраны намеренно.

Все кейсы

Что вы получите на руки

Не обещание, а форма результата

После работы остаётся документ: что найдено, что сделано, чем проверено и что осталось. Его можно прочитать через полгода и понять, почему сделано именно так.

Посмотреть обезличенный пример отчёта

Кто это делает

Личная ответственность за результат

Дмитрий Савичев

SRE/DevOps-инженер

Три года поддерживаю инфраструктуру и микросервисы в финтехе. Параллельно веду собственный контур из девяти сервисов на двух серверах — с метриками, логами, алертами и автоматической выкаткой.

Опишите в двух словах, что у вас за инфраструктура и что беспокоит. Этого достаточно, чтобы понять, могу ли я помочь.