DevOps

Мониторинг для DevOps и системных администраторов

Внутренний стек метрик отвечает на вопрос «что происходит внутри». Он не отвечает на вопрос «видит ли нас клиент» — и замолкает вместе с инфраструктурой, за которой следит. Base388 работает снаружи и независимо: внешняя проверка сервисов, контроль cron и пайплайнов, сертификаты и дежурство без лишнего шума.

DevOps-инженеры, системные администраторы, SRE небольших команд и подрядчики на технической поддержке инфраструктуры

Что обычно болит

Мониторинг падает вместе с инфраструктурой

Стек метрик стоит в том же контуре, что и продакшен. Отказ сети или узла — и вы теряете и сервис, и способность узнать о его отказе.

Изнутри всё зелёное

Метрики в норме, проверки со своего же хоста проходят. А снаружи сервис недоступен: DNS, маршрутизация, блокировка IP, просроченный сертификат.

Cron и пайплайны — слепая зона

Регулярные задачи не отдают метрик и не пишут алертов. Отвалившийся ночной прогон обнаруживается по последствиям.

Алерт-шум убивает дежурство

Когда каждое мигание превращается в сообщение, дежурный перестаёт читать канал — и пропускает настоящую аварию.

Сертификаты живут в разных местах

Часть на балансировщике, часть на сервисах, часть у подрядчика. Единого календаря сроков нет.

Что даёт Base388 в вашем случае

Каждый пункт — конкретная возможность сервиса и результат, который она приносит именно в этом сценарии.

Независимая внешняя точка правды

Проверки идут из сети, не связанной с вашим контуром: они переживают отказ, который выключает внутренний мониторинг.

Результат

Есть кто-то, кто расскажет об аварии, когда своя телеметрия молчит.

Dead man switch для cron

Heartbeat подключается одной строкой и работает из закрытого контура: соединение исходящее, входящий доступ не нужен.

Результат

Регулярные задачи перестают быть слепой зоной.

Пайплайны и длительные операции

Jobs фиксирует старт, длительность, результат и текст ошибки, ловит зависания по таймауту и прерывания новым запуском.

Результат

Зависший прогон виден во время выполнения, а не постфактум.

Правила против шума

Порог «сколько ошибок подряд», частота напоминаний по продолжающемуся инциденту, тихие часы, разные каналы под разные сервисы.

Результат

Канал дежурства остаётся читаемым, а значит рабочим.

Единый календарь сроков

SSL-сертификаты и регистрации доменов по всем сервисам — с многоступенчатыми предупреждениями заранее.

Результат

Продление становится плановой задачей спринта.

Самомониторинг команд без обвязки

Флаги --jobs-tok и --heartbeat-tok добавляются прямо в строку cron и работают для любой консольной команды.

Результат

Мониторинг расписания подключается без правок в коде задач.

Проверки, проходящие через WAF

Уникальный секрет монитора в заголовке X-Base388-Verify позволяет пустить проверку точечным правилом.

Результат

Не приходится ослаблять защиту ради мониторинга.

Как это настроить у себя

Порядок действий, с которого обычно начинают в этой роли.

01

Закройте внешний периметр

Мониторы на публичные сервисы и health-check-эндпоинты, с проверкой содержимого, а не только кода ответа.

02

Прикройте расписание

Heartbeat на каждую регулярную задачу, jobs — на длительные и критичные прогоны.

03

Разведите каналы

Критичное — в канал дежурства, фоновое — в рабочий чат. Настройте тихие часы и порог срабатывания.

04

Соберите сроки

Включите контроль SSL и доменов на всех внешних сервисах — календарь соберётся сам.

Что вы получаете

  • Внешняя проверка переживает отказ, который выключает внутренний мониторинг.
  • Cron и пайплайны перестают быть слепой зоной.
  • Зависшие процессы обнаруживаются во время прогона, а не по последствиям.
  • Канал дежурства остаётся читаемым — шум отфильтрован правилами.
  • Сроки сертификатов и доменов собраны в одном месте.

Какой тариф обычно берут инженеры

Основные ограничители — число мониторов, число heartbeat и jobs и минимальный интервал проверки. Подбор на странице тарифов считает это по вашим ответам.

Частые вопросы

Заменит ли это внутренний стек метрик?
Нет, и не должен. Внутренний мониторинг отвечает на вопрос «что происходит внутри», Base388 — на вопрос «видит ли нас клиент». Они дополняют друг друга, и вторая точка зрения нужна именно потому, что она независима.
Нужен ли входящий доступ к нашим серверам?
Для heartbeat и jobs — нет, там всё соединение исходящее. Для HTTP-мониторинга нужен публично доступный адрес.
Как подключить мониторинг к уже существующему cron?
Дописать пинг через && или добавить флаг --heartbeat-tok / --jobs-tok к команде. Правки в коде задач не требуются.

Добавьте независимую точку зрения

Внешние проверки, контроль расписания и дежурство без шума — начните с бесплатного тарифа.