У вас стоит Zabbix, нарисованы дашборды в Grafana, кто-то настроил алерты. Но «мониторинг стоит» и «авария будет замечена» — разные утверждения. Мы поимённо проверяем, всё ли важное под наблюдением и сработает ли оповещение, когда важное сломается.
Мониторинг отвечает на вопрос «что сейчас происходит с системой». Аудит покрытия отвечает на другой, более неудобный: всё ли, что важно, вообще под наблюдением, и сработает ли оповещение, когда важное сломается.
Именно на этом периметре живут дыры: настраивавший мониторинг человек по определению не заведёт в него то, о чём забыл или не знал. Дашборд не может подсветить собственную слепую зону — он зелёный не там, где всё исправно, а там, где есть за чем следить. Аудит — это взгляд снаружи на то, чего дашборд не видит.
Боевая система при этом не останавливается: аудит — только чтение и наблюдение.
Примеры мы приводим на Zabbix — он даёт сбор метрик, хранение, триггеры и оповещения в одной коробке и опрашивает сетевое железо по SNMP прямо из поставки, включая отечественный Eltex и MikroTik. Но проверяется не название системы, а то, что она сработает: сверка двух списков, проверка доставки фактом отправки, сторож снаружи и сквозные пробы одинаковы на любом стеке.
Grafana в этом раскладе — слой визуализации поверх источника, а не независимое суждение о здоровье: зелёная панель — это отрисовка того, что ей отдал Zabbix. Она не знает, что какой-то узел не заведён, и нарисует пустое место спокойным. Метод аудита от операционной системы не зависит — Zabbix и его агент работают на Astra Linux и RED OS так же, как на Ubuntu.
Метрики собирались, графики рисовались, дашборд зеленел — но правило оповещения покрывало ровно две сущности. Ядро дата-центра, веб-сервер, телефония и сам сервер мониторинга молчали.
Любой из тринадцати сайтов мог лежать сколько угодно при зелёном экране: снятие метрик и проверка доступности — разные настройки, вторую просто не сделали. Завели тринадцать триггеров с анти-флапом.
Сквозной тест показал: отправка в мессенджер не проходила — рассинхрон параметров после обновления плюс блокировка на выходе. Проверяется только фактом отправки: 46 успешных против одной неуспешной за неделю после починки.
Сервер мониторинга не сообщит «я умер». Независимый наблюдатель на другой площадке и другом канале раз в пару минут опрашивает всю цепочку и бьёт тревогу, минуя дата-центр. Если площадки одной нет — роль закрывает дешёвая облачная виртуалка.
За один день покажем поимённо, что ваш мониторинг заметит, а что пропустит по построению — и проверим доставку алерта фактом отправки.
Или позвоните: 8 (804) 333-33-35 — бесплатно по России