Мониторинг для бизнеса измеряет доступность рабочих сервисов — 1С, базы данных, удалённого доступа, почты, обменов — а не только загрузку процессора. Второй обязательный слой: место на дисках, статус резервных копий, срок сертификатов и состояние оборудования. Оповещения должны доходить до ответственного и проверяться учебной тревогой.
Типичная история: сотрудники утром не могут войти в 1С, и только тогда выясняется, что ночью закончилось место на диске сервера баз данных. Мониторинг существует, чтобы такие события становились задачей для администратора за часы или дни до того, как их заметят сотрудники. Ниже — минимальный состав, который AST настраивает для компаний с одним-двумя серверами и филиалами.
Мониторить сервисы, а не только железо
Первый уровень — проверки того, чем пользуются люди: отвечает ли сервер 1С и СУБД, открывается ли удалённый рабочий стол, доступен ли VPN с площадок, работает ли почта и сайт, прошёл ли ночной обмен с CRM. Эти проверки выполняются снаружи и изнутри сети и показывают влияние на бизнес. Загрузка процессора и памяти важна как объяснение причины, а не как единственный сигнал.
Второй уровень: диски, копии, сертификаты, оборудование
Свободное место на всех разделах с порогами в процентах и в гигабайтах; состояние RAID и SMART дисков; температура и питание, события ИБП; результат последнего задания резервного копирования и проверки копий; срок действия TLS-сертификатов и доменов; обновления с перезагрузкой. Именно эти проверки предотвращают большинство «внезапных» аварий, потому что проблемы в них накапливаются постепенно.
Пороги и оповещения без шума
Оповещение полезно, если на него реагируют. Для каждого события определяются порог, время подтверждения (чтобы не реагировать на секундные всплески) и канал: мессенджер для срочных, почта для сводок. Указывается ответственный и порядок эскалации, если он не ответил. Если система присылает десятки писем в день, их перестают читать — поэтому пороги пересматриваются после первых недель по фактической статистике.
Инструменты
Для инфраструктуры с Windows и Linux серверами обычно используем Zabbix: агенты, шаблоны для ОС, СУБД и оборудования, карты и отчёты. Для контейнеров и сервисов с метриками подходит связка Prometheus и Grafana. Внешние проверки доступности сайта и VPN лучше делать из другой сети. Proxmox и системы резервного копирования имеют собственные уведомления — их подключаем к тем же каналам, чтобы у ответственного был один поток событий.
Что делать с данными и как проверять систему
Раз в месяц просматриваются тренды: рост занятого места, нагрузка в часы отчётов, повторяющиеся события. По ним планируются расширение дисков, перенос сервисов или оптимизация. Сам мониторинг тоже нуждается в проверке: периодически моделируем сбой (останавливаем тестовый сервис, отключаем копию) и смотрим, за сколько минут и кому пришло оповещение. Без такой проверки нельзя утверждать, что система предупредит о реальной аварии.
Что фиксируем при проверке
| Объект | Что проверяем |
|---|---|
| Сервисы | Проверки 1С, СУБД, RDP/VPN, почты, обменов снаружи и изнутри |
| Ресурсы | Диски, RAID/SMART, питание, обновления |
| Копии | Статус задания и результат проверки восстановления |
| Оповещения | Пороги, время подтверждения, ответственный, эскалация |
| Проверка | Учебная тревога с замером времени доставки |
Вопросы перед началом
Нужен ли отдельный сервер для мониторинга?
Небольшой инфраструктуре достаточно виртуальной машины; важно разместить её так, чтобы отказ основного сервера не выключал сам мониторинг. Внешние проверки выполняются с другой площадки.
Можно ли обойтись уведомлениями Proxmox и системы копирования?
Они закрывают часть событий, но не проверяют доступность сервисов для пользователей и не собирают тренды. Обычно их подключают к общему мониторингу, а не используют вместо него.
Кто получает оповещения, если нет своего администратора?
В формате IT-аутсорсинга оповещения принимает дежурный подрядчика по согласованному графику, а руководителю приходит сводка. Порядок и время реакции фиксируются в SLA.
Документация и источники
Материал команды AST описывает подход к задаче. Технические возможности сверены с документацией ниже; конкретная схема зависит от версий и условий проекта.
Нужна помощь с похожей задачей?
Опишите текущую систему и результат, который хотите получить. Определим состав первого этапа.