Обзор системы мониторинга
Мониторинг в INFRAX объединяет карточку узла, SNMP-настройки и дашборд мониторинга в одну цепочку. Платформа собирает данные о доступности, агенте, CPU, RAM, дисках, сети, SSL-сертификатах и SNMP-метриках, а затем превращает превышения порогов в инциденты и тикеты.
Архитектура мониторинга
Текущая модель мониторинга INFRAX состоит из нескольких связанных слоёв: параметры на узле или в папке, планировщик задач, хранилище истории и дашборд для оперативного контроля.
Мониторинг узла
- Карточка мониторинга - на вкладке Мониторинг на карточке узла доступны секции Мониторинг доступности, Мониторинг агента, Загрузка процессора, Загрузка памяти, Дисковое пространство и SSL-сертификаты
- Наследование настроек - параметры можно задать на уровне папки и применить ко всем вложенным узлам
- Инциденты - при нарушении порогов система может создать тикет и закрыть его после нормализации
SNMP-мониторинг
- Отдельная конфигурация - параметры SNMP задаются на вкладке SNMP в настройках узла
- Шаблоны мониторинга - метрики для сетевого оборудования собираются по шаблонам
- Автоопределение - система использует SNMP-данные для определения типа устройства и заполнения CMDB
Дашборд мониторинга
- Общий статус - сводка по онлайн и офлайн узлам
- Бизнес-сервисы - здоровье сервисов на основе состояния входящих узлов
- Топы метрик - CPU, RAM, диски, сеть, потери пакетов и время отклика
- Контроль состояния - устаревшие агенты, узлы без SNMP-шаблона, переопределённые триггеры и другие события обслуживания
Планировщик задач
- Периодический сбор - данные собираются фоновыми заданиями по расписанию
- Гибкая настройка - интервалы и расписания управляются через системные настройки и cron-задачи
- Разделение по типам - отдельные задачи используются для ping, агентских метрик, дисков, SSL и SNMP
Схема взаимодействия
Узел / папка
├─> настройки мониторинга
├─> cron-задачи и сбор данных
├─> история и текущее состояние
└─> дашборд, инциденты, тикеты
Типы метрик
Набор метрик в INFRAX разделён по способу сбора и по месту отображения. Часть метрик живёт в карточке узла, часть - на дашборде, а SNMP-метрики доступны в отдельном блоке конфигурации устройства.
| Группа метрик | Что контролируется | Где используется |
|---|---|---|
| Доступность | Статус узла, RTT и потери пакетов по ping | Мониторинг доступности и секция сетевого соединения на дашборде |
| Агент | Доступность агента мониторинга и время его ответа | Карточка Мониторинг агента |
| CPU | Загрузка процессора и, при необходимости, загрузка по ядрам | Карточка Загрузка процессора и топы CPU на дашборде |
| RAM | Использование памяти и свободный объём | Карточка Загрузка памяти и топы RAM на дашборде |
| Диск | Заполнение, время отклика, скорость чтения и записи, IOPS | Карточка Дисковое пространство и секция производительности дисков |
| Сеть | Скорость приёма, передачи и суммарная скорость интерфейсов | Дашборд мониторинга и графики узла |
| SSL | Срок действия и валидность сертификата | Карточка SSL-сертификаты и связанные триггеры |
| SNMP | Метрики устройств, таблицы, модули и базовые характеристики | Настройки SNMP, шаблоны мониторинга и панели SNMP |
Что требует агента
- Нужен агент - CPU, RAM, диски и сетевая активность узла
- Не нужен агент - ping и SSL-проверка
- Требуется SNMP - сетевое оборудование, ИБП, хранилища и другие устройства, для которых настроен SNMP-шаблон
Сбор данных
В текущем продукте данные собираются несколькими независимыми контурами, и каждый из них соответствует своему типу узла и своей карточке в интерфейсе.
Агентский сбор
Агентская модель используется для серверов и рабочих станций, когда нужны детальные показатели операционной системы и локальных ресурсов.
- Задача по расписанию обращается к агенту на целевом узле
- Агент возвращает текущие значения CPU, RAM, дисков и сети
- Данные сохраняются как история и как текущее состояние
Ping-мониторинг
Ping используется для проверки доступности узла без установки программного обеспечения.
- Сервер отправляет ICMP Echo Request
- Измеряется RTT и фиксируется потеря пакетов
- Результат попадает в карточку доступности и в топы дашборда
SNMP-сбор
SNMP-мониторинг применяется для сетевого оборудования и других устройств, где важны метрики, получаемые по MIB/OID.
- Проверяется доступность SNMP-порта
- Собирается общая информация об устройстве
- Шаблон мониторинга определяет, какие метрики и таблицы нужно опрашивать
Проверка SSL-сертификатов
Проверка сертификатов выполняется как отдельная задача и помогает контролировать срок действия веб-сервисов и инфраструктурных конечных точек.
- Система извлекает сертификат по HTTPS
- Проверяются срок действия и корректность цепочки
- При необходимости создаётся инцидент в Helpdesk
Основные задачи
| Задача | Назначение | Результат |
|---|---|---|
PingAllNodes |
Проверка доступности узлов по ping | Доступность, RTT и потери пакетов |
CollectMonitoringMetrics |
Сбор метрик по SNMP-шаблонам | Метрики устройств и таблиц SNMP |
GetDisksInfo |
Сбор данных об утилизации дисков | Заполнение, скорость и IOPS |
CheckSslCertificates |
Проверка SSL-сертификатов | Срок действия и валидность |
SnmpPortScan |
Проверка доступности SNMP-портов | Готовность устройства к опросу |
SnmpDiscoverNodeInfo |
Получение общей информации об устройстве | Тип устройства, модель и базовые характеристики |
Хранение данных
INFRAX хранит мониторинговые данные так, чтобы карточки узлов и дашборды показывали актуальное состояние, а история оставалась доступной для анализа трендов.
История и текущее состояние
- История метрик - используется для графиков и анализа изменений во времени
- Текущее состояние - применяется в дашбордах, топах и карточках узлов
- Свежесть данных - устаревшие записи не должны искажать оперативный обзор
Настройки хранения
| Параметр | Назначение |
|---|---|
monitoring_data_retention_days |
Срок хранения истории мониторинга |
dashboard_metrics_max_age |
Максимальный возраст метрик, допустимый для дашборда |
Дашборд использует только свежие метрики, поэтому остановленные узлы, давно не обновлявшиеся агенты и старые снимки состояния не засоряют топы и сводные виджеты.
Процесс мониторинга
Полный цикл мониторинга в INFRAX проходит через одинаковую последовательность действий независимо от типа метрики.
1. Настройка
├─> задаются пороги, автозакрытие и наследование
└─> при необходимости подключается SNMP-шаблон
2. Сбор данных
├─> ping, агент, SNMP или SSL-задача
└─> данные попадают в хранилище
3. Оценка условий
├─> значения сравниваются с порогами
└─> фиксируются последовательные превышения
4. Реакция
├─> создаётся инцидент или тикет
└─> при нормализации может сработать автозакрытие
5. Оперативный контроль
├─> дашборд показывает состояние в реальном времени
└─> карточка узла даёт детальную расшифровку по каждой метрике
Где смотреть результаты
- Карточка узла - детальная работа с доступностью, ресурсами и порогами
- Дашборд мониторинга - общая картина по всей инфраструктуре
- Helpdesk - инциденты, созданные по правилам мониторинга
Рекомендации
| Тип узла | Рекомендуемый подход | Почему так |
|---|---|---|
| Серверы и рабочие станции | Агентный мониторинг | Даёт CPU, RAM, диски и сеть с максимальной детализацией |
| Сетевое оборудование | SNMP + Ping | Позволяет контролировать доступность и аппаратные метрики без установки агента |
| ИБП, хранилища, принтеры | SNMP + Ping | Подходит для устройств, которые не запускают агенты мониторинга |
| Публичные веб-сервисы | Ping + SSL | Позволяет одновременно видеть доступность и срок действия сертификата |
Практика настройки
- Настраивайте базовые пороги на уровне папок, а исключения - только на отдельных узлах
- Используйте дашборд как первую точку входа для поиска проблемных узлов
- Следите за устаревшими агентами и отсутствующими SNMP-шаблонами в карточке мониторинга
- Подбирайте интервалы сбора с учётом критичности узла и объёма данных
- Для критичных сервисов включайте автоматическое создание тикетов и аккуратно используйте автозакрытие