Обзор системы мониторинга

ℹ️ О системе мониторинга

Мониторинг в INFRAX объединяет карточку узла, SNMP-настройки и дашборд мониторинга в одну цепочку. Платформа собирает данные о доступности, агенте, CPU, RAM, дисках, сети, SSL-сертификатах и SNMP-метриках, а затем превращает превышения порогов в инциденты и тикеты.

Архитектура мониторинга

Текущая модель мониторинга INFRAX состоит из нескольких связанных слоёв: параметры на узле или в папке, планировщик задач, хранилище истории и дашборд для оперативного контроля.

Мониторинг узла

  • Карточка мониторинга - на вкладке Мониторинг на карточке узла доступны секции Мониторинг доступности, Мониторинг агента, Загрузка процессора, Загрузка памяти, Дисковое пространство и SSL-сертификаты
  • Наследование настроек - параметры можно задать на уровне папки и применить ко всем вложенным узлам
  • Инциденты - при нарушении порогов система может создать тикет и закрыть его после нормализации

SNMP-мониторинг

  • Отдельная конфигурация - параметры SNMP задаются на вкладке SNMP в настройках узла
  • Шаблоны мониторинга - метрики для сетевого оборудования собираются по шаблонам
  • Автоопределение - система использует SNMP-данные для определения типа устройства и заполнения CMDB

Дашборд мониторинга

  • Общий статус - сводка по онлайн и офлайн узлам
  • Бизнес-сервисы - здоровье сервисов на основе состояния входящих узлов
  • Топы метрик - CPU, RAM, диски, сеть, потери пакетов и время отклика
  • Контроль состояния - устаревшие агенты, узлы без SNMP-шаблона, переопределённые триггеры и другие события обслуживания

Планировщик задач

  • Периодический сбор - данные собираются фоновыми заданиями по расписанию
  • Гибкая настройка - интервалы и расписания управляются через системные настройки и cron-задачи
  • Разделение по типам - отдельные задачи используются для ping, агентских метрик, дисков, SSL и SNMP

Схема взаимодействия

Узел / папка
   ├─> настройки мониторинга
   ├─> cron-задачи и сбор данных
   ├─> история и текущее состояние
   └─> дашборд, инциденты, тикеты

Типы метрик

Набор метрик в INFRAX разделён по способу сбора и по месту отображения. Часть метрик живёт в карточке узла, часть - на дашборде, а SNMP-метрики доступны в отдельном блоке конфигурации устройства.

Группа метрик Что контролируется Где используется
Доступность Статус узла, RTT и потери пакетов по ping Мониторинг доступности и секция сетевого соединения на дашборде
Агент Доступность агента мониторинга и время его ответа Карточка Мониторинг агента
CPU Загрузка процессора и, при необходимости, загрузка по ядрам Карточка Загрузка процессора и топы CPU на дашборде
RAM Использование памяти и свободный объём Карточка Загрузка памяти и топы RAM на дашборде
Диск Заполнение, время отклика, скорость чтения и записи, IOPS Карточка Дисковое пространство и секция производительности дисков
Сеть Скорость приёма, передачи и суммарная скорость интерфейсов Дашборд мониторинга и графики узла
SSL Срок действия и валидность сертификата Карточка SSL-сертификаты и связанные триггеры
SNMP Метрики устройств, таблицы, модули и базовые характеристики Настройки SNMP, шаблоны мониторинга и панели SNMP

Что требует агента

  • Нужен агент - CPU, RAM, диски и сетевая активность узла
  • Не нужен агент - ping и SSL-проверка
  • Требуется SNMP - сетевое оборудование, ИБП, хранилища и другие устройства, для которых настроен SNMP-шаблон

Сбор данных

В текущем продукте данные собираются несколькими независимыми контурами, и каждый из них соответствует своему типу узла и своей карточке в интерфейсе.

Агентский сбор

Агентская модель используется для серверов и рабочих станций, когда нужны детальные показатели операционной системы и локальных ресурсов.

  • Задача по расписанию обращается к агенту на целевом узле
  • Агент возвращает текущие значения CPU, RAM, дисков и сети
  • Данные сохраняются как история и как текущее состояние

Ping-мониторинг

Ping используется для проверки доступности узла без установки программного обеспечения.

  • Сервер отправляет ICMP Echo Request
  • Измеряется RTT и фиксируется потеря пакетов
  • Результат попадает в карточку доступности и в топы дашборда

SNMP-сбор

SNMP-мониторинг применяется для сетевого оборудования и других устройств, где важны метрики, получаемые по MIB/OID.

  • Проверяется доступность SNMP-порта
  • Собирается общая информация об устройстве
  • Шаблон мониторинга определяет, какие метрики и таблицы нужно опрашивать

Проверка SSL-сертификатов

Проверка сертификатов выполняется как отдельная задача и помогает контролировать срок действия веб-сервисов и инфраструктурных конечных точек.

  • Система извлекает сертификат по HTTPS
  • Проверяются срок действия и корректность цепочки
  • При необходимости создаётся инцидент в Helpdesk

Основные задачи

Задача Назначение Результат
PingAllNodes Проверка доступности узлов по ping Доступность, RTT и потери пакетов
CollectMonitoringMetrics Сбор метрик по SNMP-шаблонам Метрики устройств и таблиц SNMP
GetDisksInfo Сбор данных об утилизации дисков Заполнение, скорость и IOPS
CheckSslCertificates Проверка SSL-сертификатов Срок действия и валидность
SnmpPortScan Проверка доступности SNMP-портов Готовность устройства к опросу
SnmpDiscoverNodeInfo Получение общей информации об устройстве Тип устройства, модель и базовые характеристики

Хранение данных

INFRAX хранит мониторинговые данные так, чтобы карточки узлов и дашборды показывали актуальное состояние, а история оставалась доступной для анализа трендов.

История и текущее состояние

  • История метрик - используется для графиков и анализа изменений во времени
  • Текущее состояние - применяется в дашбордах, топах и карточках узлов
  • Свежесть данных - устаревшие записи не должны искажать оперативный обзор

Настройки хранения

Параметр Назначение
monitoring_data_retention_days Срок хранения истории мониторинга
dashboard_metrics_max_age Максимальный возраст метрик, допустимый для дашборда
ℹ️ Фильтрация устаревших данных

Дашборд использует только свежие метрики, поэтому остановленные узлы, давно не обновлявшиеся агенты и старые снимки состояния не засоряют топы и сводные виджеты.

Процесс мониторинга

Полный цикл мониторинга в INFRAX проходит через одинаковую последовательность действий независимо от типа метрики.

1. Настройка
   ├─> задаются пороги, автозакрытие и наследование
   └─> при необходимости подключается SNMP-шаблон

2. Сбор данных
   ├─> ping, агент, SNMP или SSL-задача
   └─> данные попадают в хранилище

3. Оценка условий
   ├─> значения сравниваются с порогами
   └─> фиксируются последовательные превышения

4. Реакция
   ├─> создаётся инцидент или тикет
   └─> при нормализации может сработать автозакрытие

5. Оперативный контроль
   ├─> дашборд показывает состояние в реальном времени
   └─> карточка узла даёт детальную расшифровку по каждой метрике

Где смотреть результаты

  • Карточка узла - детальная работа с доступностью, ресурсами и порогами
  • Дашборд мониторинга - общая картина по всей инфраструктуре
  • Helpdesk - инциденты, созданные по правилам мониторинга

Рекомендации

Тип узла Рекомендуемый подход Почему так
Серверы и рабочие станции Агентный мониторинг Даёт CPU, RAM, диски и сеть с максимальной детализацией
Сетевое оборудование SNMP + Ping Позволяет контролировать доступность и аппаратные метрики без установки агента
ИБП, хранилища, принтеры SNMP + Ping Подходит для устройств, которые не запускают агенты мониторинга
Публичные веб-сервисы Ping + SSL Позволяет одновременно видеть доступность и срок действия сертификата

Практика настройки

  • Настраивайте базовые пороги на уровне папок, а исключения - только на отдельных узлах
  • Используйте дашборд как первую точку входа для поиска проблемных узлов
  • Следите за устаревшими агентами и отсутствующими SNMP-шаблонами в карточке мониторинга
  • Подбирайте интервалы сбора с учётом критичности узла и объёма данных
  • Для критичных сервисов включайте автоматическое создание тикетов и аккуратно используйте автозакрытие