Мониторинг доступности

ℹ️ О мониторинге доступности

В текущем продукте мониторинг доступности вынесен в отдельную вкладку Ping на карточке узла. Система отправляет ICMP-запросы, измеряет RTT, фиксирует периоды недоступности, сохраняет историю и может автоматически создавать и закрывать инциденты при восстановлении связи.

Обзор системы

Мониторинг доступности в INFRAX - это базовый режим контроля сетевых узлов. Он доступен для любого узла, даже если на нем не установлен агент.

Что делает Ping-мониторинг

  • Проверяет доступность узла - периодически отправляет ICMP Echo Request
  • Измеряет RTT - показывает задержку ответа в миллисекундах
  • Фиксирует простои - отмечает интервалы, когда узел не отвечал на запросы
  • Создает инциденты - по достижении порога неудачных попыток
  • Закрывает инциденты автоматически - после восстановления доступности
  • Поддерживает наследование - настройки можно задать на папке и применить ко всем вложенным узлам
Когда инциденты объединяются в проблему

Если несколько разных узлов одной точно заданной сети перестают отвечать почти одновременно, алгоритм может предложить общую проблему. По начальным настройкам нужны 3 узла за 60 секунд. Совпадение указывает на общую область сбоя, но не устанавливает неисправное устройство. Условия и действия оператора описаны в статье «Автоматическое обнаружение проблем».

Ping-мониторинг

Вкладка Ping показывает историю доступности узла. Основная линия графика отражает RTT, а маркеры и баннеры помогают быстро найти периоды недоступности.

Измеряемые параметры

Параметр Описание Единица измерения
Доступность Состояние узла online/offline Логическое значение
Время отклика (RTT) Задержка ответа на ping Миллисекунды (мс)
Периоды недоступности Интервалы, в которые узел не отвечал История событий

Как работает проверка

  1. Система периодически отправляет ping-запросы к узлу
  2. При ответе фиксируется RTT
  3. Если узел не отвечает, счетчик неудачных попыток увеличивается
  4. При превышении порога узел помечается как недоступный
  5. Все данные сохраняются в истории и используются в таблице периодов недоступности

Узлы на площадке

Узлы, отнесённые к площадке, опрашивает не сервер INFRAX, а шлюз этой площадки — изнутри её сети. Благодаря этому в мониторинг не попадают чужие машины с такими же частными адресами, а время отклика измеряется рядом с узлом: задержка канала до площадки в него не добавляется. Проверки сервера INFRAX и проверки площадок идут параллельно, поэтому общий проход мониторинга не удлиняется.

Когда шлюз площадки теряет связь, её узлы помечаются недоступными — дотянуться до них действительно нечем, — но инцидент создаётся один — на саму площадку, а не на каждый узел за шлюзом. Заголовок такого инцидента: «Площадка {siteTitle} недоступна», первое сообщение — «Площадка {siteTitle} недоступна: связь с её шлюзом потеряна, узлы площадки не опрашиваются ({failCount} последовательных проверок)». Используются те же пороги и та же настройка создания инцидентов, что и для обычных узлов.

  • В дереве Узлы сети у таких узлов вместо обычной пометки Недоступен появляется отдельный значок с подсказкой «Нет транспорта до площадки «{site}»: подключиться к этому узлу нельзя, мониторинг и удалённый доступ по нему не работают.»
  • Из-за одной упавшей площадки папки выше не получают пометку с числом недоступных узлов внутри («Недоступных узлов внутри: N») — такие узлы в этот признак не входят
  • История задержек за время недоступности не пишется: измерения не было, поэтому на графике будет разрыв, а не полка нулей
  • Когда связь восстановится, инцидент закрывается автоматически на общих условиях, а в него добавляется сообщение «Связь с площадкой восстановлена, опрос её узлов продолжен ({successCount} последовательных успешных проверок)»
ℹ️ Когда инцидент по площадке не заводится

Если состояние площадок установить не удалось (над деревом появляется строка «Сервис sitelink-hub недоступен, поэтому неизвестно, какие шлюзы площадок на связи. Дерево и его узлы взяты из базы данных.»), состояния узлов не меняются и инциденты не создаются: ничего не установлено, а не «всё офлайн». Не заводится инцидент и по площадке в статусе Ожидает подключения или Отозвана — это не авария. Подробнее — в разделе Работа с узлами площадки.

Настройка мониторинга

Графики доступности находятся на вкладке «Мониторинг» карточки узла. Порог срабатывания и создание инцидентов настраиваются отдельно: «Параметры → Настройки триггеров → Мониторинг доступности».

Доступ к настройкам

  1. Откройте карточку узла и выберите «Параметры»
  2. Откройте вкладку «Настройки триггеров»
  3. Найдите секцию «Мониторинг доступности»

Параметры настройки

Инциденты

Система может автоматически реагировать на потерю доступности узла:

  • Создавать инцидент - включение и отключение автоматического создания инцидентов
  • Автозакрытие инцидента - закрытие инцидента после восстановления доступности

Порог неудачных проверок используется и при восстановлении. Например, при значении 3 инцидент создаётся после трёх неудачных проверок подряд, а закрывается после трёх последовательных успешных проверок. Это защищает от преждевременного закрытия при кратком ответе узла.

Узлы, которые выключают намеренно

Выключенный параметр Создавать инцидент означает, что недоступность узла ожидаема: так помечают машины, которые выключают на ночь, резервное оборудование, тестовые стенды. Дерево Узлы сети показывает такие узлы иначе:

  • отметка недоступности у самого узла остаётся, но выглядит приглушённо, а её подсказка говорит «Недоступен; инцидент по этому узлу не открывается»;
  • в значке папки, подсказка которого называет число недоступных узлов внутри («Недоступных узлов внутри: N»), такие узлы не учитываются — папка, где все машины выключены намеренно, этого значка не показывает вовсе.

Параметр наследуется, поэтому его достаточно выключить на папке: всё, что лежит внутри, перестанет и открывать инциденты, и попадать в это число.

Количество неудачных попыток

Этот параметр определяет порог, после которого узел считается недоступным:

  • Диапазон значений: от 1 до 20 попыток
  • Меньшее значение дает более быструю реакцию
  • Большое значение уменьшает количество ложных срабатываний на нестабильных каналах
💡 Наследование настроек

Параметры можно задать на уровне папки, и они автоматически наследуются дочерними узлами. При необходимости любой узел может переопределить унаследованные значения.

Просмотр данных доступности

История доступности открывается на вкладке Ping в карточке узла. Для просмотра используются предустановленные интервалы и произвольный диапазон дат.

Интерфейс просмотра

График доступности

  • Основная линия графика показывает RTT
  • Красные точки обозначают моменты недоступности узла
  • Розовые области показывают пропуски данных
  • Красные треугольники над точками отмечают периоды недоступности с деталями

Выбор временного интервала

В текущем интерфейсе доступны такие интервалы:

Интервал Описание Рекомендуется для
1 час Последний час Оперативного контроля
2 часа Последние 2 часа Недавних событий
4 часа Последние 4 часа Анализа за смену
12 часов Последние 12 часов Анализа за рабочий день
1 день Последние 24 часа Ежедневного анализа
1 неделя Последние 7 дней Еженедельного анализа
1 месяц Последние 30 дней Долгосрочной статистики
Произвольно Пользовательский период Разбора инцидентов

Управление просмотром

Элементы управления

  • Назад / Вперёд - переход между соседними интервалами
  • Обновить - повторная загрузка данных за текущий период
  • Сбросить - возврат к интервалу "1 час"
  • Клик по точке - приближение графика вокруг выбранной точки
⚠️ Оптимизация отображения

Если за выбранный период приходит слишком много точек, система автоматически сокращает серию до наиболее показательных значений. На графике также может появляться баннер с информацией об аппроксимации.

Периоды недоступности

Для режима Ping доступна детальная таблица периодов недоступности узла.

Информационный баннер

Под графиком отображается один из двух баннеров:

  • Зелёный баннер - "За выбранный период не зарегистрировано событий недоступности"
  • Красный баннер - "За выбранный период зарегистрировано N событий недоступности" с кнопкой Подробнее

Таблица периодов недоступности

После нажатия кнопки Подробнее график заменяется таблицей с подробной информацией:

Колонка Описание
Начало периода Дата и время начала недоступности
Конец периода Дата и время восстановления доступности
Длительность Общая продолжительность недоступности

Чтобы вернуться к графику, нажмите кнопку Вернуться в баннере.

Дашборд мониторинга

Сводка по доступности узлов отображается на дашборде мониторинга. В нем используются виджеты Состояние сетевого соединения, Топ-10 по потере пакетов и Топ-10 по сетевому времени отклика.

Подробности о дашборде см. в разделе Дашборды мониторинга.

Рекомендации

Настройка порогов

Выбор количества неудачных попыток

  • Для критичных узлов - используйте меньшее значение (2-3 попытки) для быстрой реакции
  • Для удаленных узлов - используйте большее значение (5-7 попыток), если связь нестабильна
  • Для очень шумных каналов - увеличьте порог до 10 попыток

Анализ данных

Регулярный мониторинг

  • Проверяйте дашборд мониторинга ежедневно
  • Анализируйте периоды недоступности в динамике
  • Обращайте внимание на узлы с высокой потерей пакетов и большим RTT
  • Используйте график для поиска кратковременных провалов и всплесков задержки

Автоматизация реагирования

Настройка инцидентов

  • Включайте автоматическое создание инцидентов для критичных узлов
  • Используйте автозакрытие инцидентов для сокращения ручной работы
  • Проверяйте, что унаследованные настройки на папках соответствуют политике мониторинга
✅ Лучшая практика

Регулярно анализируйте топы по потере пакетов и времени отклика на дашборде. Рост этих значений обычно указывает на проблемы с сетевым оборудованием, перегрузку каналов или нестабильный маршрут до узла.