Мониторинг доступности
В текущем продукте мониторинг доступности вынесен в отдельную вкладку Ping на карточке узла. Система отправляет ICMP-запросы, измеряет RTT, фиксирует периоды недоступности, сохраняет историю и может автоматически создавать и закрывать инциденты при восстановлении связи.
Обзор системы
Мониторинг доступности в INFRAX - это базовый режим контроля сетевых узлов. Он доступен для любого узла, даже если на нем не установлен агент.
Что делает Ping-мониторинг
- Проверяет доступность узла - периодически отправляет ICMP Echo Request
- Измеряет RTT - показывает задержку ответа в миллисекундах
- Фиксирует простои - отмечает интервалы, когда узел не отвечал на запросы
- Создает инциденты - по достижении порога неудачных попыток
- Закрывает инциденты автоматически - после восстановления доступности
- Поддерживает наследование - настройки можно задать на папке и применить ко всем вложенным узлам
Если несколько разных узлов одной точно заданной сети перестают отвечать почти одновременно, алгоритм может предложить общую проблему. По начальным настройкам нужны 3 узла за 60 секунд. Совпадение указывает на общую область сбоя, но не устанавливает неисправное устройство. Условия и действия оператора описаны в статье «Автоматическое обнаружение проблем».
Ping-мониторинг
Вкладка Ping показывает историю доступности узла. Основная линия графика отражает RTT, а маркеры и баннеры помогают быстро найти периоды недоступности.
Измеряемые параметры
| Параметр | Описание | Единица измерения |
|---|---|---|
| Доступность | Состояние узла online/offline | Логическое значение |
| Время отклика (RTT) | Задержка ответа на ping | Миллисекунды (мс) |
| Периоды недоступности | Интервалы, в которые узел не отвечал | История событий |
Как работает проверка
- Система периодически отправляет ping-запросы к узлу
- При ответе фиксируется RTT
- Если узел не отвечает, счетчик неудачных попыток увеличивается
- При превышении порога узел помечается как недоступный
- Все данные сохраняются в истории и используются в таблице периодов недоступности
Узлы на площадке
Узлы, отнесённые к площадке, опрашивает не сервер INFRAX, а шлюз этой площадки — изнутри её сети. Благодаря этому в мониторинг не попадают чужие машины с такими же частными адресами, а время отклика измеряется рядом с узлом: задержка канала до площадки в него не добавляется. Проверки сервера INFRAX и проверки площадок идут параллельно, поэтому общий проход мониторинга не удлиняется.
Когда шлюз площадки теряет связь, её узлы помечаются недоступными — дотянуться до них действительно нечем, — но инцидент создаётся один — на саму площадку, а не на каждый узел за шлюзом. Заголовок такого инцидента: «Площадка {siteTitle} недоступна», первое сообщение — «Площадка {siteTitle} недоступна: связь с её шлюзом потеряна, узлы площадки не опрашиваются ({failCount} последовательных проверок)». Используются те же пороги и та же настройка создания инцидентов, что и для обычных узлов.
- В дереве Узлы сети у таких узлов вместо обычной пометки Недоступен появляется отдельный значок с подсказкой «Нет транспорта до площадки «{site}»: подключиться к этому узлу нельзя, мониторинг и удалённый доступ по нему не работают.»
- Из-за одной упавшей площадки папки выше не получают пометку с числом недоступных узлов внутри («Недоступных узлов внутри: N») — такие узлы в этот признак не входят
- История задержек за время недоступности не пишется: измерения не было, поэтому на графике будет разрыв, а не полка нулей
- Когда связь восстановится, инцидент закрывается автоматически на общих условиях, а в него добавляется сообщение «Связь с площадкой восстановлена, опрос её узлов продолжен ({successCount} последовательных успешных проверок)»
Если состояние площадок установить не удалось (над деревом появляется строка «Сервис sitelink-hub недоступен, поэтому неизвестно, какие шлюзы площадок на связи. Дерево и его узлы взяты из базы данных.»), состояния узлов не меняются и инциденты не создаются: ничего не установлено, а не «всё офлайн». Не заводится инцидент и по площадке в статусе Ожидает подключения или Отозвана — это не авария. Подробнее — в разделе Работа с узлами площадки.
Настройка мониторинга
Графики доступности находятся на вкладке «Мониторинг» карточки узла. Порог срабатывания и создание инцидентов настраиваются отдельно: «Параметры → Настройки триггеров → Мониторинг доступности».
Доступ к настройкам
- Откройте карточку узла и выберите «Параметры»
- Откройте вкладку «Настройки триггеров»
- Найдите секцию «Мониторинг доступности»
Параметры настройки
Инциденты
Система может автоматически реагировать на потерю доступности узла:
- Создавать инцидент - включение и отключение автоматического создания инцидентов
- Автозакрытие инцидента - закрытие инцидента после восстановления доступности
Порог неудачных проверок используется и при восстановлении. Например, при значении 3 инцидент создаётся после трёх неудачных проверок подряд, а закрывается после трёх последовательных успешных проверок. Это защищает от преждевременного закрытия при кратком ответе узла.
Узлы, которые выключают намеренно
Выключенный параметр Создавать инцидент означает, что недоступность узла ожидаема: так помечают машины, которые выключают на ночь, резервное оборудование, тестовые стенды. Дерево Узлы сети показывает такие узлы иначе:
- отметка недоступности у самого узла остаётся, но выглядит приглушённо, а её подсказка говорит «Недоступен; инцидент по этому узлу не открывается»;
- в значке папки, подсказка которого называет число недоступных узлов внутри («Недоступных узлов внутри: N»), такие узлы не учитываются — папка, где все машины выключены намеренно, этого значка не показывает вовсе.
Параметр наследуется, поэтому его достаточно выключить на папке: всё, что лежит внутри, перестанет и открывать инциденты, и попадать в это число.
Количество неудачных попыток
Этот параметр определяет порог, после которого узел считается недоступным:
- Диапазон значений: от 1 до 20 попыток
- Меньшее значение дает более быструю реакцию
- Большое значение уменьшает количество ложных срабатываний на нестабильных каналах
Параметры можно задать на уровне папки, и они автоматически наследуются дочерними узлами. При необходимости любой узел может переопределить унаследованные значения.
Просмотр данных доступности
История доступности открывается на вкладке Ping в карточке узла. Для просмотра используются предустановленные интервалы и произвольный диапазон дат.
Интерфейс просмотра
График доступности
- Основная линия графика показывает RTT
- Красные точки обозначают моменты недоступности узла
- Розовые области показывают пропуски данных
- Красные треугольники над точками отмечают периоды недоступности с деталями
Выбор временного интервала
В текущем интерфейсе доступны такие интервалы:
| Интервал | Описание | Рекомендуется для |
|---|---|---|
| 1 час | Последний час | Оперативного контроля |
| 2 часа | Последние 2 часа | Недавних событий |
| 4 часа | Последние 4 часа | Анализа за смену |
| 12 часов | Последние 12 часов | Анализа за рабочий день |
| 1 день | Последние 24 часа | Ежедневного анализа |
| 1 неделя | Последние 7 дней | Еженедельного анализа |
| 1 месяц | Последние 30 дней | Долгосрочной статистики |
| Произвольно | Пользовательский период | Разбора инцидентов |
Управление просмотром
Элементы управления
- Назад / Вперёд - переход между соседними интервалами
- Обновить - повторная загрузка данных за текущий период
- Сбросить - возврат к интервалу "1 час"
- Клик по точке - приближение графика вокруг выбранной точки
Если за выбранный период приходит слишком много точек, система автоматически сокращает серию до наиболее показательных значений. На графике также может появляться баннер с информацией об аппроксимации.
Периоды недоступности
Для режима Ping доступна детальная таблица периодов недоступности узла.
Информационный баннер
Под графиком отображается один из двух баннеров:
- Зелёный баннер - "За выбранный период не зарегистрировано событий недоступности"
- Красный баннер - "За выбранный период зарегистрировано N событий недоступности" с кнопкой Подробнее
Таблица периодов недоступности
После нажатия кнопки Подробнее график заменяется таблицей с подробной информацией:
| Колонка | Описание |
|---|---|
| Начало периода | Дата и время начала недоступности |
| Конец периода | Дата и время восстановления доступности |
| Длительность | Общая продолжительность недоступности |
Чтобы вернуться к графику, нажмите кнопку Вернуться в баннере.
Дашборд мониторинга
Сводка по доступности узлов отображается на дашборде мониторинга. В нем используются виджеты Состояние сетевого соединения, Топ-10 по потере пакетов и Топ-10 по сетевому времени отклика.
Подробности о дашборде см. в разделе Дашборды мониторинга.
Рекомендации
Настройка порогов
Выбор количества неудачных попыток
- Для критичных узлов - используйте меньшее значение (2-3 попытки) для быстрой реакции
- Для удаленных узлов - используйте большее значение (5-7 попыток), если связь нестабильна
- Для очень шумных каналов - увеличьте порог до 10 попыток
Анализ данных
Регулярный мониторинг
- Проверяйте дашборд мониторинга ежедневно
- Анализируйте периоды недоступности в динамике
- Обращайте внимание на узлы с высокой потерей пакетов и большим RTT
- Используйте график для поиска кратковременных провалов и всплесков задержки
Автоматизация реагирования
Настройка инцидентов
- Включайте автоматическое создание инцидентов для критичных узлов
- Используйте автозакрытие инцидентов для сокращения ручной работы
- Проверяйте, что унаследованные настройки на папках соответствуют политике мониторинга
Регулярно анализируйте топы по потере пакетов и времени отклика на дашборде. Рост этих значений обычно указывает на проблемы с сетевым оборудованием, перегрузку каналов или нестабильный маршрут до узла.