Мониторинг системных ресурсов

ℹ️ О мониторинге системных ресурсов

Мониторинг системных ресурсов в INFRAX собирает данные о загрузке CPU, использовании RAM, дисках и сетевых интерфейсах. Метрики отображаются в карточке узла и на дашборде мониторинга, а пороговые значения можно связать с автоматическим созданием и закрытием тикетов.

Обзор системы

Секция системных ресурсов в текущем продукте состоит из карточки узла с графиками и вкладки настроек мониторинга. Для серверов и рабочих станций требуется агент, а ping и SSL остаются отдельными проверками.

Что отображается в интерфейсе

  • Загрузка процессора — общая загрузка CPU и, при необходимости, нагрузка по ядрам
  • Загрузка памяти — использование RAM и объем свободной памяти
  • Дисковое пространство — заполнение дисков, время отклика, скорость передачи и IOPS
  • Сетевая активность — общая скорость, прием и передача по интерфейсам
  • История данных — сохранение метрик для графиков и анализа трендов

Где настраивается

  • Вкладка «Мониторинг» — карточки Мониторинг доступности, Загрузка процессора, Загрузка памяти, Дисковое пространство, Мониторинг агента и SSL-сертификаты
  • Параметры мониторинга производительности — отдельные пороги для времени отклика диска, передачи, чтения/записи, IOPS и сетевой активности
  • Наследование — настройки можно задать на уровне папки и применить к дочерним узлам
Проблемы ресурсов и нестабильных сигналов

Система может предложить проблему, когда на одном узле почти одновременно возникли несколько инцидентов процессора, памяти и дисков либо когда один точный сигнал многократно переходит в аварию и обратно. Значения показателей в проблему не копируются: оператор сверяет её состав с графиками и историей переходов. Подробнее: «Автоматическое обнаружение проблем».

⚠️ Требования

Для сбора данных о CPU, RAM, дисках и сети на узлах должны быть установлены агенты мониторинга. Ping и SSL работают без агента.

Мониторинг процессора (CPU)

Вкладка CPU показывает общую загрузку процессора и нагрузку по ядрам, если данные доступны.

Собираемые данные

Метрики CPU

  • Общая загрузка — процент использования процессора
  • Загрузка по ядрам — детальная информация о загрузке каждого ядра
  • История загрузки — временные ряды данных для анализа тренда

Настройка мониторинга CPU

В карточке «Загрузка процессора» задаются порог предупреждения, критический порог, автосоздание тикетов, автозакрытие и количество превышений подряд.

  1. Откройте карточку узла или папки и выберите «Параметры»
  2. Перейдите на вкладку «Настройки триггеров»
  3. В разделе «Загрузка процессора» настройте пороги и создание инцидентов
Параметр Описание
Создавать тикеты при превышении нагрузки Автоматическое создание тикетов при высокой загрузке CPU
Автоматически закрывать тикеты Закрывать тикет, когда загрузка вернется в норму
Порог предупреждения Порог для включения предупреждающего состояния
Критический порог Порог для включения критического состояния
Количество превышений подряд Сколько раз подряд порог должен быть превышен для создания тикета
💡 Наследование настроек

Параметры мониторинга можно наследовать от папок. Общие значения на уровне папки автоматически применяются ко всем вложенным узлам, а для конкретного узла их можно переопределить.

Мониторинг памяти (RAM)

Вкладка RAM показывает использование оперативной памяти узла и помогает вовремя заметить нехватку ресурсов.

Собираемые данные

Метрики RAM

  • Общее использование — процент занятой оперативной памяти
  • Свободная память — количество доступной памяти
  • История использования — временные ряды данных для анализа тренда

Настройка мониторинга RAM

В карточке «Загрузка памяти» задаются те же типы порогов, что и для CPU, но для использования RAM.

  1. Откройте карточку узла или папки и выберите «Параметры»
  2. Перейдите на вкладку «Настройки триггеров»
  3. В разделе «Загрузка памяти» настройте пороги и создание инцидентов
Параметр Описание
Создавать тикеты при превышении нагрузки Автоматическое создание тикетов при высоком использовании памяти
Автоматически закрывать тикеты Закрывать тикет, когда использование памяти вернется в норму
Порог предупреждения Порог для включения предупреждающего состояния
Критический порог Порог для включения критического состояния
Количество превышений подряд Сколько раз подряд порог должен быть превышен для создания тикета

Мониторинг дисков

Система отслеживает состояние дисковой подсистемы: заполнение, время отклика, скорость передачи и IOPS. На дашборде дополнительно показываются отдельные топы по чтению и записи.

Типы метрик дисков

Утилизация

Процент занятого дискового пространства на каждом диске. При превышении порога система может автоматически создать тикет.

Время отклика

Среднее время отклика диска в миллисекундах. Высокое значение обычно указывает на проблемы с дисковой подсистемой.

Скорость передачи

Общая скорость передачи данных на диск и с диска в МБ/с. Для отдельного анализа на дашборде доступны скорости чтения и записи.

IOPS

Количество операций ввода-вывода в секунду. Используется для оценки нагрузки на дисковую подсистему.

Настройка мониторинга дисков

В карточке «Дисковое пространство» задаются пороги заполнения, автосоздание тикетов и автозакрытие при нормализации.

  1. Откройте карточку узла или папки и выберите «Параметры»
  2. Перейдите на вкладку «Настройки триггеров»
  3. В разделе «Дисковое пространство» настройте пороги и создание инцидентов
Параметр Описание
Создавать тикеты при превышении нагрузки Автоматическое создание тикетов при заполнении дисков
Автоматически закрывать тикеты Закрывать тикет, когда заполнение вернется в норму
Порог заполнения диска Порог заполнения для срабатывания триггера

Инцидент заводится отдельно по каждому диску. Пока по диску есть незакрытый инцидент, повторные превышения порога на нём новых инцидентов не создают; другой диск того же узла заводит свой инцидент.

Индивидуальные лимиты для дисков

Для каждого диска узла можно задать индивидуальный лимит заполнения, отличный от общего порога:

  1. В настройках мониторинга дисков откройте раздел «Индивидуальные лимиты дисков»
  2. Для каждого диска укажите свой процент заполнения
  3. Диски без индивидуальных лимитов используют общий порог
💡 Удаление индивидуального лимита

Чтобы вернуть диск к общему порогу, удалите его индивидуальный лимит с помощью кнопки удаления рядом с названием диска.

Мониторинг сети

Система отслеживает сетевую активность на интерфейсах узлов и показывает общую скорость, прием и передачу данных в Мбит/с.

Собираемые данные

Метрики сетевых интерфейсов

  • Общая скорость — суммарная скорость приема и передачи данных
  • Скорость приема — скорость входящего трафика в Мбит/с
  • Скорость передачи — скорость исходящего трафика в Мбит/с
  • История трафика — временные ряды данных для каждого интерфейса

Выбор интерфейса для мониторинга

Если на узле несколько сетевых интерфейсов, вы можете выбрать нужный интерфейс для просмотра его метрик на графиках и в дашборде.

ℹ️ Автоматический сбор данных

Система автоматически собирает данные со всех сетевых интерфейсов узла. Данные по каждому интерфейсу сохраняются отдельно для последующего анализа.

Настройка мониторинга

Настройки мониторинга системных ресурсов доступны для каждого узла и папки в иерархии узлов.

Доступ к настройкам мониторинга

  1. Откройте страницу «Узлы сети» в главном меню
  2. Выберите узел или папку в дереве и откройте карточку
  3. Перейдите в «Параметры → Настройки триггеров»

Карточки мониторинга

Вкладка «Настройки триггеров» показывает отдельные секции для основных сценариев мониторинга:

Стандартные карточки

  • Мониторинг доступности
  • Загрузка процессора
  • Загрузка памяти
  • Дисковое пространство
  • Мониторинг агента
  • SSL-сертификаты

Наследование параметров

  • Параметры, заданные на уровне папки, автоматически применяются ко всем вложенным узлам
  • Для конкретного узла можно переопределить унаследованные параметры
  • Индикатор наследования показывает, откуда взято текущее значение
  • Кнопка сброса возвращает использование унаследованного значения

Параметры мониторинга производительности

Отдельный блок производительности управляет порогами для дисков и сети. Значения по умолчанию можно вернуть кнопкой «Сбросить к настройкам по умолчанию».

Раздел Единица Порог предупреждения Критический порог
Время отклика диска мс 50 500
Скорость передачи данных диска МБ/с 100 500
Скорость чтения/записи диска МБ/с 100 500
IOPS диска IOPS 500 2000
Сетевая активность Мбит/с 100 1000
⚠️ Внимание

Изменение значений по умолчанию доступно только администраторам системы в глобальных настройках приложения.

Просмотр данных мониторинга

Данные мониторинга системных ресурсов доступны через интерфейс узла в виде интерактивных графиков.

Доступ к графикам мониторинга

  1. Откройте страницу «Узлы сети» в главном меню
  2. Выберите узел в дереве
  3. Нажмите кнопку «Мониторинг»
  4. Выберите вкладку с нужным типом данных: «Пинг», «ЦПУ», «ОЗУ», «Диски» или «Сеть»

Управление временным интервалом

Для графиков доступен гибкий выбор периода отображения данных:

Предустановленные интервалы

  • 1 час
  • 2 часа
  • 4 часа
  • 12 часов
  • Сутки
  • Неделя
  • Месяц
  • Задать... — произвольный период с указанием начала и конца

Навигация по данным

Для работы с историческими данными доступны кнопки навигации:

  • Кнопка «Назад» — сдвигает период на такой же интервал назад во времени
  • Кнопка «Вперёд» — сдвигает период на такой же интервал вперед во времени
  • Кнопка «Обновить» — загружает актуальные данные за выбранный период
  • Кнопка «Сбросить» — возвращает последний час данных

Интерактивные возможности графиков

Работа с графиками

  • Клик по графику — приблизить период вокруг выбранной точки
  • Произвольный период — указать точные даты и время начала и конца периода
  • Оптимизация отображения — при большом количестве точек данные автоматически прореживаются для повышения производительности
ℹ️ Аппроксимация данных

Если за выбранный период слишком много точек данных, система автоматически сокращает их количество для быстрого отображения. При этом сохраняются наиболее показательные точки, включая пики и минимумы. Информация об аппроксимации отображается над графиком с указанием исходного и оптимизированного количества точек.

Просмотр метрик дисков

Для просмотра дисковых данных доступны дополнительные опции:

  1. Перейдите на вкладку «Диски»
  2. Выберите интересующую метрику:
    • Утилизация
    • Время отклика
    • Скорость передачи
    • IOPS
  3. Выберите диск из выпадающего списка
  4. График автоматически обновится для выбранной комбинации метрики и диска
💡 Комбинированный график скорости передачи

При выборе метрики «Скорость передачи» отображается комбинированный график с тремя линиями: общая скорость, скорость чтения и скорость записи. Это позволяет оценить характер нагрузки на дисковую подсистему.

Просмотр метрик сети

Для просмотра данных о сетевой активности:

  1. Перейдите на вкладку «Сеть»
  2. Выберите интересующую метрику:
    • Общая скорость
    • Скорость приема
    • Скорость передачи
  3. Выберите сетевой интерфейс из выпадающего списка
  4. График автоматически обновится для выбранной комбинации метрики и интерфейса

Дашборд мониторинга

Сводная информация о системных ресурсах всех узлов доступна на дашборде мониторинга. На нем отображаются виджеты со статусом узлов, бизнес-сервисами, топами по CPU и RAM, показателями дисковой подсистемы, сетевой активностью и событиями мониторинга.

Подробнее о структуре дашборда и всех доступных виджетах читайте в разделе Дашборды мониторинга.

Рекомендации

Настройка порогов

  • Установите пороги CPU и RAM на уровне 85-90% для своевременного выявления проблем
  • Для критически важных серверов можно задать более низкие значения
  • Используйте параметр «Количество превышений подряд», чтобы избежать ложных срабатываний при кратковременных всплесках нагрузки
  • Для разных типов дисков, например системных, data и backup, задавайте индивидуальные лимиты заполнения

Планирование мониторинга

  • Используйте наследование параметров и задавайте общие настройки на уровне папок
  • Для узлов с особыми требованиями переопределяйте параметры индивидуально
  • Регулярно проверяйте дашборд мониторинга для выявления узлов с высокой нагрузкой
  • Следите за узлами с устаревшими версиями агентов и своевременно обновляйте их

Анализ данных

  • Используйте графики за длительные периоды, например неделю или месяц, для выявления трендов и планирования модернизации
  • Обращайте внимание на регулярные пики нагрузки — они могут указывать на плановые задачи, которые можно оптимизировать
  • Высокое время отклика дисков может указывать на необходимость проверки дисковой подсистемы или замены оборудования
  • Следите за ростом сетевого трафика — он может указывать на изменение паттернов использования системы

Автоматизация реагирования

  • Включайте автоматическое создание тикетов для критически важных узлов
  • Используйте автоматическое закрытие тикетов, чтобы сократить количество ложных инцидентов
  • Настройте правила SLA для тикетов мониторинга с учетом критичности узлов
  • Для тестовых и dev-окружений можно отключить создание тикетов

Производительность системы

  • Регулярно просматривайте разделы дашборда с производительностью дисков — высокие IOPS или время отклика могут быть признаками узких мест
  • Если скорость чтения или записи постоянно близка к максимальной пропускной способности, рассмотрите возможность масштабирования дисковой подсистемы
  • Используйте графики сетевой активности для планирования пропускной способности каналов связи
⚠️ Важно

Мониторинг системных ресурсов — это инструмент для проактивного управления инфраструктурой. Регулярный анализ данных мониторинга позволяет предотвращать проблемы до того, как они повлияют на работу пользователей.