Автоматическое обнаружение проблем

Как читать результат

Алгоритм не устанавливает причину автоматически. Он находит события, которые совпадают по объекту, сети и времени, и сразу создаёт обычную проблему в состоянии «Новая». Отдельного объекта-предложения нет. Оператор проверяет состав созданной проблемы, после чего принимает её в работу либо отклоняет.

Где находятся настройки

Откройте Настройки → Обнаружение проблем. Раздел доступен пользователям с правом работы с соответствующим разделом настроек.

В поставку входят готовые алгоритмы и по одной действующей начальной настройке для каждого из них. Начальная область — вся установка, без заранее выбранного проекта. Чтобы алгоритм выполнялся, для него должна существовать хотя бы одна настройка. Можно создать несколько настроек одного алгоритма, например с разными проектами или порогами. Удаление настройки прекращает её дальнейшие проверки, но не удаляет ранее созданные проблемы и историю.

Здесь настраивается

Какие события искать, в каких проектах, сколько совпадений нужно и за какой период.

Здесь не настраивается

Важность и режим соглашения об уровне обслуживания для автоматических тикетов. Они задаются в «SLA → Автоматические тикеты».

Пустое поле проектов означает всю установку. При обычном распределении каждый проект проверяется отдельно, и проблема создаётся в проекте своих инцидентов. События разных проектов не смешиваются.

Параметры простыми словами

ПараметрЧто он означаетПример
Минимальное числоСколько разных узлов или инцидентов нужно, чтобы создать проблемуЗначение 3: два события недостаточны, третье запускает объединение
Период одновременностиНасколько близко по времени должны начаться события60 секунд: события в 10:00:00 и 10:00:45 считаются одной группой
Срок пополнения проблемыКак долго после первого срабатывания добавлять новые подходящие события без повторного набора минимального числа600 секунд: следующий подходящий инцидент через пять минут войдёт в уже созданную проблему
Стабильная работа после восстановленияСколько времени сигнал должен оставаться в норме, чтобы восстановление считалось настоящим600 секунд: краткое возвращение в норму не завершает нестабильность
Допустимая разница времени началаНасколько могут отличаться моменты начала двух проблем, чтобы связать их общей проблемой сети600 секунд: разница до десяти минут допустима
Два разных времени

Период одновременности отвечает на вопрос «создавать ли новую проблему», а срок пополнения — «добавлять ли событие в уже созданную». Не увеличивайте оба значения без необходимости: слишком широкие периоды могут объединить независимые сбои.

Алгоритмы и начальные значения

Начальные значения подходят как отправная точка. Перед изменением оцените обычную частоту событий именно в вашей инфраструктуре.

АлгоритмЧто объединяетНачальные значения
Одновременная недоступность узлов Инциденты проверки доступности не менее чем на трёх разных узлах одной точно заданной сети 3 узла; 60 секунд на совпадение; 600 секунд на пополнение
Агенты не установлены Узлы, с которых агент ещё ни разу не передавал данные после отведённого времени на установку; только результаты одной проверки 3 узла; проверка длительностью 60 секунд; 600 секунд на пополнение
Недоступны ранее работавшие агенты Потерю связи с агентами, которые раньше отвечали, в одном проекте и одной точно заданной сети 3 агента; 60 секунд на совпадение; 600 секунд на пополнение
Нестабильный сигнал мониторинга Повторные переходы одного и того же сигнала узла в аварию и обратно: доступность, агент, процессор, память или конкретный диск 3 срабатывания и 2 восстановления за 1800 секунд; 600 секунд устойчивой нормы; 86400 секунд на пополнение
Одновременные нарушения ресурсов узла Инциденты процессора, памяти и конкретных дисков одного узла, возникшие почти одновременно 3 инцидента; 2 группы ресурсов; 300 секунд на совпадение; 600 секунд на пополнение
Общий сбой сетевой доступности Уже созданные проблемы недоступности узлов и ранее работавших агентов одной сети; создаёт вышестоящую проблему в проекте этой сети До 600 секунд между началом проблем; 1200 секунд на пополнение общей проблемы

Как разбирать срабатывания

Одновременная недоступность узлов

Совпадение говорит, что несколько узлов одной сети перестали отвечать почти одновременно. Проверьте саму сеть, шлюз, питание сетевого оборудования, недавние изменения и доступность узлов из другой точки. Не делайте вывод о неисправности маршрутизатора только по названию проблемы.

Агенты не установлены

Эта проблема означает отсутствие первых данных агента, а не потерю ранее работавшей связи. Проверьте, должны ли агенты быть установлены на этих узлах. Установите их там, где контроль нужен, либо отключите требование там, где агент не предусмотрен.

Недоступны ранее работавшие агенты

Агенты раньше передавали данные, а затем перестали. Проверьте доступность узлов, службу агента, сертификаты и сетевые ограничения. Не смешивайте этот случай с узлами, на которых агент никогда не работал.

Нестабильный сигнал мониторинга

Система учитывает переходы одного точного сигнала, а не просто похожие названия. Изучите историю переходов, сравните её с нагрузкой и изменениями, затем дождитесь устойчивой нормы. Частые короткие срабатывания могут указывать на неверный порог наблюдения, но менять его следует только после проверки реального поведения объекта.

Одновременные нарушения ресурсов узла

Несколько ресурсных инцидентов на одном узле могут быть следствием одной нагрузки, нехватки ёмкости или зависшего процесса. Сравните процессор и память с конкретными дисками, найдите общий момент начала и проверьте процессы, очередь ввода-вывода и свободное место.

Общий сбой сетевой доступности

Система нашла совпадающие по сети и времени проблемы доступности узлов и агентов. Откройте всю ветвь и сравните их состав. Общая сеть подтверждает область, в которой следует искать, но не указывает конкретное устройство или физическую причину.

Как менять настройки

  1. Начните с поставляемых значений и соберите примеры правильных и ложных срабатываний.
  2. Ограничьте область проектами, если в разных частях инфраструктуры различаются масштабы и обычная частота событий.
  3. Повышайте минимальное число, если малые группы часто не имеют общей причины. Понижайте его только тогда, когда важны небольшие группы и оператор готов проверять больше автоматически созданных проблем.
  4. Увеличивайте период одновременности только если связанные события действительно приходят с задержкой.
  5. Выбирайте срок пополнения по обычной длительности одной волны отказа. Он не является временем автоматического закрытия.
  6. После изменения проверьте состояние последнего запуска и новые автоматически созданные проблемы в Helpdesk.
Пересекающиеся настройки

Несколько настроек могут охватывать одни и те же проекты и события. Если система не может однозначно выбрать состав, последняя проверка будет отмечена как конфликт. Разделяйте области действия или пороги так, чтобы назначение каждой настройки было понятно.

Изменение настройки не переписывает уже созданные проблемы. Их состав и история сохраняются; новые проверки используют актуальные значения.

Состояние последней проверки

СостояниеЧто означаетЧто делать
Ещё не запускаласьНастройка сохранена, но проверка ещё не завершаласьДождитесь следующего запуска
Совпадений нетПроверка прошла, но порог не достигнутДействие не требуется
СрабатываниеНайден состав и создана либо дополнена проблемаОткройте созданную проблему и проверьте её состав
Конфликт настроекПодходящие настройки пересеклись так, что результат нельзя выбрать однозначноРазведите области или условия
ОшибкаПроверка не завершиласьПередайте время и название настройки администратору, проверьте журнал приложения

Внешние уведомления могут быть немного отложены, чтобы система собрала одну понятную сводку вместо множества сообщений. Сам инцидент и проблема появляются в Helpdesk сразу после обработки.