Автоматическое обнаружение проблем
Алгоритм не устанавливает причину автоматически. Он находит события, которые совпадают по объекту, сети и времени, и сразу создаёт обычную проблему в состоянии «Новая». Отдельного объекта-предложения нет. Оператор проверяет состав созданной проблемы, после чего принимает её в работу либо отклоняет.
Где находятся настройки
Откройте Настройки → Обнаружение проблем. Раздел доступен пользователям с правом работы с соответствующим разделом настроек.
В поставку входят готовые алгоритмы и по одной действующей начальной настройке для каждого из них. Начальная область — вся установка, без заранее выбранного проекта. Чтобы алгоритм выполнялся, для него должна существовать хотя бы одна настройка. Можно создать несколько настроек одного алгоритма, например с разными проектами или порогами. Удаление настройки прекращает её дальнейшие проверки, но не удаляет ранее созданные проблемы и историю.
Здесь настраивается
Какие события искать, в каких проектах, сколько совпадений нужно и за какой период.
Здесь не настраивается
Важность и режим соглашения об уровне обслуживания для автоматических тикетов. Они задаются в «SLA → Автоматические тикеты».
Пустое поле проектов означает всю установку. При обычном распределении каждый проект проверяется отдельно, и проблема создаётся в проекте своих инцидентов. События разных проектов не смешиваются.
Параметры простыми словами
| Параметр | Что он означает | Пример |
|---|---|---|
| Минимальное число | Сколько разных узлов или инцидентов нужно, чтобы создать проблему | Значение 3: два события недостаточны, третье запускает объединение |
| Период одновременности | Насколько близко по времени должны начаться события | 60 секунд: события в 10:00:00 и 10:00:45 считаются одной группой |
| Срок пополнения проблемы | Как долго после первого срабатывания добавлять новые подходящие события без повторного набора минимального числа | 600 секунд: следующий подходящий инцидент через пять минут войдёт в уже созданную проблему |
| Стабильная работа после восстановления | Сколько времени сигнал должен оставаться в норме, чтобы восстановление считалось настоящим | 600 секунд: краткое возвращение в норму не завершает нестабильность |
| Допустимая разница времени начала | Насколько могут отличаться моменты начала двух проблем, чтобы связать их общей проблемой сети | 600 секунд: разница до десяти минут допустима |
Период одновременности отвечает на вопрос «создавать ли новую проблему», а срок пополнения — «добавлять ли событие в уже созданную». Не увеличивайте оба значения без необходимости: слишком широкие периоды могут объединить независимые сбои.
Алгоритмы и начальные значения
Начальные значения подходят как отправная точка. Перед изменением оцените обычную частоту событий именно в вашей инфраструктуре.
| Алгоритм | Что объединяет | Начальные значения |
|---|---|---|
| Одновременная недоступность узлов | Инциденты проверки доступности не менее чем на трёх разных узлах одной точно заданной сети | 3 узла; 60 секунд на совпадение; 600 секунд на пополнение |
| Агенты не установлены | Узлы, с которых агент ещё ни разу не передавал данные после отведённого времени на установку; только результаты одной проверки | 3 узла; проверка длительностью 60 секунд; 600 секунд на пополнение |
| Недоступны ранее работавшие агенты | Потерю связи с агентами, которые раньше отвечали, в одном проекте и одной точно заданной сети | 3 агента; 60 секунд на совпадение; 600 секунд на пополнение |
| Нестабильный сигнал мониторинга | Повторные переходы одного и того же сигнала узла в аварию и обратно: доступность, агент, процессор, память или конкретный диск | 3 срабатывания и 2 восстановления за 1800 секунд; 600 секунд устойчивой нормы; 86400 секунд на пополнение |
| Одновременные нарушения ресурсов узла | Инциденты процессора, памяти и конкретных дисков одного узла, возникшие почти одновременно | 3 инцидента; 2 группы ресурсов; 300 секунд на совпадение; 600 секунд на пополнение |
| Общий сбой сетевой доступности | Уже созданные проблемы недоступности узлов и ранее работавших агентов одной сети; создаёт вышестоящую проблему в проекте этой сети | До 600 секунд между началом проблем; 1200 секунд на пополнение общей проблемы |
Как разбирать срабатывания
Одновременная недоступность узлов
Совпадение говорит, что несколько узлов одной сети перестали отвечать почти одновременно. Проверьте саму сеть, шлюз, питание сетевого оборудования, недавние изменения и доступность узлов из другой точки. Не делайте вывод о неисправности маршрутизатора только по названию проблемы.
Агенты не установлены
Эта проблема означает отсутствие первых данных агента, а не потерю ранее работавшей связи. Проверьте, должны ли агенты быть установлены на этих узлах. Установите их там, где контроль нужен, либо отключите требование там, где агент не предусмотрен.
Недоступны ранее работавшие агенты
Агенты раньше передавали данные, а затем перестали. Проверьте доступность узлов, службу агента, сертификаты и сетевые ограничения. Не смешивайте этот случай с узлами, на которых агент никогда не работал.
Нестабильный сигнал мониторинга
Система учитывает переходы одного точного сигнала, а не просто похожие названия. Изучите историю переходов, сравните её с нагрузкой и изменениями, затем дождитесь устойчивой нормы. Частые короткие срабатывания могут указывать на неверный порог наблюдения, но менять его следует только после проверки реального поведения объекта.
Одновременные нарушения ресурсов узла
Несколько ресурсных инцидентов на одном узле могут быть следствием одной нагрузки, нехватки ёмкости или зависшего процесса. Сравните процессор и память с конкретными дисками, найдите общий момент начала и проверьте процессы, очередь ввода-вывода и свободное место.
Общий сбой сетевой доступности
Система нашла совпадающие по сети и времени проблемы доступности узлов и агентов. Откройте всю ветвь и сравните их состав. Общая сеть подтверждает область, в которой следует искать, но не указывает конкретное устройство или физическую причину.
Как менять настройки
- Начните с поставляемых значений и соберите примеры правильных и ложных срабатываний.
- Ограничьте область проектами, если в разных частях инфраструктуры различаются масштабы и обычная частота событий.
- Повышайте минимальное число, если малые группы часто не имеют общей причины. Понижайте его только тогда, когда важны небольшие группы и оператор готов проверять больше автоматически созданных проблем.
- Увеличивайте период одновременности только если связанные события действительно приходят с задержкой.
- Выбирайте срок пополнения по обычной длительности одной волны отказа. Он не является временем автоматического закрытия.
- После изменения проверьте состояние последнего запуска и новые автоматически созданные проблемы в Helpdesk.
Несколько настроек могут охватывать одни и те же проекты и события. Если система не может однозначно выбрать состав, последняя проверка будет отмечена как конфликт. Разделяйте области действия или пороги так, чтобы назначение каждой настройки было понятно.
Изменение настройки не переписывает уже созданные проблемы. Их состав и история сохраняются; новые проверки используют актуальные значения.
Состояние последней проверки
| Состояние | Что означает | Что делать |
|---|---|---|
| Ещё не запускалась | Настройка сохранена, но проверка ещё не завершалась | Дождитесь следующего запуска |
| Совпадений нет | Проверка прошла, но порог не достигнут | Действие не требуется |
| Срабатывание | Найден состав и создана либо дополнена проблема | Откройте созданную проблему и проверьте её состав |
| Конфликт настроек | Подходящие настройки пересеклись так, что результат нельзя выбрать однозначно | Разведите области или условия |
| Ошибка | Проверка не завершилась | Передайте время и название настройки администратору, проверьте журнал приложения |
Внешние уведомления могут быть немного отложены, чтобы система собрала одну понятную сводку вместо множества сообщений. Сам инцидент и проблема появляются в Helpdesk сразу после обработки.