Телефон: 8-800-350-22-65
Напишите нам:
MAX:
WhatsApp:
Telegram:
Прием заявок круглосуточно
График работы офиса: с 9:00 до 21:00 Нск (с 5:00 до 19:00 Мск)

Статья опубликована в рамках: CXXVII Международной научно-практической конференции «Экспериментальные и теоретические исследования в современной науке» (Россия, г. Новосибирск, 29 июля 2026 г.)

Наука: Технические науки

Скачать книгу(-и): Сборник статей конференции

Библиографическое описание:
Емелин С.В. МНОГОЭТАПНЫЙ АЛГОРИТМ ОБРАБОТКИ ИНЦИДЕНТОВ ПРИ МОНИТОРИНГЕ СЕТЕВОГО ОБОРУДОВАНИЯ // Экспериментальные и теоретические исследования в современной науке: сб. ст. по матер. CXXVII междунар. науч.-практ. конф. № 7(119). – Новосибирск: СибАК, 2026. – С. 73-77.
Проголосовать за статью
Дипломы участников
У данной статьи нет
дипломов

МНОГОЭТАПНЫЙ АЛГОРИТМ ОБРАБОТКИ ИНЦИДЕНТОВ ПРИ МОНИТОРИНГЕ СЕТЕВОГО ОБОРУДОВАНИЯ

Емелин Сергей Васильевич

студент, Московский государственный технологический университет «СТАНКИН»,

РФ, г. Москва

MULTI-STAGE INCIDENT PROCESSING ALGORITHM FOR NETWORK EQUIPMENT MONITORING

 

Emelin Sergei Vasilievich

Student, Moscow State University of Technology "STANKIN",

 Russia, Moscow

 

АННОТАЦИЯ

Цель: повышение достоверности учёта простоев сетевого оборудования промышленного предприятия. Метод: функциональное моделирование в нотациях IDEF0 и BPMN 2.0, сравнительный анализ систем мониторинга. Результат: разработан алгоритм из трёх этапов — временной селекции, топологической корреляции и иерархической классификации причин. Выводы: применение этапов снижает объём избыточных уведомлений и повышает достоверность расчёта показателей надёжности.

ABSTRACT

Background: improving the reliability of downtime accounting for the network equipment of an industrial enterprise. Methods: functional modelling using the IDEF0 and BPMN 2.0 notations, comparative analysis of monitoring systems. Result: a three-stage algorithm has been developed, comprising temporal selection, topological correlation and hierarchical classification of causes. Conclusion: applying the stages reduces the volume of redundant notifications and improves the reliability of the calculated availability indicators.

 

Ключевые слова: учёт простоев; мониторинг сетевого оборудования; корреляция событий; классификация инцидентов; надёжность инфраструктуры.

Keywords: downtime accounting; network equipment monitoring; event correlation; incident classification; infrastructure reliability.

 

Сетевая инфраструктура промышленного предприятия выполняет функцию транспортного уровня для информационных потоков корпоративного сегмента, технологических сетей автоматизированных систем управления и телеметрии. Непрерывность процессов добычи предъявляет к её доступности повышенные требования: кратковременный простой узла способен нарушить координацию производственных циклов на удалённых объектах [1, с. 24].

Штатные средства мониторинга фиксируют лишь состояние «доступен — недоступен», чего недостаточно для полноценного учёта простоев по трём причинам. Во-первых, кратковременные потери связи при плановой перезагрузке или колебаниях питания регистрируются как отказы и искажают статистику доступности. Во-вторых, отказ магистрального узла порождает лавину уведомлений от подчинённых устройств, среди которых персоналу требуется самостоятельно отыскать первопричину. В-третьих, недоступность фиксируется без указания причины, вследствие чего данные малопригодны для анализа надёжности [2, с. 312].

Целью работы является разработка алгоритма многоэтапной обработки инцидентов, преобразующего поток разрозненных событий мониторинга в структурированную запись о простое. Материалом исследования послужила сетевая инфраструктура ПАО «Сургутнефтегаз» — тысячи устройств, географически распределённых и частично эксплуатируемых в агрессивной среде. Применялись методы структурного функционального моделирования в нотации IDEF0 и процессного моделирования в нотации BPMN 2.0, а также сравнительный анализ систем мониторинга [3, с. 8; 4, с. 61].

В качестве источников первичных данных рассматривались Zabbix, Nagios и Cisco Prime Infrastructure. Все три решения фиксируют факт недоступности, но не классифицируют причины простоя, а определение корневого узла реализовано лишь частично и привязано к оборудованию одного производителя. Базовым источником данных выбран Zabbix, сочетающий мультивендорную поддержку, масштабируемость и возможность работы в замкнутом контуре предприятия [5, с. 47]. Недостающая функциональность реализуется разработанным алгоритмом.

Алгоритм включает три последовательных этапа, каждый из которых сокращает объём передаваемых далее данных. Порядок этапов определяется возрастанием стоимости обработки: простые проверки выполняются первыми и отсеивают большинство событий, а ресурсоёмкая экспертная верификация — последней.

Этап временной селекции исключает из учёта события, не являющиеся отказами. При потере связи запись об инциденте не создаётся немедленно: система выполняет серию повторных проверок доступности в пределах защитного интервала. Если устройство восстанавливает работоспособность, событие классифицируется как ложный простой и исключается из расчёта показателей доступности. Интервал зависит от характеристик канала связи: для спутниковых линий он больше, чем для волоконно-оптических.

Этап топологической корреляции выявляет первопричину при одновременной потере связи с группой устройств: алгоритм проверяет иерархию сети от вышестоящих узлов к нижестоящим, и при подтверждении недоступности вышестоящего узла зависимые устройства объединяются в единый инцидент вместо отдельных уведомлений. Это предотвращает генерацию десятков дублирующих заявок при отказе магистрального коммутатора [6, с. 402].

Этап иерархической классификации присваивает инциденту категорию причины. Автоматическая часть анализирует системные сообщения устройства: при обнаружении диагностических кодов, указывающих на перегрев, отказ модуля памяти или потерю питания, присваивается категория аппаратного сбоя. Если связь прерывается без диагностических сообщений, инцидент переводится в состояние ожидания ручной классификации, и администратор выбирает причину из справочника. Критерии всех этапов обработки приведены в таблице 1.

Таблица 1.

Матрица критериев обработки и классификации инцидентов

Этап алгоритма

Технический признак

Результирующая категория

Механизм обработки

Временная селекция

Восстановление связи в пределах защитного интервала

Ложный простой

Запись в журнал диагностики, исключение из аналитики

Топологическая корреляция

Недоступность вышестоящего узла

Дублирующий инцидент

Включение в основной инцидент без отдельных уведомлений

Иерархическая классификация

Наличие диагностических кодов устройства

Аппаратный сбой

Автоматическое присвоение категории и регистрация

Ручная верификация

Отсутствие диагностических кодов

Внешнее повреждение или ошибка конфигурации

Выбор причины администратором из справочника

 

Алгоритм реализуется в составе функциональной модели учёта простоев. Статическая структура описана в нотации IDEF0: входами служат метрики мониторинга, записи системных журналов и обращения пользователей; управлением — регламенты эксплуатации и соглашения об уровне обслуживания; выходом — верифицированная запись об инциденте и отчётность. Динамика взаимодействия описана в нотации BPMN 2.0: событие задержки реализует защитный интервал, эксклюзивные шлюзы — логику корреляции, а граничное событие таймера контролирует нормативный срок восстановления и инициирует эскалацию [7, с. 118; 8].

На основании верифицированных записей, из которых исключены ложные простои и дублирующие инциденты, вычисляются коэффициент готовности и среднее время восстановления. Достоверность показателей определяется качеством первых двух этапов: без отсева ложных срабатываний коэффициент готовности занижается, а без корреляции среднее время восстановления искажается многократным учётом одного отказа.

Функциональный анализ выявил два ограничения: при каскадных отказах растёт объём событий, требующих ручной классификации, а ценность статистики зависит от дисциплины заполнения справочника причин — выбор обобщённой категории обесценивает анализ. Влияние обоих факторов снижается расширением библиотеки шаблонов автоматической классификации.

Предложенный алгоритм преобразует поток технических событий в структурированные записи о простоях. Последовательное применение трёх этапов позволяет исключить ложные срабатывания, объединить зависимые отказы в единый инцидент и обеспечить обязательное указание причины. Решение аппаратно-независимо, что допускает применение в гетерогенной сетевой среде, а повышение достоверности статистики создаёт основу для планирования модернизации инфраструктуры.

 

Список литературы:

  1. Олифер В.Г., Олифер Н.А. Компьютерные сети. Принципы, технологии, протоколы. — СПб.: Питер, 2022. — 992 с.
  2. Limoncelli T.A. The Practice of System and Network Administration. — Boston: Addison-Wesley, 2020. — 1104 p.
  3. ГОСТ 34.601-90. Информационная технология. Комплекс стандартов на автоматизированные системы. Автоматизированные системы. Стадии создания. — М.: Стандартинформ, 2020. — 15 с.
  4. Тельнов Ю.Ф. Инжиниринг предприятия и моделирование бизнес-процессов. — М.: ИНФРА-М, 2025. — 340 с.
  5. Iton R. Zabbix 7 IT Infrastructure Monitoring Cookbook. — Birmingham: Packt Publishing, 2024. — 350 p.
  6. Tanenbaum A.S. Computer Networks. — Harlow: Pearson, 2021. — 944 p.
  7. Репин В.В. Моделирование бизнес-процессов в нотации BPMN. — М.: Инфра-Инженерия, 2023. — 256 с.
  8. BPMN 2.0 Specification [Электронный ресурс]. — URL: https://www.omg.org/spec/BPMN/2.0/ (дата обращения: 29.07.2026).
Проголосовать за статью
Дипломы участников
У данной статьи нет
дипломов