Статья опубликована в рамках: CXXVII Международной научно-практической конференции «Экспериментальные и теоретические исследования в современной науке» (Россия, г. Новосибирск, 29 июля 2026 г.)
Наука: Технические науки
Скачать книгу(-и): Сборник статей конференции
дипломов
МНОГОЭТАПНЫЙ АЛГОРИТМ ОБРАБОТКИ ИНЦИДЕНТОВ ПРИ МОНИТОРИНГЕ СЕТЕВОГО ОБОРУДОВАНИЯ
MULTI-STAGE INCIDENT PROCESSING ALGORITHM FOR NETWORK EQUIPMENT MONITORING
Emelin Sergei Vasilievich
Student, Moscow State University of Technology "STANKIN",
Russia, Moscow
АННОТАЦИЯ
Цель: повышение достоверности учёта простоев сетевого оборудования промышленного предприятия. Метод: функциональное моделирование в нотациях IDEF0 и BPMN 2.0, сравнительный анализ систем мониторинга. Результат: разработан алгоритм из трёх этапов — временной селекции, топологической корреляции и иерархической классификации причин. Выводы: применение этапов снижает объём избыточных уведомлений и повышает достоверность расчёта показателей надёжности.
ABSTRACT
Background: improving the reliability of downtime accounting for the network equipment of an industrial enterprise. Methods: functional modelling using the IDEF0 and BPMN 2.0 notations, comparative analysis of monitoring systems. Result: a three-stage algorithm has been developed, comprising temporal selection, topological correlation and hierarchical classification of causes. Conclusion: applying the stages reduces the volume of redundant notifications and improves the reliability of the calculated availability indicators.
Ключевые слова: учёт простоев; мониторинг сетевого оборудования; корреляция событий; классификация инцидентов; надёжность инфраструктуры.
Keywords: downtime accounting; network equipment monitoring; event correlation; incident classification; infrastructure reliability.
Сетевая инфраструктура промышленного предприятия выполняет функцию транспортного уровня для информационных потоков корпоративного сегмента, технологических сетей автоматизированных систем управления и телеметрии. Непрерывность процессов добычи предъявляет к её доступности повышенные требования: кратковременный простой узла способен нарушить координацию производственных циклов на удалённых объектах [1, с. 24].
Штатные средства мониторинга фиксируют лишь состояние «доступен — недоступен», чего недостаточно для полноценного учёта простоев по трём причинам. Во-первых, кратковременные потери связи при плановой перезагрузке или колебаниях питания регистрируются как отказы и искажают статистику доступности. Во-вторых, отказ магистрального узла порождает лавину уведомлений от подчинённых устройств, среди которых персоналу требуется самостоятельно отыскать первопричину. В-третьих, недоступность фиксируется без указания причины, вследствие чего данные малопригодны для анализа надёжности [2, с. 312].
Целью работы является разработка алгоритма многоэтапной обработки инцидентов, преобразующего поток разрозненных событий мониторинга в структурированную запись о простое. Материалом исследования послужила сетевая инфраструктура ПАО «Сургутнефтегаз» — тысячи устройств, географически распределённых и частично эксплуатируемых в агрессивной среде. Применялись методы структурного функционального моделирования в нотации IDEF0 и процессного моделирования в нотации BPMN 2.0, а также сравнительный анализ систем мониторинга [3, с. 8; 4, с. 61].
В качестве источников первичных данных рассматривались Zabbix, Nagios и Cisco Prime Infrastructure. Все три решения фиксируют факт недоступности, но не классифицируют причины простоя, а определение корневого узла реализовано лишь частично и привязано к оборудованию одного производителя. Базовым источником данных выбран Zabbix, сочетающий мультивендорную поддержку, масштабируемость и возможность работы в замкнутом контуре предприятия [5, с. 47]. Недостающая функциональность реализуется разработанным алгоритмом.
Алгоритм включает три последовательных этапа, каждый из которых сокращает объём передаваемых далее данных. Порядок этапов определяется возрастанием стоимости обработки: простые проверки выполняются первыми и отсеивают большинство событий, а ресурсоёмкая экспертная верификация — последней.
Этап временной селекции исключает из учёта события, не являющиеся отказами. При потере связи запись об инциденте не создаётся немедленно: система выполняет серию повторных проверок доступности в пределах защитного интервала. Если устройство восстанавливает работоспособность, событие классифицируется как ложный простой и исключается из расчёта показателей доступности. Интервал зависит от характеристик канала связи: для спутниковых линий он больше, чем для волоконно-оптических.
Этап топологической корреляции выявляет первопричину при одновременной потере связи с группой устройств: алгоритм проверяет иерархию сети от вышестоящих узлов к нижестоящим, и при подтверждении недоступности вышестоящего узла зависимые устройства объединяются в единый инцидент вместо отдельных уведомлений. Это предотвращает генерацию десятков дублирующих заявок при отказе магистрального коммутатора [6, с. 402].
Этап иерархической классификации присваивает инциденту категорию причины. Автоматическая часть анализирует системные сообщения устройства: при обнаружении диагностических кодов, указывающих на перегрев, отказ модуля памяти или потерю питания, присваивается категория аппаратного сбоя. Если связь прерывается без диагностических сообщений, инцидент переводится в состояние ожидания ручной классификации, и администратор выбирает причину из справочника. Критерии всех этапов обработки приведены в таблице 1.
Таблица 1.
Матрица критериев обработки и классификации инцидентов
|
Этап алгоритма |
Технический признак |
Результирующая категория |
Механизм обработки |
|
Временная селекция |
Восстановление связи в пределах защитного интервала |
Ложный простой |
Запись в журнал диагностики, исключение из аналитики |
|
Топологическая корреляция |
Недоступность вышестоящего узла |
Дублирующий инцидент |
Включение в основной инцидент без отдельных уведомлений |
|
Иерархическая классификация |
Наличие диагностических кодов устройства |
Аппаратный сбой |
Автоматическое присвоение категории и регистрация |
|
Ручная верификация |
Отсутствие диагностических кодов |
Внешнее повреждение или ошибка конфигурации |
Выбор причины администратором из справочника |
Алгоритм реализуется в составе функциональной модели учёта простоев. Статическая структура описана в нотации IDEF0: входами служат метрики мониторинга, записи системных журналов и обращения пользователей; управлением — регламенты эксплуатации и соглашения об уровне обслуживания; выходом — верифицированная запись об инциденте и отчётность. Динамика взаимодействия описана в нотации BPMN 2.0: событие задержки реализует защитный интервал, эксклюзивные шлюзы — логику корреляции, а граничное событие таймера контролирует нормативный срок восстановления и инициирует эскалацию [7, с. 118; 8].
На основании верифицированных записей, из которых исключены ложные простои и дублирующие инциденты, вычисляются коэффициент готовности и среднее время восстановления. Достоверность показателей определяется качеством первых двух этапов: без отсева ложных срабатываний коэффициент готовности занижается, а без корреляции среднее время восстановления искажается многократным учётом одного отказа.
Функциональный анализ выявил два ограничения: при каскадных отказах растёт объём событий, требующих ручной классификации, а ценность статистики зависит от дисциплины заполнения справочника причин — выбор обобщённой категории обесценивает анализ. Влияние обоих факторов снижается расширением библиотеки шаблонов автоматической классификации.
Предложенный алгоритм преобразует поток технических событий в структурированные записи о простоях. Последовательное применение трёх этапов позволяет исключить ложные срабатывания, объединить зависимые отказы в единый инцидент и обеспечить обязательное указание причины. Решение аппаратно-независимо, что допускает применение в гетерогенной сетевой среде, а повышение достоверности статистики создаёт основу для планирования модернизации инфраструктуры.
Список литературы:
- Олифер В.Г., Олифер Н.А. Компьютерные сети. Принципы, технологии, протоколы. — СПб.: Питер, 2022. — 992 с.
- Limoncelli T.A. The Practice of System and Network Administration. — Boston: Addison-Wesley, 2020. — 1104 p.
- ГОСТ 34.601-90. Информационная технология. Комплекс стандартов на автоматизированные системы. Автоматизированные системы. Стадии создания. — М.: Стандартинформ, 2020. — 15 с.
- Тельнов Ю.Ф. Инжиниринг предприятия и моделирование бизнес-процессов. — М.: ИНФРА-М, 2025. — 340 с.
- Iton R. Zabbix 7 IT Infrastructure Monitoring Cookbook. — Birmingham: Packt Publishing, 2024. — 350 p.
- Tanenbaum A.S. Computer Networks. — Harlow: Pearson, 2021. — 944 p.
- Репин В.В. Моделирование бизнес-процессов в нотации BPMN. — М.: Инфра-Инженерия, 2023. — 256 с.
- BPMN 2.0 Specification [Электронный ресурс]. — URL: https://www.omg.org/spec/BPMN/2.0/ (дата обращения: 29.07.2026).
дипломов

