Поздравляем с 1 сентября!
   
Телефон: 8-800-350-22-65
Напишите нам:
MAX:
WhatsApp:
Telegram:
Прием заявок круглосуточно
График работы офиса: с 9:00 до 21:00 Нск (с 5:00 до 19:00 Мск)

Статья опубликована в рамках: CCXLII Международной научно-практической конференции «Научное сообщество студентов: МЕЖДИСЦИПЛИНАРНЫЕ ИССЛЕДОВАНИЯ» (Россия, г. Новосибирск, 10 августа 2026 г.)

Наука: Информационные технологии

Скачать книгу(-и): Сборник статей конференции

Библиографическое описание:
Власов Е.А. МЕТОДОЛОГИЯ ИМИТАЦИОННОГО МОДЕЛИРОВАНИЯ И ГЕНЕРАЦИИ СИНТЕТИЧЕСКИХ ДАННЫХ НА PYTHON ДЛЯ СТРЕСС-ТЕСТИРОВАНИЯ АНАЛИТИЧЕСКИХ СИСТЕМ ЭЛЕКТРОННОГО ПРАВИТЕЛЬСТВА // Научное сообщество студентов: МЕЖДИСЦИПЛИНАРНЫЕ ИССЛЕДОВАНИЯ: сб. ст. по мат. CCXLII междунар. студ. науч.-практ. конф. № 15(241). URL: https://sibac.info/archive/meghdis/15(241).pdf (дата обращения: 31.08.2026)
Проголосовать за статью
Конференция завершена
Эта статья набрала 0 голосов
Дипломы участников
У данной статьи нет
дипломов

МЕТОДОЛОГИЯ ИМИТАЦИОННОГО МОДЕЛИРОВАНИЯ И ГЕНЕРАЦИИ СИНТЕТИЧЕСКИХ ДАННЫХ НА PYTHON ДЛЯ СТРЕСС-ТЕСТИРОВАНИЯ АНАЛИТИЧЕСКИХ СИСТЕМ ЭЛЕКТРОННОГО ПРАВИТЕЛЬСТВА

Власов Егор Александрович

студент IV курса, Северо-Западный институт управления – филиал Российской академии народного хозяйства и государственной службы при Президенте Российской Федерации,

РФ, г. Санкт-Петербург

METHODOLOGY OF SIMULATION MODELING AND SYNTHETIC DATA GENERATION IN PYTHON FOR STRESS TESTING OF E-GOVERNMENT ANALYTICAL SYSTEMS

 

Vlasov Egor Aleksandrovich

4th year full-time student, North-West Institute of Management - branch of the Russian Presidential Academy of National Economy and Public Administration,

Russia, St. Petersburg

 

АННОТАЦИЯ

В статье исследуются методы программного имитационного моделирования транзакционных потоков с использованием средств языка программирования Python (NumPy, Pandas) для верификации и нагрузочного тестирования систем бизнес-аналитики. Обоснована необходимость генерации синтетических наборов данных в условиях жестких ограничений законодательства о персональных данных и требований конфиденциальности инфраструктурных логов электронного правительства. Предложена математическая модель воспроизведения стохастических пиков нагрузки и аппаратных сбоев шлюзов.

ABSTRACT

The article explores methods of programmatic simulation modeling of transaction flows using the Python programming language (NumPy, Pandas) to verify and load-test business intelligence systems. The necessity of generating synthetic datasets under the strict constraints of personal data protection regulations and confidentiality requirements of e-government infrastructure logs is substantiated. A mathematical model for reproducing stochastic load peaks and hardware gateway failures is proposed.

 

Ключевые слова: инженерия данных, Python, имитационное моделирование, синтетические данные, распределение Пуассона, нагрузочное тестирование, электронное правительство.

Keywords: data engineering, Python, simulation modeling, synthetic data, Poisson distribution, load testing, e-government.

 

Проектирование и внедрение современных систем предиктивной бизнес-аналитики для мониторинга цифровых государственных сервисов (ЕПГУ, СМЭВ) неизбежно сталкивается с методологическим противоречием. С одной стороны, для отладки алгоритмов обнаружения аномалий и проверки пропускной способности конвейеров обработки данных требуются репрезентативные массивы транзакционных логов, исчисляемые сотнями тысяч и миллионами записей. С другой стороны, требования информационной безопасности, режима коммерческой тайны и защиты персональных данных исключают возможность прямого использования реальных логов ведомственных информационных систем на этапе разработки и тестирования аналитического контура.

Решением данной проблемы выступает разработка специализированного программного комплекса имитационного моделирования на базе экосистемы Python (NumPy и Pandas). В отличие от статических тестовых заглушек, программная генерация позволяет воспроизвести сложные нелинейные зависимости, характерные для реального трафика государственных услуг.

Методология построения синтетического датасета опирается на комбинацию вероятностных распределений, отражающих различные аспекты функционирования ИТ-инфраструктуры:

  1. Моделирование интенсивности входящего потока (Распределение Пуассона): Интенсивность обращения граждан к государственным услугам носит неравномерный характер с выраженными суточными циклами. Для эмуляции плотности транзакций применяется дискретное распределение Пуассона, где параметр интенсивности  динамически варьируется в зависимости от смоделированного часа суток, формируя утренние и вечерние пиковые нагрузки.
  2. Моделирование времени отклика в штатном режиме (Логнормальное распределение): Время обработки синхронных запросов шлюзами не может принимать отрицательные значения и имеет правостороннюю асимметрию из-за сетевых задержек. Использование логнормального распределения позволяет генерировать базовое время отклика транзакций в диапазоне от 100 до 300 миллисекунд с естественным разбросом.
  3. Эмуляция стохастических сбоев и деградации сервисов (Бета-распределение и экспоненциальный рост): Для проверки устойчивости алгоритмов выявления аномалий в синтетический массив внедряются искусственные отклонения. С помощью библиотеки Pandas и генераторов случайных чисел моделируются каскадные задержки и инфраструктурные отказы региональных ведомственных систем, при которых время обработки запроса возрастает, а статус транзакции принудительно переводится в код ошибки (TimeOut или технологический сбой).

Программная реализация генерации массива данных организуется векторизованными методами NumPy, что обеспечивает высокую производительность скрипта. На выходе формируется структурированная таблица, полностью имитирующая поля производственных логов: уникальные идентификаторы сессий, временные метки (timestamp), коды ведомств, статусы и флаги ошибок.

Предложенный подход к имитационному моделированию на Python позволяет полностью нивелировать риски нарушения законодательства о защите информации на этапе проектирования аналитических систем. Созданные синтетические датасеты обеспечивают надежную верификацию алгоритмов и нагрузочное тестирование хранилищ данных, выступая универсальным методологическим инструментом для исследователей в сфере бизнес-информатики и государственного управления.

 

Список литературы:

  1. Федеральный закон от 27.07.2006 № 149-ФЗ (ред. от 2026) «Об информации, информационных технологиях и о защите информации» // СПС КонсультантПлюс. – URL: https://www.consultant.ru/document/cons_doc_LAW_61798/ (дата обращения: 18.06.2026). 
  2. Федеральный закон от 27.07.2006 № 152-ФЗ (ред. от 2025) «О персональных данных» // СПС КонсультантПлюс. – URL: https://www.consultant.ru/document/cons_doc_LAW_61801/ (дата обращения: 18.06.2026).
  3. Постановление Правительства Российской Федерации от 08.09.2010 № 697 (ред. от 2025) «О единой системе межведомственного электронного взаимодействия» // СПС КонсультантПлюс. – URL: https://www.consultant.ru/document/cons_doc_LAW_104665/ (дата обращения: 14.06.2026).
  4. pandas Documentation [Электронный ресурс] // The pandas Development Team. – URL: https://pandas.pydata.org/docs/ (дата обращения: 20.06.2026).
Проголосовать за статью
Конференция завершена
Эта статья набрала 0 голосов
Дипломы участников
У данной статьи нет
дипломов