Телефон: 8-800-350-22-65
Напишите нам:
WhatsApp:
Telegram:
MAX:
Прием заявок круглосуточно
График работы офиса: с 9:00 до 21:00 Нск (с 5:00 до 19:00 Мск)

Статья опубликована в рамках: CLXIV Международной научно-практической конференции «Научное сообщество студентов XXI столетия. ТЕХНИЧЕСКИЕ НАУКИ» (Россия, г. Новосибирск, 06 августа 2026 г.)

Наука: Информационные технологии

Скачать книгу(-и): Сборник статей конференции

Библиографическое описание:
Власов Е.А. ПРОЕКТИРОВАНИЕ ETL-КОНВЕЙЕРА И СИСТЕМЫ ПРЕДИКТИВНОЙ БИЗНЕС-АНАЛИТИКИ ДЛЯ МОНИТОРИНГА ЭЛЕКТРОННОГО ПРАВИТЕЛЬСТВА // Научное сообщество студентов XXI столетия. ТЕХНИЧЕСКИЕ НАУКИ: сб. ст. по мат. CLXIV междунар. студ. науч.-практ. конф. № 8(162). URL: https://sibac.info/archive/technic/8(162).pdf (дата обращения: 11.08.2026)
Проголосовать за статью
Идет голосование
Эта статья набрала 0 голосов (обновление каждые 15 минут)
Дипломы участников
У данной статьи нет
дипломов

ПРОЕКТИРОВАНИЕ ETL-КОНВЕЙЕРА И СИСТЕМЫ ПРЕДИКТИВНОЙ БИЗНЕС-АНАЛИТИКИ ДЛЯ МОНИТОРИНГА ЭЛЕКТРОННОГО ПРАВИТЕЛЬСТВА

Власов Егор Александрович

студент IV курса, Северо-Западный институт управления – филиал Российской академии народного хозяйства и государственной службы при Президенте Российской Федерации,

РФ, г. Санкт-Петербург

DESIGNING AN ETL PIPELINE AND PREDICTIVE BUSINESS ANALYTICS SYSTEM FOR E-GOVERNMENT MONITORING

 

Vlasov Egor Aleksandrovich

4th year full-time student, The North-Western Institute of Management is a branch of the Russian Presidential Academy of National Economy and Public Administration,

Russia, St. Petersburg

 

АННОТАЦИЯ

В статье рассматривается процесс проектирования автоматизированного конвейера обработки данных (ETL) и построения системы бизнес-аналитики для мониторинга качества оказания государственных услуг. Описана логика трансформации системных логов с применением математического аппарата (индекс Z-score и предиктивный индекс риска). Представлены результаты имитационного моделирования и внедрения материализованных витрин данных на базе стека Apache Airflow, ClickHouse и Apache Superset.

ABSTRACT

The article examines the process of designing an automated data processing pipeline (ETL) and building a business analytics system to monitor the quality of public service delivery. It describes the logic of system log transformation using mathematical tools (Z-score and predictive risk index). The study presents the results of simulation modeling and the implementation of materialized data marts based on the Apache Airflow, ClickHouse, and Apache Superset stack.

 

Ключевые слова: ETL-процессы, бизнес-аналитика, Apache Airflow, ClickHouse, Apache Superset, электронное правительство, Data Lineage, мониторинг инфраструктуры.

Keywords: ETL processes, business analytics, Apache Airflow, ClickHouse, Apache Superset, e-government, Data Lineage, infrastructure monitoring.

 

Цифровизация государственного управления и интеграция информационных систем через инфраструктуру Системы межведомственного электронного взаимодействия (СМЭВ) сопровождаются экспоненциальным ростом объема транзакционных данных. Классические подходы к мониторингу функционирования Единого портала государственных и муниципальных услуг (ЕПГУ), опирающиеся на нормализованные реляционные СУБД, демонстрируют деградацию производительности при построении агрегированных отчетов на миллионах записей. В связи с этим возникает научно-практическая задача проектирования высокопроизводительной аналитической инфраструктуры, обеспечивающей проактивный контроль технологической стабильности и соблюдения регламентных сроков (SLA).

В рамках исследования спроектирована гибридная архитектура хранилища данных (DWH). Для изоляции транзакционной нагрузки нормативно-справочная информация (классификаторы ведомств, номенклатура услуг) локализована в СУБД PostgreSQL с поддержкой ACID. Основной массив транзакционных логов аккумулируется в колоночной СУБД ClickHouse с использованием семейства движков MergeTree. Связывание гетерогенных сред реализовано через механизм внешних словарей в оперативной памяти (RAM).

Оркестрация процессов извлечения, трансформации и загрузки данных (ETL) автоматизирована с помощью фреймворка Apache Airflow. Логика миграции логов описана в виде направленных ациклических графов (DAGs), реализующих принцип идемпотентности. Интеграция данных осуществляется по инкрементальной модели, что минимизирует нагрузку на операционные системы-источники.

На этапе трансформации в изолированной области (Staging Area) сырые данные проходят процедуру синтаксической нормализации и сквозного маппинга статусов ведомственных систем (Data Lineage). Для реализации предиктивного мониторинга алгоритмический аппарат дополнен двумя вычислительными блоками:

  1. Выявление инфраструктурных аномалий шлюзов: расчет стандартизированного отклонения (Z-score) времени отклика от скользящего среднего. Отклонения Z > 3 (правило трех сигм) классифицируются как системные сбои.
  2. Прогнозирование срыва SLA: вычисление предиктивного индекса риска , интегрирующего нормативное время оказания услуги и исторический коэффициент операционной эффективности конкретного ведомства.

Учитывая режим конфиденциальности реальных логов ЕПГУ, для верификации разработанных алгоритмов был создан программный комплекс имитационного моделирования на языке Python (библиотеки NumPy, Pandas). В ходе эксперимента сгенерирован синтетический репрезентативный массив объемом 500 000 транзакций, подчиненный логнормальному (штатная работа), нормальному (аппаратные сбои) и бета-распределению (задержки исполнения услуг). Данный массив выступил полигоном для тестирования ETL-конвейера.

Для обеспечения субсекундного отклика графических интерфейсов Apache Superset в ClickHouse спроектирован выделенный слой агрегированных витрин данных (Data Marts) на базе материализованных представлений (Materialized Views) и движка SummingMergeTree. Триггерная преагрегация данных «на лету» исключает ресурсоемкое полное сканирование (Full Table Scan) таблицы фактов. На основе витрин развернуты оперативные дашборды, визуализирующие тепловые карты узких мест инфраструктуры.

Анализ эффективности спроектированной (TO-BE) архитектуры по сравнению с базовой (AS-IS) моделью выявил кратное улучшение ключевых метрик:

  • утилизация дискового пространства снизилась в 11 раз (за счет алгоритмов словарного сжатия LZ4 в колоночной структуре).
  • скорость рендеринга аналитических запросов сократилась с 120–150 секунд до 0,3-0,5 секунд.
  • интеграция математических моделей непосредственно в DAG-графы Airflow позволила сократить среднее время обнаружения инцидентов (MTTD) с реактивных 24 часов до 5 минут.

Разработанный ETL-конвейер и инфраструктура Data Marts трансформируют процессы мониторинга электронного правительства, обеспечивая переход от ретроспективной фиксации инцидентов к проактивному управлению качеством государственных сервисов и минимизации технологических рисков.

 

Список литературы:

  1. Дмитриев К. А., Соколова И. В. Сравнительный анализ отечественных BI-систем в рамках реализации стратегии импортозамещения программного обеспечения // Вестник компьютерных и информационных технологий. 2024. Т. 21, № 4. С. 34–45.
  2. Таненбаум Э. Распределенные системы. Принципы и парадигмы / Э. Таненбаум, М. ван Стеен. – Санкт-Петербург : Питер, 2003. – 877 с.
  3. Турбан Э. Бизнес-аналитика: анализ и управление данными / Э. Турбан, Р. Шарда, Д. Деллен. – Санкт-Петербург : Питер, 2021. – 336 с.
Проголосовать за статью
Идет голосование
Эта статья набрала 0 голосов (обновление каждые 15 минут)
Дипломы участников
У данной статьи нет
дипломов