Статья опубликована в рамках: CXXVII Международной научно-практической конференции «Экспериментальные и теоретические исследования в современной науке» (Россия, г. Новосибирск, 29 июля 2026 г.)
Наука: Технические науки
Скачать книгу(-и): Сборник статей конференции
дипломов
АРХИТЕКТУРА РАСПРЕДЕЛЁННОЙ БОРТОВОЙ СИСТЕМЫ УПРАВЛЕНИЯ ГЕТЕРОГЕННЫМ РОЕМ РОБОТИЗИРОВАННЫХ ПЛАТФОРМ
ARCHITECTURE OF A DISTRIBUTED ONBOARD CONTROL SYSTEM FOR A HETEROGENEOUS SWARM OF ROBOTIC PLATFORMS
Bragin Dmitry Mikhailovich
Magistr, National Research Nuclear University MEPhI, Institute of Intelligent Cybernetic Systems, Department No. 42 "Cryptology and Cybersecurity",
Russia, Moscow
АННОТАЦИЯ
Цель. Разработка гибридной архитектуры распределённой бортовой системы управления гетерогенным роем роботизированных платформ, объединяющей децентрализованную координацию, модель принятия решений в условиях частичной наблюдаемости (Dec-POMDP) и эвристическую коррекцию управляющих решений для повышения автономности, живучести и эффективности группы в условиях деградации связи и отказов агентов.
Метод. Задача управления формализована в рамках Dec-POMDP. Предложена нормализованная многокритериальная функция полезности, учитывающая эффективность миссии, безопасность движения, качество связи, энергопотребление и устойчивость формации. Разработан программный прототип на базе ROS 2. Проведена серия из 720 воспроизводимых имитационных экспериментов в шести сценариях с фиксированными значениями случайного seed. Результат. Предложенная архитектура продемонстрировала устойчивое преимущество по коэффициенту сохранения связности роя (0,989 против 0,928 в номинальном сценарии; 0,587 против 0,531 в стресс-сценарии) и интегральному показателю эффективности (0,839 против 0,805; 0,803 против 0,775) относительно централизованных, реактивных и rule-based подходов. Общая доля успешных запусков составила 96,8 %.
Выводы. Вероятностно-эвристический контур управления обеспечивает устойчивое коллективное поведение роя в условиях деградации связи, отказов агентов и комбинированного стрессового воздействия. Результаты применимы при создании автономных робототехнических комплексов для мониторинга, разведки и поисково-спасательных операций.
ABSTRACT
Background. Modern tasks of territory monitoring, search-and-rescue operations, and reconnaissance require the coordinated use of heterogeneous robotic platforms capable of autonomous decision-making under communication degradation and partial agent failures. Traditional centralized control approaches possess a critical single point of failure vulnerability.
Methods. A hybrid architecture combining decentralized coordination, the Decentralized Partially Observable Markov Decision Process (Dec-POMDP) model, and heuristic correction of control decisions is proposed. A normalized multi-criteria utility function accounting for mission effectiveness, movement safety, communication quality, energy consumption, and formation stability is developed. A software prototype based on ROS 2 was implemented, and 720 reproducible simulation experiments across six scenarios were conducted with fixed random seeds.
Result. The proposed architecture demonstrated a consistent advantage in swarm connectivity coefficient (0.989 vs. 0.928 in the nominal scenario; 0.587 vs. 0.531 in the stress scenario) and integral performance index (0.839 vs. 0.805; 0.803 vs. 0.775) compared to centralized, reactive, and rule-based approaches. The overall success rate was 96.8 %. Conclusion. The probabilistic-heuristic control loop ensures stable collective swarm behavior under communication degradation, agent failures, and combined stress conditions. The results are applicable to the design of autonomous robotic complexes for monitoring, reconnaissance, and search-and-rescue operations.
Ключевые слова: архитектура распределённой системы управления; гетерогенный рой роботизированных платформ; децентрализованная координация; агрегирование мультисенсорной информации; Dec-POMDP; отказоустойчивость; ROS 2; имитационное моделирование.
Keywords: distributed control system architecture; heterogeneous swarm of robotic platforms; decentralized coordination; multisensor data fusion; Dec-POMDP; fault tolerance; ROS 2; simulation modeling.
Современные задачи мониторинга территорий, поисково-спасательных операций и разведки требуют совместного применения разнородных роботизированных платформ, способных координировать действия в динамически изменяющихся средах. Традиционные централизованные подходы к управлению группами роботов обладают критическим недостатком — наличием единой точки отказа, что делает систему уязвимой при потере канала связи с центром управления или выходе из строя управляющего узла [1, 2].
Перспективным направлением решения данной проблемы является разработка распределённых систем управления, интегрирующих мультисенсорную информацию и обеспечивающих автономное принятие решений на основе методов искусственного интеллекта. Современные платформы оснащаются камерами оптического и инфракрасного диапазонов, лидарами, радарами, инерциальными измерительными модулями, приёмниками глобальных навигационных спутниковых систем и средствами радиотехнической разведки. Объединение данных от разнородных сенсоров позволяет формировать более устойчивую модель окружающей среды по сравнению с использованием каждого источника по отдельности [3, 4].
Вместе с тем интеграция интеллектуальных алгоритмов в распределённую систему управления роем сопряжена с рядом ограничений: вычислительная сложность точного решения децентрализованных частично наблюдаемых марковских процессов относится к классу NEXP-полных задач [5], стохастические задержки передачи данных критически влияют на алгоритмы координации, а архитектуры нейронных сетей, демонстрирующие высокую точность на серверном оборудовании, часто непригодны для бортовых вычислителей из-за ограничений энергопотребления.
Целью настоящей работы является разработка архитектуры и алгоритмического обеспечения распределённой бортовой системы управления гетерогенным роем, использующей агрегированное мультисенсорное представление и вероятностно-эвристический контур принятия решений для повышения автономности, живучести и эффективности группы разнородных платформ.
Проектируемая система строится на программной платформе ROS 2, обеспечивающей модульное построение распределённой архитектуры и взаимодействие компонентов через промышленный стандарт Data Distribution Service (DDS). Децентрализованная архитектура DDS исключает единую точку отказа: узлы взаимодействуют напрямую без центрального брокера сообщений, что обеспечивает автоматическое обнаружение узлов, настраиваемые политики качества обслуживания и устойчивость к сетевым задержкам [6, 7].
Вычислительная архитектура реализована в виде трёхуровневой структуры (рисунок 1). Уровень восприятия выполняет предварительную обработку данных, фильтрацию шумов, сенсорную фузию и построение агрегированного состояния среды, включающего координаты агентов, карту препятствий, коэффициент покрытия территории, показатели связности, задержки и потери сообщений, энергетические характеристики и признаки отказов. Уровень принятия решений реализует стратегическое и тактическое планирование, распределение задач и интеллектуальное управление. Исполнительный уровень обеспечивает низкоуровневое управление приводами и мониторинг аппаратных параметров.

Рисунок 1. Общая архитектура распределённой системы управления
Логическая топология взаимодействия агентов построена по гибридной иерархической схеме, сочетающей mesh-взаимодействие и кластерную организацию. Каждый агент обладает возможностью прямого взаимодействия с соседними узлами в зоне устойчивой связи. Для повышения управляемости формируются логические кластеры, внутри которых один агент временно выполняет функции координатора. При отказе координатора реализуется механизм автоматического переизбрания нового управляющего узла [8].
Задача управления формулируется в рамках формализма децентрализованного частично наблюдаемого марковского процесса принятия решений (Dec-POMDP), определяемого кортежем ⟨N, S, A, T, R, Ω, O, γ⟩, где N — множество агентов, S — пространство совместных состояний, A — пространство совместных действий, T — функция вероятностных переходов, R — функция вознаграждения, Ω — пространство наблюдений, O — функция наблюдаемости, γ — коэффициент дисконтирования [5, с. 52; 9, с. 101]. Каждый агент поддерживает локальную историю наблюдений и выбирает действие согласно локальной политике, стремясь максимизировать ожидаемую совокупную полезность.
Ключевым элементом модели является нормализованная многокритериальная функция полезности:
J(S_t, U_t) = Σ ω_k · J'_k, где Σ ω_k = 1, ω_k ≥ 0,
включающая пять компонент: выполнение миссии (степень достижения целевых точек и покрытия области поиска), безопасность движения (экспоненциальная функция дистанций между агентами), качество сетевого взаимодействия (учёт задержек и потерь пакетов), энергоэффективность и устойчивость формации (минимизация квадратичного отклонения от эталонных дистанций). Динамическая адаптация весов реализуется через мета-контроллер, повышающий приоритет безопасности и связности в критических режимах [10].
Алгоритм прогнозирования состояния среды основан на расширенном фильтре Калмана с последующей моделью краткосрочного прогнозирования и метрикой доверия к прогнозу [11, 12]. Распределение задач между агентами осуществляется модифицированным аукционным алгоритмом с учётом расстояния до цели, остаточного ресурса, текущей загрузки и вероятности успешного выполнения. Адаптивное планирование траектории реализовано на двух уровнях: глобальный поиск модифицированным алгоритмом A* с учётом связности и локальная реактивная коррекция методом динамического окна.
Архитектура предусматривает интерфейс интеграции многоагентного обучения с подкреплением по парадигме централизованного обучения с децентрализованным исполнением (CTDE) на базе модифицированного алгоритма QMIX с механизмом графового внимания для учёта гетерогенности агентов [13, 14].
Программный прототип реализован на базе ROS 2 в виде набора взаимосвязанных узлов. Основная статистическая серия экспериментов выполнена в ускоренном детерминированном режиме headless_fast_kinematic, обеспечивающем массовые воспроизводимые запуски при фиксированных значениях случайного seed. Базовая конфигурация рассматривает рой из N = 8 агентов.
Сценарная матрица включает шесть сценариев: S1 — номинальная навигация; S2 — плотное препятственное окружение; S3 — деградация каналов связи; S4 — частичный отказ агентов; S5 — вычислительная деградация; S6 — комбинированный стресс-тест. Для каждого сценария проведены эксперименты с четырьмя архитектурами: централизованным планированием (Central-A*), реактивным управлением, децентрализованным rule-based алгоритмом и предложенной архитектурой Dec-POMDP с эвристической коррекцией. Общее количество запусков составило 720 (6 × 4 × 30 seed).
По результатам валидации получено 697 успешных завершений миссии и 23 корректно классифицированных неуспешных прогона. Общая доля успешных запусков составила 96,8 %, что подтверждает работоспособность экспериментального стенда. Результаты сравнительного анализа представлены в таблице 1.
Таблица 1.
Результаты сравнительного анализа
|
Сценарий |
Архитектура |
coverage_ratio |
connectivity_coeff |
collisions_count |
total_energy_wh |
integral_score |
|---|---|---|---|---|---|---|
|
S1 |
Централизованное планирование (Central-A*) |
0.6151 |
0.9280 |
0.0667 |
1.2356 |
0.8050 |
|
Предложенная архитектура (Dec-POMDP + эвристическая коррекция) |
0.6052 |
0.9890 |
0.0000 |
1.9811 |
0.8391 |
|
|
Реактивное управление |
0.6066 |
0.9094 |
0.1000 |
2.1769 |
0.6487 |
|
|
Децентрализованный rule-based алгоритм |
0.6088 |
0.9503 |
0.0667 |
1.8315 |
0.7460 |
|
|
S2 |
Централизованное планирование (Central-A*) |
0.6107 |
0.8619 |
0.1667 |
1.4696 |
0.7751 |
|
Предложенная архитектура (Dec-POMDP + эвристическая коррекция) |
0.6086 |
0.9283 |
0.0667 |
2.3304 |
0.8235 |
|
|
Реактивное управление |
0.6068 |
0.8286 |
0.1667 |
2.5423 |
0.6660 |
|
|
Децентрализованный rule-based алгоритм |
0.6097 |
0.8823 |
0.2000 |
2.1231 |
0.6816 |
|
|
S3 |
Централизованное планирование (Central-A*) |
0.6151 |
0.6872 |
0.0667 |
1.3325 |
0.7448 |
|
Предложенная архитектура (Dec-POMDP + эвристическая коррекция) |
0.6075 |
0.7343 |
0.0000 |
2.1188 |
0.7780 |
|
|
Реактивное управление |
0.6115 |
0.6706 |
0.1000 |
2.3525 |
0.5900 |
|
|
Децентрализованный rule-based алгоритм |
0.6066 |
0.7047 |
0.1000 |
1.9373 |
0.6382 |
|
|
S4 |
Централизованное планирование (Central-A*) |
0.6105 |
0.8341 |
0.0667 |
1.3429 |
0.8056 |
|
Предложенная архитектура (Dec-POMDP + эвристическая коррекция) |
0.6040 |
0.8935 |
0.0000 |
2.1416 |
0.8161 |
|
|
Реактивное управление |
0.6071 |
0.8124 |
0.1000 |
2.3654 |
0.6620 |
|
|
Децентрализованный rule-based алгоритм |
0.6079 |
0.8551 |
0.1333 |
1.9664 |
0.6744 |
|
|
S5
|
Централизованное планирование (Central-A*) |
0.6136 |
0.8471 |
0.0667 |
1.4092 |
0.8095 |
|
Предложенная архитектура (Dec-POMDP + эвристическая коррекция) |
0.6084 |
0.9082 |
0.0000 |
2.2617 |
0.8186 |
|
|
Реактивное управление |
0.6108 |
0.8247 |
0.1333 |
2.4731 |
0.6283 |
|
|
Децентрализованный rule-based алгоритм |
0.6038 |
0.8710 |
0.1000 |
2.0122 |
0.7193 |
|
|
S6 |
Централизованное планирование (Central-A*) |
0.6102 |
0.5306 |
0.2333 |
1.9275 |
0.7747 |
|
Предложенная архитектура (Dec-POMDP + эвристическая коррекция) |
0.6099 |
0.5867 |
0.1333 |
3.0230 |
0.8033 |
|
|
Реактивное управление |
0.6565 |
0.2891 |
0.6333 |
9.0498 |
0.2736 |
|
|
Децентрализованный rule-based алгоритм |
0.6056 |
0.5438 |
0.2667 |
2.7916 |
0.7549 |
Анализ результатов показывает, что предложенная архитектура Dec-POMDP с эвристической коррекцией демонстрирует устойчивое преимущество по коэффициенту сохранения связности роя во всех шести сценариях (рисунок 2). Наиболее выраженное различие наблюдается в сценариях деградации связи (S3) и комбинированного стресс-теста (S6), где способность поддерживать коммуникационную топологию становится критически важной.

Рисунок 2. Сравнение коэффициента сохранения связности роя по сценариям
По интегральному показателю эффективности предложенная архитектура показывает лучший результат во всех сценариях (рисунок 3). В стрессовом сценарии S6 реактивное управление демонстрирует аномально высокое энергопотребление (9,05 Вт·ч против 3,02 Вт·ч у Dec-POMDP), что связано с отсутствием механизма координационного восстановления связности.

Рисунок 3. Сравнение интегрального показателя эффективности по сценариям
Следует отметить, что предложенная архитектура в ряде сценариев потребляет больше энергии, чем централизованное планирование, что представляет инженерный компромисс между поддержанием связности и расходом ресурса. Однако более высокая связность и интегральная эффективность компенсируют увеличенный энергорасход.
В работе разработана гибридная архитектура распределённой бортовой системы управления гетерогенным роем роботизированных платформ, объединяющая децентрализованную координацию, модель Dec-POMDP и эвристическую коррекцию управляющих решений. Предложена нормализованная многокритериальная функция полезности и комплекс алгоритмов прогнозирования, распределения задач и адаптивного планирования траекторий.
Проведённая серия из 720 воспроизводимых имитационных экспериментов подтвердила преимущество предложенного подхода по коэффициенту сохранения связности роя и интегральному показателю эффективности относительно централизованных, реактивных и rule-based подходов. Разрыв в метриках наиболее выражен в условиях деградации связи и комбинированного стрессового воздействия.
Перспективы дальнейшего развития включают перенос экспериментов в физически детализированную среду Gazebo/DDS, обучение и валидацию MARL-политики, расширение сценарной матрицы, оценку масштабируемости при увеличении числа агентов и апробацию архитектуры на аппаратных роботизированных платформах.
Список литературы:
- Макаренко С. И. Противодействие беспилотным летательным аппаратам : монография. Санкт-Петербург : Наукоемкие технологии, 2020. 204 с.
- Макаренко С. И., Захаров Н. С. Робототехнические комплексы военного назначения: современное состояние и перспективы развития // Системы управления, связи и безопасности. 2016. № 2. С. 112–125.
- Huang K., Li Y., Wang J., Zhang Z. A Survey of Multi-Sensor Fusion in Autonomous Driving // Sensors. 2025. Vol. 25, No. 3. Art. 789. DOI: 10.3390/s25030789.
- Yeong D. J., Kim J., Lee S., Park H. Sensor and Sensor Fusion Technology in Autonomous Vehicles: A Review // Sensors. 2021. Vol. 21, No. 12. Art. 4125. DOI: 10.3390/s21124125.
- Oliehoek F. A., Amato C. A Concise Introduction to Decentralized POMDPs. Cham : Springer, 2016. 142 p. DOI: 10.1007/978-3-319-28928-8.
- Quigley M., Gerkey B., Smart W. D. Robot Operating System 2: Design, Architecture, and Uses in the Wild // Science Robotics. 2022. Vol. 7, No. 62. Art. eabj2118. DOI: 10.1126/scirobotics.abj2118.
- Ведерников Ю. В. Основы теории структурной оптимизации систем контроля и управления беспилотными летательными аппаратами : учебное пособие. 2-е изд., испр. и доп. Санкт-Петербург : Политехника, 2022. 367 с.
- Brambilla M., Ferrante E., Birattari M., Dorigo M. Swarm robotics: a review from the swarm engineering perspective // Swarm Intelligence. 2013. Vol. 7, No. 1. P. 1–41. DOI: 10.1007/s11721-012-0075-2.
- Kaelbling L. P., Littman M. L., Cassandra A. R. Planning and Acting in Partially Observable Stochastic Domains // Artificial Intelligence. 1998. Vol. 101, No. 1–2. P. 99–134.
- Deb K. Multi-Objective Optimization Using Evolutionary Algorithms. Chichester : John Wiley & Sons, 2001. 497 p.
- Kalman R. E. A New Approach to Linear Filtering and Prediction Problems // Journal of Basic Engineering. 1960. Vol. 82, No. 1. P. 35–45.
- Julier S. J., Uhlmann J. K. Unscented Filtering and Nonlinear Estimation // Proceedings of the IEEE. 2004. Vol. 92, No. 3. P. 401–422.
- Rashid T., Samvelyan M., Schroeder C., Farquhar S., Foerster J., Whiteson S. QMIX: Monotonic Value Function Factorisation for Deep Multi-Agent Reinforcement Learning // Proceedings of the 35th International Conference on Machine Learning. 2018. P. 4295–4304.
- Wang Y., Liu Z., Li X., Zhang J. Heterogeneous Multi-Agent Deep Reinforcement Learning for UAV Clustering // Drones. 2025. Vol. 9, No. 2. Art. 45. DOI: 10.3390/drones9020045.
дипломов

