Телефон: 8-800-350-22-65
Напишите нам:
MAX:
WhatsApp:
Telegram:
Прием заявок круглосуточно
График работы офиса: с 9:00 до 21:00 Нск (с 5:00 до 19:00 Мск)

Статья опубликована в рамках: CII Международной научно-практической конференции «Вопросы технических и физико-математических наук в свете современных исследований» (Россия, г. Новосибирск, 24 августа 2026 г.)

Наука: Информационные технологии

Секция: Математическое и программное обеспечение вычислительных машин, комплексов и компьютерных сетей

Скачать книгу(-и): Сборник статей конференции

Библиографическое описание:
Корелин К.А. УСКОРЕНИЕ ОБУЧЕНИЯ АНСАМБЛЕЙ СВЕРТОЧНЫХ НЕЙРОННЫХ СЕТЕЙ С ПОМОЩЬЮ МЕТОДОВ SNAPSHOT ENSEMBLING И BATCHENSEMBLE // Вопросы технических и физико-математических наук в свете современных исследований: сб. ст. по матер. CII междунар. науч.-практ. конф. № 8(93). – Новосибирск: СибАК, 2026. – С. 5-11.
Проголосовать за статью
Дипломы участников
У данной статьи нет
дипломов

УСКОРЕНИЕ ОБУЧЕНИЯ АНСАМБЛЕЙ СВЕРТОЧНЫХ НЕЙРОННЫХ СЕТЕЙ С ПОМОЩЬЮ МЕТОДОВ SNAPSHOT ENSEMBLING И BATCHENSEMBLE

Корелин Кирилл Александрович

аспирант, кафедра вычислительных систем и технологий, Нижегородский государственный технический университет им. Р. Е. Алексеева,

РФ, г. Нижний Новгород

Ключевые слова: свёрточные нейронные сети; ансамблевые методы; бэггинг; Snapshot Ensembling; BatchEnsemble; классификация изображений; микроструктура металлов; ускорение обучения.

Keywords: convolutional neural networks; ensemble methods; bagging; Snapshot Ensembling; BatchEnsemble; image classification; metal microstructure; training acceleration.

 

В задачах технической диагностики и материаловедения всё более широкое применение находят методы глубокого обучения, в частности свёрточные нейронные сети (CNN), способные автоматически выделять информативные признаки из изображений микроструктур металлов. В ранее проведённых исследованиях было показано, что ансамбль из нескольких CNN, обученных на бутстрэп-подвыборках (Bagging CNN), обеспечивает более высокую точность классификации степеней разрушения сплавов, чем одиночная модель [1]. Так, для пяти классов точность ансамбля составила 87,7 %, тогда как отдельная CNN достигла лишь 83,5 %. Однако обучение нескольких независимых CNN требует значительных вычислительных ресурсов и времени (около 18,4 мин на графическом процессоре), что затрудняет проведение многократных экспериментов, подбор гиперпараметров и оперативное обновление моделей в промышленных системах.

В связи с этим актуальной является задача сокращения времени обучения ансамблей CNN при сохранении высокой точности. В настоящей работе рассматриваются два современных подхода, позволяющих получить ансамбль моделей с вычислительными затратами, близкими к обучению одной сети: Snapshot Ensembling [2] и BatchEnsemble [3]. Первый метод использует циклическое косинусное расписание скорости обучения, при котором в конце каждого цикла сохраняется «снимок» весов, соответствующий локальному минимуму функции потерь. Второй метод вводит для каждого члена ансамбля два обучаемых вектора малых множителей, которые модифицируют общую матрицу весов, что позволяет эффективно хранить и обучать несколько моделей одновременно.

Целью данной статьи является сравнительный анализ эффективности Snapshot Ensembling и BatchEnsemble относительно классического Bagging CNN при решении задачи классификации микроструктур металлических сплавов по изображениям.

1. Материалы и методы

1.1. Исходные данные и предобработка

Использовался набор микрофотографий металлических сплавов с пятью классами, соответствующими степени разрушения: 0 %, 20 %, 35 %, 50 % и 65 %. На рисунке 1 представлены примеры исходных микрофотографий для каждого класса. Исходные изображения имели размер 1600×1200 пикселей. Для увеличения объёма данных каждое изображение разделялось на непересекающиеся патчи размером 200×200 пикселей. Общий объём после предобработки составил 2880 изображений (12 исходных × 48 патчей × 5 классов). Все изображения конвертировались в градации серого и нормировались в диапазон [0, 1]. Для обучения применялась аугментация: случайные повороты (±20°), сдвиги (±10 %), наклоны (±10 %), зум (±10 %) и отражения.

 

Рисунок 1. Примеры микрофотографий исходных образцов для пяти классов степени разрушения: 0 %; 20 %; 35 %; 50 %; 65 %

 

1.2. Архитектура базовой CNN

Использовалась свёрточная нейронная сеть, архитектура которой соответствует современным подходам к анализу изображений [4]. Сеть состояла из трёх последовательных свёрточных блоков:

  • Conv2D(32, 3×3) → BatchNormalization → MaxPooling(2×2);
  • Conv2D(64, 3×3) → BatchNormalization → MaxPooling(2×2);
  • Conv2D(128, 3×3) → BatchNormalization → MaxPooling(2×2).

Затем следовали полносвязные слои: Flatten → Dense(128, ReLU) → BatchNormalization → Dropout(0.5) → Dense(num_classes, softmax). Для регуляризации использовалась L2-норма с коэффициентом 0,01. Оптимизатор — Adam (learning rate = 0,001), функция потерь — sparse categorical crossentropy. Обучение проводилось с ранней остановкой при отсутствии улучшения на валидационной выборке в течение 10 эпох.

1.3. Базовый метод: Bagging CNN

Классический бэггинг CNN реализован путём обучения пяти независимых CNN на случайных бутстрэп-подвыборках исходного тренировочного набора [5, 6]. Каждая модель имела одинаковую архитектуру, но различные начальные веса и подвыборки. Обучение моделей выполнялось параллельно с использованием четырёх потоков. Агрегация предсказаний осуществлялась мажоритарным голосованием.

1.4. Snapshot Ensembling

Метод Snapshot Ensembling [2] позволяет получить несколько моделей из одного процесса обучения. Для этого используется циклическое косинусное расписание скорости обучения: скорость обучения периодически уменьшается от максимального значения до нуля, после чего резко возрастает, и модель сохраняет текущее состояние весов. Каждый локальный минимум соответствует отдельному члену ансамбля. В работе использовалось пять циклов, что давало пять «снимков» весов. Скорость обучения на эпохе t задаётся выражением:

                                     (1)

где T — длина цикла, = 0,001,  = 1·10⁻⁵.

После завершения обучения каждый снимок используется как самостоятельная модель, а итоговое предсказание формируется мажоритарным голосованием.

1.5. BatchEnsemble

Метод BatchEnsemble [3] вводит для каждого i-го члена ансамбля два обучаемых вектора  и  , которые модифицируют веса базовой модели W следующим образом:

                                                                                                  (2)

где ∘ — поэлементное умножение (произведение Адамара),  и  — векторы размерности, равной числу входных и выходных нейронов слоя соответственно. Базовая матрица W является общей для всех членов ансамбля, что позволяет хранить и обучать ансамбль с затратами, близкими к одной модели. В работе использовался ансамбль из пяти членов. Обучение проводилось одновременно для всех членов на перемешанных батчах.

1.6. Оценка качества

Для каждого метода фиксировались точность классификации на тестовой выборке и время обучения в минутах (на GPU NVIDIA T4). Эксперименты проводились для четырёх конфигураций классов: {0 %, 50 %}, {0 %, 35 %, 65 %}, {0 %, 20 %, 50 %, 65 %} и {0 %, 20 %, 35 %, 50 %, 65 %}, что позволяло проследить масштабируемость методов.

2. Результаты и обсуждение

Результаты экспериментов представлены в таблице 1.

Таблица 1.

Сравнение точности и времени обучения методов

Метод

2 класса

3 класса

4 класса

5 классов

Одиночная CNN

98,6 %

(3,35 мин)

98,5 %

(5,66 мин)

93,6 %

(6,97 мин)

83,5 %

(8,16 мин)

Bagging CNN

(5 моделей)

99,1 %

(7,82 мин)

98,8 %

(11,70 мин)

95,3 %

(14,15 мин)

87,7 %

(18,44 мин)

Snapshot Ensembling

(5 снимков)

98,8 %

(3,80 мин)

98,4 %

(6,20 мин)

94,5 %

(7,90 мин)

86,4 %

(10,50 мин)

BatchEnsemble

(5 членов)

98,7 %

(3,45 мин)

98,2 %

(6,00 мин)

94,2 %

(7,60 мин)

86,1 %

(9,80 мин)

 

Из таблицы видно, что оба предложенных метода обеспечивают сокращение времени обучения по сравнению с Bagging CNN. Для пяти классов время уменьшается с 18,44 мин до 10,50 мин (Snapshot) и 9,80 мин (BatchEnsemble), то есть в 1,75 и 1,88 раза соответственно. При этом точность снижается на 1,3 % для Snapshot и на 1,6 % для BatchEnsemble относительно Bagging CNN. Снижение точности обусловлено меньшим разнообразием моделей в ансамбле, однако оно остаётся приемлемым для многих практических задач.

На рисунке 2 приведены графики зависимости точности и времени обучения от числа классов для рассматриваемых методов.

 

Рисунок 2. Зависимость точности (слева) и времени обучения (справа) от числа классов для четырёх методов

 

Анализ показывает, что Snapshot Ensembling демонстрирует наилучший баланс между точностью и временем: его точность незначительно уступает Bagging CNN (не более 1,3 %), а время обучения сокращается почти вдвое. BatchEnsemble обеспечивает ещё большее ускорение, но точность снижается чуть сильнее (до 1,6 %), что может быть связано с ограниченной выразительностью ранговых множителей и меньшим разнообразием членов ансамбля.

Оценка разнообразия моделей (разногласие между предсказаниями) показала, что Snapshot Ensembling обеспечивает достаточное разнообразие за счёт посещения различных локальных минимумов в ходе циклического изменения скорости обучения. В BatchEnsemble разнообразие ниже, поскольку все члены используют общую базовую матрицу весов и отличаются лишь малыми множителями. Важным аспектом для практического применения является также калибровка вероятностей [7] и оценка неопределённости [8], что особенно значимо в промышленной диагностике.

3. Заключение

В работе проведено сравнительное исследование методов ускорения обучения ансамблей свёрточных нейронных сетей для задачи классификации микроструктур металлических сплавов. Показано, что Snapshot Ensembling и BatchEnsemble позволяют сократить время обучения в 1,7–1,9 раза по сравнению с классическим Bagging CNN при снижении точности не более чем на 1,6 %. Наилучший компромисс между точностью и временем достигается методом Snapshot Ensembling, который рекомендуется для практического применения в системах технической диагностики, где важны как высокая точность, так и оперативность перенастройки модели.

Перспективными направлениями дальнейших исследований являются комбинирование Snapshot Ensembling с переносом обучения, использование методов дистилляции знаний для сжатия ансамбля в одну модель, а также применение предложенных подходов к другим типам технических объектов.

 

Список литературы:

  1. Ломакина Л. С., Двитовская А. Н., Корелин К. А. Диагностирование и прогнозирование состояний технических и технологических объектов на основе ансамблевых технологий машинного обучения // Информационные и математические технологии в науке и управлении. — 2025. — № 4(40). — С. 26–37.
  2. Huang G., Li Y., Pleiss G., Liu Z., Hopcroft J. E., Weinberger K. Q. Snapshot Ensembles: Train 1, get M for free // Proceedings of the 5th International Conference on Learning Representations (ICLR). — 2017.
  3. Wen Y., Tran D., Ba J. BatchEnsemble: an Alternative Approach to Efficient Ensemble and Lifelong Learning // Proceedings of the 8th International Conference on Learning Representations (ICLR). — 2020.
  4. Сикорский О. С. Обзор свёрточных нейронных сетей для задачи классификации изображений // Новые информационные технологии в автоматизированных системах. — 2017. — С. 37-42.
  5. Breiman L. Bagging predictors // Machine Learning. — 1996. — Vol. 24, No. 2. — P. 123–140.
  6. Рзаев Б. Т., Лебедев И. С. Применение бэггинга при поиске аномалий сетевого трафика // Научно-технический вестник информационных технологий, механики и оптики. — 2021. — Т. 21, № 2. — С. 234–241.
  7. Guo C., Pleiss G., Sun Y., Weinberger K. Q. On Calibration of Modern Neural Networks // Proceedings of the 34th International Conference on Machine Learning (ICML). — 2017.
  8. Кузьмин Г. Ю., Шелманов А. О., Смирнов И. В. Непредвзятость и оценки неопределенности в задаче текстовой классификации // Искусственный интеллект и принятие решений. — 2025. — № 2. — С. 60–72.
Проголосовать за статью
Дипломы участников
У данной статьи нет
дипломов