Статья опубликована в рамках: Научного журнала «Студенческий» № 29(367)
Рубрика журнала: Математика
Скачать книгу(-и): скачать журнал
МАТЕМАТИЧЕСКИЕ АСПЕКТЫ ПРИМЕНЕНИЯ МЕТОДОВ МАШИННОГО ОБУЧЕНИЯ ДЛЯ ОЦЕНКИ КРЕДИТНОГО РИСКА В ФИНАНСОВЫХ ОРГАНИЗАЦИЯХ
MATHEMATICAL ASPECTS OF THE APPLICATION OF METHODS MACHINE LEARNING FOR CREDIT RISK ASSESSMENT IN FINANCIAL INSTITUTIONS
Rizhkina Violetta Dmitrievna
Student, Department of Finance and Credit, Ulyanovsk State University,
Russia, Ulyanovsk
АННОТАЦИЯ
Статья посвящена исследованию математических аспектов применения методов машинного обучения в задачах оценки кредитного риска финансовых организаций. Рассмотрены подходы к предварительной обработке финансовых данных, стандартизации признаков и математической подготовке информации для интеллектуального анализа. Описаны особенности использования вероятностных и статистических моделей машинного обучения при кредитном скоринге и прогнозировании дефолта заемщиков. Определены преимущества применения математических методов искусственного интеллекта в условиях цифровизации финансового сектора и роста объёмов обрабатываемых данных.
ABSTRACT
The article is devoted to the study of mathematical aspects of the application of machine learning methods in the tasks of assessing the credit risk of financial institutions. Approaches to the preliminary processing of financial data, standardization of features and mathematical preparation of information for intellectual analysis are considered. The specifics of using probabilistic and statistical machine learning models in credit scoring and forecasting the default of borrowers are described. The advantages of using mathematical methods of artificial intelligence in the context of digitalization of the financial sector and the growth of the volume of processed data are determined.
Ключевые слова: машинное обучение, математическое моделирование, кредитный риск, кредитный скоринг, искусственный интеллект.
Keywords: machine learning, mathematical modeling, credit risk, credit scoring, artificial intelligence.
Когда финансы шагнули в цифровую эру, объем данных, с которыми работают банки, буквально «взлетел». Взять хотя бы обработку заявок на кредиты, тут каждый клиент оставляет за собой целый след - доходы, расходы, возвраты по прошлым займам. Аналогично и с анализом финансового поведения клиентов или с попытками заранее предсказать вероятность дефолта: цифры льют рекой. Раньше для оценки кредитного риска полагались на статистику и мнения экспертов. Но эти методы уже не поспевают за новыми реалиями. Банки постепенно переключаются на инструменты машинного обучения - и вот тут раскрывается целый спектр новых возможностей. Машинное обучение способно «увидеть» в данных то, что человек просто пропустит - заметить хитрые зависимости между колонками таблицы или учесть множество мелких факторов, которые поодиночке вроде и не важны, а вместе дают тот самый сигнал «тревога». Как только банк внедряет такие интеллектуальные подходы, он получает ощутимое преимущество, например, может почувствовать волну просрочек еще до того, как она захлестнет весь портфель или справляться со все более сложными финансовыми продуктами без лишнего стресса для сотрудников.
Однако все это начинает работать только тогда, когда данные поддаются тщательной предварительной обработке - иначе алгоритмы будут гадать на кофейной гуще. Особого внимания заслуживают выбросы - в финансовых данных они встречаются постоянно из-за скачков в доходах или слишком экзотических кредитных сумм. И если не потратить время на их обработку (а иногда инженер должен даже задуматься - а выброс ли это или вполне честная уникальная ситуация?), то точность любых прогнозов резко падает. Так что модели начинаются не с нейронных сетей, а с грамотной уборки и понимания своих данных. Для устранения влияния различия масштабов признаков используется процедура стандартизации данных на основе Z-преобразования [5]. Преобразование выполняется по следующей формуле:
(1)
где
– исходное значение
-го признака
-го клиента,
– среднее арифметическое признака по выборке,
– выборочное стандартное отклонение.
С категориальными признаками приходится действовать иначе. В том же банке куча информации представлена словами или метками - цель кредита («путешествие», «ремонт»), тип жилья («аренда», «собственное»), был ли дефолт - да/нет… Если оставить всё как есть, алгоритмы не смогут адекватно разобраться, какая «цель кредита» важнее другой (ведь для компьютера они просто слова). Поэтому каждую категорию превращаем в отдельный бинарный столбец через one-hot-кодирование - своего рода чек-боксы «выбрано/не выбрано». Например, из цели кредита появится столько столбцов, сколько различных целей встречается в ваших данных; напротив нужной ячейки будет стоять единица, напротив остальных нули. Это делает входные данные понятными для модели и открывает путь к поиску реальных зависимостей между характеристиками клиента и его поведением.
В итоге подготовка данных оказывается определяющей для того, насколько вообще модель сможет распознать что-нибудь полезное среди шумных таблиц клиентских досье. А без таких шагов дальше двигаться попросту бессмысленно. Для минимизации влияния экстремальных значений применяется межквартильный метод обнаружения выбросов [6]. Нормативный интервал рассчитывается следующим образом -
и
обозначают первый и третий квартиль признака, а
. Нормативный интервал считается по формуле
(2)
Если мы обнаруживаем значения, которые выбиваются за рамки установленного диапазона, эти наблюдения просто убираются из обучающей выборки. Такой фильтр не просто «поддержание порядка» — это способ сделать нашу модель более устойчивой. Если оставить экстремальные или аномальные случаи, можно получить довольно странные прогнозы, например, начнем ошибочно переоценивать риск кредитования для вполне надежных заемщиков. Когда первичная чистка и обработка завершена, дальше анализ принимают на себя модели анализа. Сейчас в кредитном скоринге на практике используется целый набор алгоритмов - каждый по-своему справляется с данными, отличается глубиной интерпретации и тем, насколько спокойно переносит помехи и «шумы» в информации. Чаще всего встречаются логистическая регрессия (её очень часто применяют ввиду прозрачности - хорошо видно, какие факторы реально влияют на итог); наивный байесовский классификатор; случайный лес; варианты градиентного бустинга и разные гибридные нейросетевые решения.
Интересно отметить, что логистическая регрессия до сих пор считается почти стандартом в банковских задачах. Причина проста - для финансовых организаций критически важно понимать - из чего складывается результат расчета риска и почему система приняла то или иное решение. Логистическая регрессия дает возможность буквально разобрать вклад каждого признака, что незаменимо при построении собственных рейтинговых систем (IRB). Обычно первичная настройка скоринговой системы как раз строится именно на этом алгоритме - мы можем не только оценить вероятность дефолта для конкретного заемщика, но и понять каким образом тот или иной фактор влияет на финальное решение. Правдоподобие результата вычисляется через следующую функцию:
(3)
где
– индикатор дефолта,
– вектор стандартизованных признаков,
– веса.
Вероятность дефолта заемщика в данной модели рассчитывается через логистическую функцию:
(4)
Эта функция переводит линейную комбинацию признаков заемщика в число от 0 до 1 - по сути, в вероятность дефолта. Чем ближе результат к единице, тем выше кредитный риск и шанс невыполнения обязательств. Модель не только оценивает общий риск, но и показывает, как каждый конкретный признак влияет на вероятность возврата кредита. Это особенно ценно для банков - учет значимости факторов важен с точки зрения регуляторов.
Наивный байесовский классификатор хорошо подходит для быстрой работы с большими массивами данных и ограниченных вычислительных ресурсов. Он строится на предположении независимости признаков и быстро распределяет клиентов по группам риска. К ансамблевым методам относятся случайный лес и градиентный бустинг. Они объединяют множество простых моделей и за счет этого точнее прогнозируют дефолты, умеют ловить сложные, нелинейные взаимосвязи между доходами, долговой нагрузкой и финпоказателями.
Современные системы скоринга все чаще используют гибридные решения: нейронные сети сочетаются с бустингом. Например, автоэнкодеры могут находить скрытые взаимосвязи между характеристиками клиента, делая обработку даже неструктурированных данных эффективной, что особенно важно при возрастающих объемах информации и требований к скорости. Краткий обзор преимуществ искусственного интеллекта в финансах приведен в таблице 1.
Таблица 1.
Преимущества применения математических методов машинного обучения в оценке кредитного риска
|
Направление применения |
Основные преимущества |
|
Кредитный скоринг |
Повышение точности оценки кредитоспособности заемщиков |
|
Прогнозирование дефолта |
Раннее выявление проблемных клиентов |
|
Анализ больших данных |
Возможность обработки значительных объёмов информации |
|
Автоматизация принятия решений |
Снижение нагрузки на кредитных специалистов |
|
Выявление скрытых зависимостей |
Обнаружение сложных нелинейных факторов риска |
|
Управление кредитным портфелем |
Снижение доли проблемной задолженности |
|
Цифровизация финансовых услуг |
Повышение скорости обработки заявок |
|
Персонализация финансовых продуктов |
Формирование индивидуальных кредитных предложений |
Можно посмотреть, что происходит, когда финансовые компании внедряют машинное обучение для оценки кредитного риска - эффективность их работы буквально меняется на глазах. Алгоритмы, давайте будем честны, это уже не просто «экселевские формулы», они копаются в многослойных финансовых данных куда глубже, чем человек смог бы за разумное время. Оценка надежности заемщиков переходит из разряда интуитивно-бумажной рутины в сферу точных и быстрых прогнозов; автоматизация тут вообще играет на опережение. Отметим основные выводы по работе.
1. Всё начинается с подготовки данных. Без предварительной обработки (когда очищаем цифры и приводим их к единому виду) никакие красивые модели предсказания работать не будут.
2. Когда методы машинного обучения доведены до ума, кредитный скоринг становится не просто чуть лучше, он в точности определяет тех, кто может сорваться в дефолт. Это позволяет банку принимать решения быстрее и с меньшими рисками.
3. Внедрение AI-технологий высвобождает ручной труд отовсюду - автоматизируются процессы проверки заявок, пересчёта рисков, создаются устойчивые системы раннего реагирования на потенциальные проблемы. Банки становятся более устойчивыми к потрясениям.
Если говорить коротко - возникает совершенно иной уровень уверенности и гибкости для банковских организаций.
Список литературы:
- Кантаев Н.К. Перспективы использования методов машинного обучения для оценки кредитных рисков // Вестник евразийской науки. 2025. №2S. С. 34.
- Пантелеева А. И. Использование машинного обучения для прогнозирования финансовых кризисов и оценки системных рисков // Вестник науки. 2025. №1 (82). С. 1078-1083.
- Жураев Ж. Д. Использование методов машинного обучения в моделировании кредитного скоринга // Вестник науки. 2021. №6-1 (39). С. 87-91.
- Чуб В.С. Сравнительный анализ методов машинного обучения в оценке кредитных рисков // Образовательные ресурсы и технологии. 2023. №3 (44). С. 81-92.
- Луценко Е.В., Сергеев А.Э., Головин Н.С., Русаков С.В. Применение искусственного интеллекта для оценки риска банкротства предприятия // Научный журнал КубГАУ. 2024. №204. С. 18.
- Коваленко А. В., Третьякова С. Н., Линкевич Е. Ф. Системы искусственного интеллекта для оценки корпоративных финансов // ЕГИ. 2024. №6 (56). С. 814-820.

