Статья опубликована в рамках: Научного журнала «Студенческий» № 27(365)
Рубрика журнала: Информационные технологии
Скачать книгу(-и): скачать журнал
АНАЛИЗ И ВЫБОР ТЕХНОЛОГИЙ МАШИННОГО ОБУЧЕНИЯ ДЛЯ ЗАДАЧ КЛАССИФИКАЦИИ ДАННЫХ
ANALYSIS AND SELECTION OF MACHINE LEARNING TECHNOLOGIES FOR DATA CLASSIFICATION TASKS
Fendrikov Alexey Valerievich
Student, Department of Information Technologies and Computing Systems, Moscow State University of Technology "STANKIN",
Russia, Moscow
АННОТАЦИЯ
В статье рассматриваются основные алгоритмы машинного обучения, применяемые для решения задач классификации данных. Проведен сравнительный анализ методов оценки качества классификационных моделей, а также сформулированы критерии выбора алгоритма в зависимости от особенностей решаемой задачи.
ABSTRACT
The article examines the main machine learning algorithms used to solve data classification problems. A comparative analysis of methods for evaluating the quality of classification models is carried out, and criteria for selecting an algorithm depending on the specifics of the task are formulated.
Ключевые слова: машинное обучение; классификация данных; алгоритмы обучения; оценка качества модели; нейронные сети.
Keywords: machine learning; data classification; learning algorithms; model quality assessment; neural networks.
Задача классификации данных является одной из наиболее распространенных в области машинного обучения и находит применение в различных сферах — от распознавания образов до анализа поведения пользователей информационных систем. Разнообразие существующих алгоритмов классификации требует от разработчика обоснованного выбора технологии, соответствующей особенностям решаемой задачи и характеристикам имеющегося набора данных.
Среди классических алгоритмов классификации выделяют логистическую регрессию, деревья решений и метод опорных векторов. Логистическая регрессия применяется для решения задач с линейно разделимыми классами и отличается высокой интерпретируемостью результатов, тогда как деревья решений позволяют выявлять нелинейные зависимости между признаками и строить модели, допускающие содержательную интерпретацию правил классификации [1, с. 87].
Для оценки качества построенных классификационных моделей применяется набор метрик, включающий точность (accuracy), полноту (recall), точность положительных предсказаний (precision) и их гармоническое среднее — F-меру. Выбор конкретной метрики определяется спецификой предметной области: в задачах с несбалансированными классами применение одной лишь метрики точности может приводить к искаженной оценке качества модели, вследствие чего предпочтение отдается метрикам, учитывающим соотношение классов [2, с. 145].
Развитие вычислительных мощностей и накопление больших объемов размеченных данных обусловили широкое распространение нейросетевых методов классификации, позволяющих автоматически извлекать значимые признаки из исходных данных без необходимости их ручного конструирования. Применение глубоких нейронных сетей особенно эффективно при решении задач классификации изображений и текстов, характеризующихся высокой размерностью входных данных [3, с. 202].
Выбор конкретного алгоритма классификации определяется рядом факторов: объемом доступных обучающих данных, требованиями к интерпретируемости получаемой модели, доступными вычислительными ресурсами и допустимым временем обучения. При ограниченном объеме данных и необходимости содержательного объяснения принимаемых моделью решений предпочтение, как правило, отдается классическим алгоритмам, тогда как при наличии больших размеченных выборок целесообразным становится применение нейросетевых архитектур.
Таким образом, выбор технологии машинного обучения для решения задачи классификации данных должен основываться на комплексном анализе характеристик исходных данных и требований, предъявляемых к разрабатываемой модели. Обоснованный выбор алгоритма и корректная оценка качества построенной модели являются необходимыми условиями создания эффективных систем автоматической классификации данных.
Список литературы:
- Флах П. Машинное обучение. — М.: ДМК Пресс, 2015. — 400 с.
- Джеймс Г., Уиттон Д., Хасти Т., Тибширани Р. Введение в статистическое обучение с примерами на языке R. — М.: ДМК Пресс, 2017. — 450 с.
- Николенко С., Кадурин А., Архангельская Е. Глубокое обучение. — СПб.: Питер, 2018. — 480 с.

