Телефон: 8-800-350-22-65
Напишите нам:
WhatsApp:
Telegram:
MAX:
Прием заявок круглосуточно
График работы офиса: с 9:00 до 21:00 Нск (с 5:00 до 19:00 Мск)

Статья опубликована в рамках: Научного журнала «Студенческий» № 23(361)

Рубрика журнала: Информационные технологии

Скачать книгу(-и): скачать журнал

Библиографическое описание:
Яруллин Р.Р. ПРИМЕНЕНИЕ МЕТОДОВ МАШИННОГО ОБУЧЕНИЯ ДЛЯ ПРОГНОЗИРОВАНИЯ ТРУДОЕМКОСТИ ЗАДАЧ В СИСТЕМАХ УПРАВЛЕНИЯ ПРОЕКТАМИ // Студенческий: электрон. научн. журн. 2026. № 23(361). URL: https://sibac.info/journal/student/361/425305 (дата обращения: 21.07.2026).

ПРИМЕНЕНИЕ МЕТОДОВ МАШИННОГО ОБУЧЕНИЯ ДЛЯ ПРОГНОЗИРОВАНИЯ ТРУДОЕМКОСТИ ЗАДАЧ В СИСТЕМАХ УПРАВЛЕНИЯ ПРОЕКТАМИ

Яруллин Рифат Рафисович

магистрант, Казанский (Приволжский) Федеральный Университет,

РФ, г. Казань

Медведева Ольга Анатолиевна

научный руководитель,

канд. физ.-мат. наук, доц., Казанский (Приволжский) Федеральный Университет,

РФ, г. Казань

АННОТАЦИЯ

В статье рассматривается подход к прогнозированию трудоемкости задач в системах управления проектами, использующих методологии гибкой разработки. Для решения задачи применяется алгоритм градиентного бустинга, обучаемый на исторических данных завершенных задач. Признаковое пространство модели формируется из трех групп данных: текстового наименования задачи, обрабатываемого методом TF-IDF, категориальных атрибутов и агрегированной исторической статистики исполнителя. Описаны архитектура системы прогнозирования, процессы обучения и применения модели, а также особенности реализации в условиях инкрементально пополняемой базы задач. Экспериментальная оценка показала среднюю абсолютную ошибку прогнозирования 5,7 часа, что на 54% ниже по сравнению с базовым методом усреднения по проекту. Обсуждаются ограничения подхода и направления его дальнейшего развития.

 

Ключевые слова: прогнозирование трудоемкости, машинное обучение, градиентный бустинг, TF-IDF, Agile, Kanban, оценка задач, управление проектами.

 

Введение

Оценка трудоемкости является одним из ключевых этапов планирования в проектах, основанных на методологиях гибкой разработки. Точность оценок непосредственно влияет на качество итерационного планирования, формирование приоритетов и прогнозирование сроков поставки [1]. Вместе с тем получение надежных оценок остается труднодостижимой задачей: исследования показывают, что фактические затраты времени систематически отклоняются от первоначальных оценок, причем отклонения нередко носят систематический характер [1, 2].

Традиционно оценка трудоемкости осуществляется экспертными методами – Planning Poker, оценкой по аналогии или декомпозицией задачи. Несмотря на широкое распространение, эти методы подвержены когнитивным искажениям и во многом зависят от опыта конкретных участников команды [1]. Кроме того, они требуют явного привлечения специалистов на этап оценки, что увеличивает накладные расходы на планирование.

Применение методов машинного обучения открывает возможность автоматизировать первичную оценку трудоемкости на основе накопленных исторических данных. Обученная модель способна учитывать, как характеристики самой задачи, так и индивидуальные особенности исполнителей, не требуя при этом дополнительных трудозатрат на этапе планирования [3].

Целью данной работы является разработка подхода к прогнозированию трудоемкости задач на основе алгоритма градиентного бустинга и его интеграция в систему управления проектами.

Научная новизна работы заключается в адаптации методов машинного обучения к задаче прогнозирования трудоемкости в системах управления проектами за счет совместного использования текстовых признаков задач и динамически обновляемых характеристик исполнителей.

Анализ факторов, влияющих на трудоемкость задач

Трудоемкость задачи определяется совокупностью факторов, которые можно разделить на три группы.

К первой группе относятся содержательные характеристики задачи – смысловая сложность, функциональная область, тип выполняемой работы. Эти характеристики в значительной мере отражаются в наименовании задачи: разработка нового функционала, исправление ошибки или написание документации, как правило, требуют принципиально разных затрат времени. Анализ текстовых описаний позволяет извлечь имплицитную информацию о характере задачи, недоступную при использовании только структурированных атрибутов [4].

Ко второй группе относятся формальные атрибуты – тип задачи и ее приоритет. Тип задачи отражает ее функциональную природу и, как правило, коррелирует с характерными временными затратами. Приоритет косвенно указывает на срочность и возможные ограничения, влияющие на продолжительность выполнения [5].

К третьей группе относятся факторы, связанные с исполнителем. Производительность участников одной команды может существенно различаться в зависимости от опыта, специализации и особенностей работы. Исторические данные о завершенных задачах позволяют строить профиль исполнителя, характеризующий его среднюю производительность и степень ее предсказуемости [3, 6].

Перечисленные группы факторов разнородны по природе и требуют различных методов преобразования для совместного использования в модели машинного обучения [7].

Формирование входных данных модели

Признаковое пространство модели формируется из трех соответствующих групп данных, каждая из которых обрабатывается отдельным методом.

Текстовые признаки извлекаются из наименования задачи методом TF-IDF [4]. Метод присваивает каждому термину вес, учитывающий частоту его встречаемости в конкретной задаче и редкость в рамках общей совокупности задач рабочего пространства. Таким образом, специфичные для проекта технические термины получают более высокий вес по сравнению с общеупотребительными словами, что позволяет модели улавливать предметно-ориентированные закономерности.

Категориальные признаки – тип задачи и приоритет – кодируются порядковым кодировщиком. Данный метод выбран для сокращения размерности признакового пространства: в отличие от one-hot encoding, он не увеличивает число признаков при росте числа категорий.

Признаки исполнителя формируются путем агрегирования исторических данных по завершенным задачам. Для каждого исполнителя вычисляются два показателя: среднее время выполнения задач и стандартное отклонение данного показателя. Первый характеризует среднюю производительность, второй – стабильность результатов. При отсутствии достаточного количества исторических данных о конкретном исполнителе применяется импьютация средними значениями по проекту, что позволяет корректно обрабатывать случай холодного старта. Итоговый вектор признаков объединяет три описанные группы.

Архитектура системы

Система прогнозирования функционирует в двух режимах: обучения и предсказания.

В режиме обучения система извлекает из аналитического хранилища событий данные о завершенных задачах – фактическое время выполнения, вычисляемое как разница между временными метками первого перехода задачи в рабочий статус и ее закрытия. Параллельно из оперативной базы данных загружаются атрибуты задач и вычисляется статистика исполнителей. Обученная модель сохраняется для последующего использования, статистика исполнителей кэшируется отдельно с фиксированным временем жизни.

В режиме предсказания система принимает запрос с атрибутами новой задачи, формирует вектор признаков на основе сохраненной статистики исполнителей и применяет обученную модель для получения оценки трудоемкости.

В качестве алгоритма машинного обучения используется градиентный бустинг над деревьями решений [5]. Алгоритм последовательно строит ансамбль слабых моделей, каждая из которых корректирует ошибки предыдущих. Такой подход эффективно обрабатывает гетерогенные признаковые пространства и не требует строгих предположений о распределении данных [5, 6].

Повторное обучение модели выполняется по расписанию, что позволяет системе адаптироваться к изменениям в составе команды и характере задач по мере накопления новых исторических данных. Статистика исполнителей обновляется при каждом цикле переобучения: агрегированные показатели пересчитываются по всем завершенным на момент запуска задачам и сохраняются в кэше с ограниченным временем жизни. Такой механизм позволяет учитывать изменения состава команды и динамику производительности участников без необходимости полного переобучения модели.

Результаты и обсуждение

Для оценки качества модели использовалась выборка завершенных задач, накопленных в процессе работы системы. Данные были разделены в соотношении 80/20 на обучающую и тестовую выборки. В качестве реализации алгоритма использовалась библиотека scikit-learn (класс GradientBoostingRegressor). Качество прогнозирования оценивалось по двум метрикам: средней абсолютной ошибке (MAE) и среднеквадратичной ошибке (RMSE). Для сравнения рассматривались два базовых метода: прогноз по среднему времени выполнения задач в проекте и линейная регрессия на тех же признаках.

Градиентный бустинг демонстрирует наилучшее качество по обоим показателям: MAE составила 5,7 часа, RMSE – 8,9 часа. Базовый метод усреднения по проекту показал MAE 12,4 часа и RMSE 18,7 часа, линейная регрессия – MAE 8,1 часа и RMSE 12,5 часа. Таким образом, предложенный подход снижает среднюю абсолютную ошибку на 54% относительно базового метода и на 30% относительно линейной регрессии. Анализ результатов показывает существенное влияние признаков исполнителя на итоговое качество прогнозирования: исключение этой группы признаков из обучения приводило к росту MAE до уровня, сопоставимого с линейной регрессией. Текстовые признаки на основе TF-IDF вносят наибольший вклад для задач с выраженной предметной спецификой. Несмотря на ограниченный объем выборки, полученные результаты демонстрируют работоспособность предложенного подхода.

К ограничениям подхода следует отнести проблему холодного старта: при небольшом количестве завершенных задач в рабочем пространстве качество прогнозирования снижается вследствие недостаточного объема обучающей выборки. Кроме того, модель не учитывает контекстуальных зависимостей между задачами одного спринта или связанными задачами.

Перспективными направлениями развития являются использование эмбеддингов вместо TF-IDF для текстового представления задач, включение в модель информации о зависимостях между задачами, а также оценка неопределенности прогноза для предоставления пользователю доверительного интервала наряду с точечной оценкой.

Заключение

В работе представлен подход к прогнозированию трудоемкости задач в системах управления проектами на основе алгоритма градиентного бустинга. Предложенное признаковое пространство объединяет три группы данных – текстовые характеристики задачи, ее формальные атрибуты и историческую статистику исполнителя, – что позволяет учитывать, как содержательную сложность задачи, так и индивидуальные особенности ее выполнения.

Разработанная система функционирует в двух режимах – обучения и предсказания, и интегрирована в существующую систему управления проектами без изменения основных рабочих процессов. Практическая значимость работы заключается в возможности автоматической поддержки планирования: система предоставляет команде первичную оценку трудоемкости до начала выполнения задачи, снижая зависимость процесса планирования от субъективных суждений и временных затрат на экспертную оценку.

 

Список литературы:

  1. Jørgensen M., Shepperd M. A Systematic Review of Software Development Cost Estimation Studies // IEEE Transactions on Software Engineering. – 2007. – Т. 33, № 1. – С. 33–53.
  2. Kemerer C. F. An Empirical Validation of Software Cost Estimation Models // Communications of the ACM. – 1987. – Т. 30, № 5. – С. 416–429.
  3. Choetkiertikul M., Dam H. K., Tran T., Ghose A. Predicting the Delay of Issues with Due Dates in Software Projects // Empirical Software Engineering. – 2017. – Т. 22, № 3. – С. 1223–1263.
  4. Manning C. D., Raghavan P., Schütze H. Introduction to Information Retrieval. – Cambridge : Cambridge University Press, 2008. – 544 с.
  5. Friedman J. H. Greedy Function Approximation: A Gradient Boosting Machine // The Annals of Statistics. – 2001. – Т. 29, № 5. – С. 1189–1232.
  6. Aggarwal C. C. Outlier Analysis. – 2-е изд. – Cham : Springer, 2017. – 446 с.
  7. Guyon I., Elisseeff A. An Introduction to Variable and Feature Selection // Journal of Machine Learning Research. – 2003. – Т. 3. – С. 1157–1182.