Статья опубликована в рамках: CLXIV Международной научно-практической конференции «Научное сообщество студентов XXI столетия. ТЕХНИЧЕСКИЕ НАУКИ» (Россия, г. Новосибирск, 06 августа 2026 г.)
Наука: Информационные технологии
Скачать книгу(-и): Сборник статей конференции
дипломов
КОМПОЗИТНЫЙ ИНДЕКС СЕМАНТИЧЕСКОЙ ДЕЗОРГАНИЗАЦИИ ПОЛЬЗОВАТЕЛЬСКИХ ФАЙЛОВЫХ КОЛЛЕКЦИЙ ДЛЯ ЛОКАЛЬНЫХ СИСТЕМ РЕСТРУКТУРИЗАЦИИ
COMPOSITE INDEX OF SEMANTIC DISORGANIZATION OF USER FILE COLLECTIONS FOR LOCAL RESTRUCTURING SYSTEMS
Kolbin Ilya Dmitrievich
Student, Department of Automated Information Processing and Control Systems, Kalashnikov Izhevsk State Technical University,
Russia, Izhevsk
АННОТАЦИЯ
В статье предлагается концепция композитного индекса семантической дезорганизации пользовательских файловых коллекций по шкале от 0 до 10, объединяющего структурные, эмбеддинговые, временны́е и поведенческие признаки. Обосновывается использование плотностного индекса DBCV в качестве компонента валидации кластеризации. Описывается возможная схема интеграции метрики в конвейер «эмбеддер → UMAP → HDBSCAN → именование локальной языковой моделью». Предлагаемая методика направлена на заполнение лакуны в инструментах диагностики беспорядка, выявленной в систематических обзорах файлового менеджмента, и ориентирована на применение в настольных системах с полностью локальной обработкой данных. Работа носит концептуальный характер: SDI на текущем этапе представляет собой проектируемую метрику, не проходившую эмпирической валидации; её верификация выходит за рамки статьи и относится к последующим этапам исследования.
ABSTRACT
The paper proposes the concept of a composite index of semantic disorganization of user file collections on a 0-to-10 scale, combining structural, embedding-based, temporal and behavioural features. The use of the density-based DBCV index as a clustering validation component is substantiated. A possible scheme for integrating the metric into the pipeline "embedder → UMAP → HDBSCAN → cluster naming by a local language model" is described. The proposed methodology addresses a gap in the tools available for diagnosing disorder in file collections and is intended for desktop systems with fully local data processing. The work is conceptual in nature: at the present stage, SDI is a metric under design that has not undergone empirical validation; its verification lies beyond the scope of this paper and pertains to subsequent stages of the research.
Ключевые слова: семантическая дезорганизация, файловые коллекции, эмбеддинги, кластеризация, HDBSCAN, DBCV, цифровое накопительство, локальная обработка, мультимодальный анализ, композитная метрика.
Keywords: semantic disorganization; file collections; embeddings; clustering; HDBSCAN; DBCV; digital hoarding; local processing; multimodal analysis; composite metric.
Введение
В условиях массовой цифровизации электронные документы становятся основным носителем персональной информации, однако пользовательские файловые коллекции, как правило, остаются неорганизованными: файлы не подписаны, разбросаны по уровням иерархии и слабо связаны семантически. Подобное состояние получило в литературе устойчивое определение цифрового накопительства (digital hoarding) [1; 2] и связано не только с организационными издержками, но и с повышенной тревожностью [3], а также с утомлением и ростом когнитивных ошибок пользователя [4].
Систематический обзор Диннина и Жюльена, охватывающий более 230 работ в области файлового менеджмента, характеризует управление файлами как повсеместную, трудную и слабо поддерживаемую деятельность и констатирует, что полного количественного описания файлового поведения в литературе не существует и оно не может быть получено путём кросс-исследовательского анализа [5]. Универсальной численной метрики, способной оценить степень беспорядка в конкретной пользовательской коллекции, в рассмотренной литературе, насколько известно авторам, также не предложено. Известные авторам инструменты автоматической организации файлов, как правило, либо опираются исключительно на промптинг крупных языковых моделей, либо передают данные на облачные серверы, либо ограничиваются ручным тегированием, не предлагая количественной диагностики. Внутренние индексы кластеризации (силуэт, индекс Дэвиса–Болдина, DBCV) пригодны для технической валидации разбиения, но не отражают пользовательски релевантной дезорганизации в целом, а опросник System Usability Scale [6] оценивает удовлетворённость интерфейсом, но не качество самой коллекции.
Объектом настоящего исследования являются пользовательские файловые коллекции как информационная и поведенческая структура. Предметом — методы численной оценки степени их семантической дезорганизации. Цель работы — обосновать и описать концепцию композитного индекса семантической дезорганизации (Semantic Disorganization Index, SDI), пригодного для последующей реализации в составе локальной системы автоматической реструктуризации файловых коллекций без передачи данных в облачные сервисы. Работа носит концептуальный характер: предложенная методика формирует основу для дальнейшей экспериментальной проверки, но не претендует на её замену.
Гипотеза исследования заключается в том, что комбинация структурных, эмбеддинговых, временны́х и поведенческих признаков, агрегированных по нелинейной схеме с верификацией внутренней метрикой DBCV, может дать интерпретируемую численную оценку дезорганизации по шкале от 0 до 10, предположительно согласованную с субъективным восприятием пользователя. Проверка этой гипотезы относится к последующим этапам работы. Методологической основой настоящей статьи выступают методы дистрибутивной семантики (плотные эмбеддинги документов), плотностной кластеризации (HDBSCAN с предобработкой UMAP), внутренней валидации кластеризации (DBCV), а также анализ эмпирических исследований цифрового накопительства.
1. Источники и проявления семантической дезорганизации
Семантическая дезорганизация файловой коллекции — не одномерный феномен, а результат взаимодействия нескольких независимых процессов. Свитен и коллеги [3] на качественной выборке из 45 участников выделили пять ключевых барьеров к удалению файлов: сохранение «на всякий случай» или для будущего использования, хранение файлов как доказательств, восприятие удаления как трудоёмкого или бессмысленного действия, эмоциональную привязанность к данным и перенос ответственности за хранение на владельцев серверов. Как отмечается в обзоре [5], пользователи, как правило, плохо осведомлены о собственном файловом поведении и вряд ли способны оценить, например, число хранимых ими дублирующихся файлов, что делает количественный учёт обязательной частью диагностики.
Маккеллар и соавторы [7] на основе интервью с 20 сотрудниками двух крупных наукоёмких организаций, набравшими высокие баллы по шкале DHQ [1], выделили четыре дополнительных мотиватора накопительства в организационной среде: тревогу, соответствие нормативным требованиям, отстранённость и коллекционирование. Дополнительный фактор связан не с мотивацией пользователя, а с геометрией самого хранилища: согласно обзору [5], высота дерева задаёт глубину обхода при поиске файла, ширина уровня и коэффициент ветвления — число папок, конкурирующих за внимание пользователя на каждом шаге навигации, а неоднородность ветвей повышает вероятность столкнуться с незнакомо устроенным участком коллекции; рост глубины иерархии, в свою очередь, увеличивает дублирование имён и время извлечения файлов. Из этого следует, что любая адекватная метрика дезорганизации должна охватывать минимум четыре класса признаков: структурные (геометрия дерева папок), эмбеддинговые (семантическая связанность содержимого), временны́е (давность последнего использования) и поведенческие (частота обращений к областям коллекции).
2. Структурный компонент
Структурный компонент S ∈ [0, 1] предлагается определять на основе геометрии дерева каталогов без чтения содержимого. Согласно [5], число подпапок на одном уровне определяет количество вариантов, конкурирующих за внимание пользователя на каждом шаге навигации, а увеличение глубины иерархии повышает как дублирование имён, так и время извлечения файлов; при этом приводимые в обзоре эмпирические данные показывают крайне широкий разброс наблюдаемых глубин (от одного до шестнадцати уровней) и коэффициентов ветвления (от 1,84 до 41,8), что не позволяет заимствовать «оптимальный» диапазон из литературы напрямую. В предлагаемой методике структурный компонент агрегирует три нормированных подкомпонента: показатель ширины папок (доля папок, содержащих более Nmax элементов), показатель экстремальной глубины (отклонение средневзвешенной глубины файла от условно оптимального диапазона от двух до пяти уровней, принимаемого в качестве рабочего допущения) и показатель доли файлов с шаблонными или служебными именами (например, «новый_документ_(2).docx», «IMG_0123.jpg», «Снимок экрана»). Выбор пороговых значений и весов носит первоначальный характер и подлежит эмпирической калибровке.
Каждый подкомпонент приводится к отрезку [0, 1] и на первом этапе агрегируется с равными весами. Вычисления выполняются без чтения содержимого файлов, что обеспечивает низкое потребление оперативной памяти и делает расчёт пригодным для фоновой работы на настольных системах с ограниченными вычислительными ресурсами. Ожидается, что структурный компонент сохранит диагностическую ценность даже на коллекциях, которые по эмбеддинговым признакам выглядят согласованными: папка уровня «Документы», содержащая 5000 файлов, остаётся источником беспорядка даже при их тематической однородности, поскольку затрудняет визуальный просмотр и прямой доступ к отдельному файлу.
3. Эмбеддинговый компонент
Эмбеддинговый компонент E ∈ [0, 1] предполагается центральным элементом индекса. Каждый файл представляется плотным вектором с использованием модели семейства E5 [8] или GTE [9] для текстов и CLIP [10] для изображений; открытые эмбеддинг-модели демонстрируют качество, сопоставимое с проприетарными решениями, при кратно меньших вычислительных требованиях: E5 при дообучении превосходит модели с сорокакратно бо́льшим числом параметров [8], а GTEbase объёмом 110 млн параметров опережает как закрытый эмбеддинг-сервис OpenAI, так и модели, превосходящие её по размеру на порядок [9]; аналогичная тенденция прослеживается и для генеративных моделей, применяемых в системе на этапе именования кластеров — открытые семейства достигают качества, сопоставимого с ведущими проприетарными решениями на широком круге задач [11]. Поскольку текстовые (E5, GTE) и визуальная (CLIP) модели формируют векторы в различных, взаимно несовместимых семантических пространствах, модальности обрабатываются раздельно: эмбеддинги, кластеризация и производные от них меры вычисляются независимо для каждой модальности и агрегируются на уровне нормированных показателей; альтернативой выступает применение единой мультимодальной модели для всех типов файлов. Перед последующей обработкой векторы предлагается сжимать нелинейным методом UMAP [12], который, в отличие от методов, ориентированных исключительно на визуализацию, не накладывает вычислительных ограничений на размерность целевого пространства и потому применим как метод редукции общего назначения. Размерность выбирается не менее 15 (в предлагаемой системе — от 15 до 30): по данным эмпирического исследования Эклунда и коллег [13], редукция UMAP до не менее чем 15 измерений обеспечивает качественную основу для кластеризации независимо от выбранного алгоритма, тогда как более агрессивное сжатие ведёт к деградации разбиения вследствие потери структуры данных. Указанный вывод получен на эмбеддингах BERT и Doc2Vec, поэтому его перенос на модели семейств E5 и GTE носит характер рабочего допущения и требует проверки на целевых данных.
В рамках предлагаемой методики эмбеддинговый компонент агрегирует две независимые меры. Первая — семантическое рассеяние коллекции, определяемое как дополнение среднего попарного косинусного сходства векторов документов до единицы; мера вычисляется непосредственно по эмбеддингам и не зависит от результатов кластеризации HDBSCAN [14]. Чем ниже среднее сходство, тем менее семантически связана коллекция в целом. Обоснованность использования близости плотных эмбеддингов как индикатора смысловой однородности опирается на результаты Петуховой и коллег [15], показавших, что эмбеддинги современных языковых моделей эффективно передают тонкие семантические различия текстов и обеспечивают качественную кластеризацию документных коллекций. Следует оговорить, что эти результаты получены на структурированных текстах формального стиля (научные аннотации, новостные и веб-документы), тогда как пользовательские коллекции содержат существенно более разнородный материал; переносимость выводов на такие данные подлежит экспериментальной проверке. Отметим, что отношение общей дисперсии коллекции к средней внутрикластерной дисперсии в качестве меры рассеяния сознательно не используется: в силу разложения полной дисперсии на внутри- и межкластерную составляющие высокие значения такого отношения соответствуют компактным и хорошо разделённым кластерам, то есть выраженной тематической структуре коллекции, а не её дезорганизации.
Вторая мера — доля выбросов, то есть отношение числа точек, отнесённых алгоритмом HDBSCAN [14] к шуму (в распространённых программных реализациях такие точки помечаются меткой −1), к общему числу файлов. Доля выбросов рассматривается как прямая мера семантической фрагментации, не требующая дополнительных вычислений: коллекция с высокой долей выбросов содержит значительное число файлов без семантических «соседей». Качество кластеризации, определяющей долю выбросов, предлагается валидировать внутренним индексом DBCV [16], выбор которого обоснован сравнительным исследованием [17]: DBCV превосходит альтернативные плотностные индексы (DCSI, CDbw, VIASCKDE) при оценке кластеров вогнутой формы и вложенной структуры — именно тех, что возникают после нелинейного сжатия UMAP. Следует также учитывать, что доля выбросов чувствительна к гиперпараметрам HDBSCAN — минимальному размеру кластера (min_cluster_size) и минимальному числу соседей в плотностной оценке (min_samples): их увеличение приводит к росту числа точек, помечаемых как шум, даже на неизменной коллекции. Поэтому конфигурацию кластеризации предлагается фиксировать для всех сравниваемых состояний коллекции, в том числе при повторном вычислении индекса до и после реструктуризации, а её выбор осуществлять по сетке значений с максимизацией DBCV; идентичность гиперпараметров является необходимым условием корректного сравнения значений индекса между состояниями коллекции, поскольку при её нарушении расхождение доли выбросов может отражать смену конфигурации, а не изменение самой коллекции. Низкое значение DBCV (близкое к −1) свидетельствует о недостоверности кластеризации. Существенно, что низкое значение DBCV не должно транслироваться в снижение эмбеддингового компонента: если алгоритм плохо разделил действительно хаотичную коллекцию, механическое понижение E искусственно занизило бы индекс беспорядка. Вместо этого DBCV трактуется как мера доверия к кластерозависимым величинам: при низких значениях доля выбросов исключается из расчёта или понижается в весе в пользу бескластерной меры рассеяния, а итоговое значение SDI сопровождается пониженной оценкой достоверности; конкретная схема учёта доверия подлежит экспериментальному уточнению.
4. Временной и поведенческий компоненты
Временной компонент T ∈ [0, 1] предлагается определять на основе метаданных файлов — дат создания и последнего изменения, а также, при подтверждённой доступности и актуальности, даты последнего доступа: в Windows обновление соответствующей метки NTFS может быть отключено на системном уровне либо искажаться служебными процессами (индексирование, антивирусное сканирование, резервное копирование), поэтому основными временными сигналами выступают даты создания и изменения, дополняемые наблюдаемой системой активностью пользователя. Исследования цифрового накопительства показывают устойчивую склонность пользователей к чрезмерному накоплению данных и затруднения при их удалении [3; 7]. В настоящей методике предполагается, что временные характеристики коллекции — давность последнего использования файлов и наличие длительно нетронутых областей могут служить дополнительными признаками дезорганизации. В предлагаемой методике T агрегирует медиану «возраста бездействия» (время с последнего изменения файла либо, при достоверности соответствующей метки, с последнего обращения к нему) и долю папок, в которых более 80 % файлов имеют временную метку старше двух лет, — такие папки могут трактоваться как «забытые» области коллекции, дополнительно увеличивающие воспринимаемый беспорядок.
Поведенческий компонент B ∈ [0, 1] опирается на два независимых основания. Первое — качественное исследование Мэлоуна [18], показавшее на материале интервью с офисными работниками, что организация рабочего пространства выполняет функцию напоминания о предстоящих делах, а не только поиска нужного документа, и что когнитивная трудность категоризации сама по себе объясняет наблюдаемые способы упорядочивания; там же предложено компенсировать эту трудность автоматической классификацией, в том числе по датам обращения к документам. Второе — традиция задачно-ориентированного измерения эффективности поиска в персональных коллекциях, закреплённая Бергманом и Уиттакером [19]. Современный обзор [5] называет стандартный набор показателей: время поиска файла, доля неудачных попыток, число навигационных шагов до цели. В рамках разрабатываемой системы предполагается легковесная регистрация поведенческих сигналов: длительность сессии «свободного поиска», количество переходов между папками до открытия файла, доля повторных открытий той же папки. Полная реализация B носит архитектурный характер и предусматривается на втором этапе разработки; на первом этапе ожидается, что частичная реализация уже будет служить подкрепляющей эвристической метрикой и согласовываться с принципом множественной валидации.
5. Композиция индекса
В рамках предлагаемой методики композитный индекс SDI определяется как взвешенная нелинейная агрегация четырёх нормированных компонентов:

,
где W ∈ [0, 1] — взвешенная сумма нормированных компонентов. Функция tanh задаёт монотонное отображение с эффектом насыщения, а делитель tanh(α) приводит масштаб: без него максимум индекса при α = 1,0 составлял бы 10·tanh(1) ≈ 7,6 балла, с ним значение 10 достигается ровно при W = 1; α — параметр чувствительности (предварительно 1,0); веса wE, wS, wT, wB предлагается изначально задать как 0,50; 0,25; 0,15; 0,10. Доминирующий вес отдан эмбеддинговому компоненту, поскольку семантическая связанность содержимого рассматривается в методике как определяющий аспект дезорганизации; косвенным техническим доводом в пользу центральной роли эмбеддингового представления служит вывод [13] о том, что выбор модели векторизации влияет на качество разбиения существенно сильнее, чем тонкая настройка последующих этапов конвейера (в частности, параметров UMAP). Следует, однако, подчеркнуть, что этот результат характеризует чувствительность кластеризационного конвейера, а не относительную значимость компонентов для восприятия беспорядка пользователем, поэтому конкретные значения весов не выводятся из [13] и рассматриваются исключительно как стартовая точка для последующей калибровки на размеченных коллекциях. Предлагается следующая предварительная интерпретация шкалы: значение 0–2 соответствует организованной коллекции, не требующей реструктуризации; 2–4 — порогу «приемлемого беспорядка», рассматриваемому как целевой уровень организованности после работы системы реструктуризации; 4–7 — умеренной дезорганизации, при которой реструктуризация рекомендуется; 7–10 — выраженной семантической дезорганизации, требующей полного цикла обработки. Границы интервалов носят рабочий характер и подлежат уточнению в ходе экспериментального исследования.
6. Интеграция в конвейер локальной системы
Предполагается, что метрика SDI встраивается в конвейер локальной системы реструктуризации без дополнительных архитектурных затрат, поскольку все требуемые величины — эмбеддинги, кластерное разбиение, метки выбросов, метаданные — уже вычисляются основным потоком обработки. Эмбеддинговый и кластерный модули, реализуемые на Python с использованием готовых реализаций конвейера BERTopic [20] или Top2Vec [21], должны передавать результаты через локальное межпроцессное взаимодействие в управляющее приложение C# / WinUI 3, где компоненты S и T рассчитываются на лету. Локальную языковую модель (Mistral 7B [22] или эквивалентную) предполагается применять только на финальной стадии для именования полученных кластеров по схеме, предложенной в [23] (отметим, что там она валидировалась на проприетарной облачной модели, тогда как в настоящей работе предполагается локальный аналог), что позволяет замкнуть цикл «векторное представление → кластеризация → человекочитаемая таксономия».
Двукратное вычисление SDI до и после реструктуризации должно давать пользователю наблюдаемое снижение значения индекса и одновременно служить подкрепляющим аргументом в пользу предложенной операции. Целевой уровень организованности — снижение SDI до значения не более 4 баллов по шкале от 0 до 10, то есть до верхней границы «приемлемого беспорядка». Поскольку все вычисления предполагается выполнять локально, индекс не требует передачи персональных данных в облачные сервисы. Этот выбор согласуется с данными масштабного международного опроса [24], который фиксирует, что готовность доверять системам искусственного интеллекта выражают менее половины респондентов (46 %), при этом около четырёх из пяти обеспокоены сопутствующими рисками, включая киберугрозы, а загрузка чувствительных данных в общедоступные облачные ИИ-сервисы отмечается как распространённая практика, нарушающая внутренние регламенты организаций.
Выводы
В работе предложена концепция композитного индекса семантической дезорганизации SDI, направленная на заполнение лакуны в количественной диагностике беспорядка: систематический обзор файлового менеджмента [5] характеризует эту область как слабо поддерживаемую и констатирует отсутствие полного количественного описания файлового поведения, а универсальной численной метрики беспорядка пользовательской коллекции, насколько известно авторам, в литературе не предложено; известные авторам инструменты автоматической организации файлов, как правило, не реализуют количественной диагностики беспорядка как самостоятельной функции.
Индекс комбинирует структурные, эмбеддинговые, временны́е и поведенческие признаки, что соответствует многомерной природе цифрового накопительства, описанной в современной литературе. Эмбеддинговый компонент опирается на конвейер «эмбеддер → UMAP → HDBSCAN», который предлагается валидировать плотностным индексом DBCV; превосходство DBCV над альтернативными метриками в задачах с кластерами произвольной формы подтверждено независимым сравнительным исследованием [17]. Структурный компонент использует геометрию дерева папок и шаблонность имён файлов; временной — метаданные файловой системы; поведенческий — регистрируемые системой сигналы взаимодействия пользователя с коллекцией.
Шкала индекса от 0 до 10 задаёт целевой уровень организованности — значение не более 4 баллов, соответствующее верхней границе «приемлемого беспорядка» и предназначена для использования в качестве сравнительной меры до и после работы системы реструктуризации. Все вычисления предполагается выполнять локально, без интернет-соединения после установки и первого запуска. Настоящая работа имеет концептуальный характер: SDI на данном этапе остаётся проектируемой метрикой, не прошедшей эмпирической валидации; предложенные веса, пороги и интерпретация шкалы сформулированы как стартовые гипотезы, и их корректность подлежит экспериментальной проверке. Дальнейшее исследование предусматривает калибровку весов компонентов на размеченной коллекции пользовательских данных, сопоставление SDI с показателями субъективного восприятия дезорганизации (опросник DHQ) и пользовательской удовлетворённостью по шкале SUS [6]; при интерпретации следует учитывать, что оценка SUS не является процентной величиной, а эмпирические ориентиры её приемлемости получены отдельно: по данным Бэнгора и коллег [25], среднее значение по массиву исследований составляет около 70 баллов, что соответствует границе приемлемого уровня юзабилити.
Список литературы:
- Neave N., Briggs P., McKellar K., Sillence E. Digital hoarding behaviours: Measurement and evaluation // Computers in Human Behavior. 2019. Vol. 96. P. 72–77. DOI: 10.1016/j.chb.2019.01.037.
- van Bennekom M.J., Blom R.M., Vulink N., Denys D. A case of digital hoarding // BMJ Case Reports. 2015. Article bcr2015210814. DOI: 10.1136/bcr-2015-210814.
- Sweeten G., Sillence E., Neave N. Digital hoarding behaviours: Underlying motivations and potential negative consequences // Computers in Human Behavior. 2018. Vol. 85. P. 54–60. DOI: 10.1016/j.chb.2018.03.031.
- Liu Y., Liu Y. Hoarding knowledge or hoarding stress? Investigating the link between digital hoarding and cognitive failures among Chinese college students // Frontiers in Psychology. 2025. Vol. 15. Article 1518860. DOI: 10.3389/fpsyg.2024.1518860.
- Dinneen J.D., Julien C.-A. The ubiquitous digital file: A review of file management research // Journal of the Association for Information Science and Technology. 2020. Vol. 71, no. 1. P. E1–E32. DOI: 10.1002/asi.24222.
- Brooke J. SUS: A quick and dirty usability scale // Usability Evaluation in Industry. London: Taylor & Francis, 1996. P. 189–194.
- McKellar K., Sillence E., Neave N., Briggs P. There Is More Than One Type of Hoarder: Collecting, Managing and Hoarding Digital Data in the Workplace // Interacting with Computers. 2020. Vol. 32, no. 3. P. 209–220. DOI: 10.1093/iwc/iwaa015.
- Wang L., Yang N., Huang X. et al. Text Embeddings by Weakly-Supervised Contrastive Pre-training // arXiv preprint. 2022. DOI: 10.48550/arXiv.2212.03533.
- Li Z., Zhang X., Zhang Y., Long D., Xie P., Zhang M. Towards General Text Embeddings with Multi-stage Contrastive Learning // arXiv preprint. 2023. DOI: 10.48550/arXiv.2308.03281.
- Radford A., Kim J.W., Hallacy C. et al. Learning Transferable Visual Models From Natural Language Supervision // Proceedings of the 38th International Conference on Machine Learning (ICML). PMLR, 2021. Vol. 139. P. 8748–8763.
- Grattafiori A. et al. The Llama 3 Herd of Models // arXiv preprint. 2024. DOI: 10.48550/arXiv.2407.21783.
- McInnes L., Healy J., Melville J. UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction // arXiv preprint. 2018. DOI: 10.48550/arXiv.1802.03426.
- Eklund A., Forsman M., Drewes F. An Empirical Configuration Study of a Common Document Clustering Pipeline // Northern European Journal of Language Technology. 2023. Vol. 9. DOI: 10.3384/nejlt.2000-1533.2023.4396.
- Campello R.J.G.B., Moulavi D., Sander J. Density-Based Clustering Based on Hierarchical Density Estimates // Advances in Knowledge Discovery and Data Mining (PAKDD 2013). Berlin, Heidelberg: Springer, 2013. LNCS. Vol. 7819. P. 160–172. DOI: 10.1007/978-3-642-37456-2_14.
- Petukhova A., Matos-Carvalho J.P., Fachada N. Text clustering with large language model embeddings // International Journal of Cognitive Computing in Engineering. 2025. Vol. 6. P. 100–108. DOI: 10.1016/j.ijcce.2024.11.004.
- Moulavi D., Jaskowiak P.A., Campello R.J.G.B., Zimek A., Sander J. Density-Based Clustering Validation // Proceedings of the 2014 SIAM International Conference on Data Mining (SDM). SIAM, 2014. P. 839–847. DOI: 10.1137/1.9781611973440.96.
- Chicco D., Sabino G., Oneto L., Jurman G. The DBCV index is more informative than DCSI, CDbw, and VIASCKDE indices for unsupervised clustering internal assessment of concave-shaped and density-based clusters // PeerJ Computer Science. 2025. Vol. 11. Article e3095. DOI: 10.7717/peerj-cs.3095.
- Malone T.W. How do people organize their desks? Implications for the design of office information systems // ACM Transactions on Office Information Systems. 1983. Vol. 1, no. 1. P. 99–112. DOI: 10.1145/357423.357430.
- Bergman O., Whittaker S. The Science of Managing Our Digital Stuff. Cambridge, MA: MIT Press, 2016. 296 p. DOI: 10.7551/mitpress/9780262035170.001.0001.
- Grootendorst M. BERTopic: Neural topic modeling with a class-based TF-IDF procedure // arXiv preprint. 2022. DOI: 10.48550/arXiv.2203.05794.
- Angelov D. Top2Vec: Distributed Representations of Topics // arXiv preprint. 2020. DOI: 10.48550/arXiv.2008.09470.
- Jiang A.Q., Sablayrolles A., Mensch A. et al. Mistral 7B // arXiv preprint. 2023. DOI: 10.48550/arXiv.2310.06825.
- Preiss A.J., Arbeit C.A., Berghammer A. et al. Evaluation of Text Cluster Naming with Generative Large Language Models // Journal of Data Science. 2024. Vol. 22, no. 3. P. 376–392. DOI: 10.6339/24-JDS1149.
- Gillespie N., Lockey S., Ward T., Macdade A., Hassed G. Trust, attitudes and use of Artificial Intelligence: A global study 2025. University of Melbourne & KPMG, 2025. DOI: 10.26188/28822919.
- Bangor A., Kortum P., Miller J. Determining What Individual SUS Scores Mean: Adding an Adjective Rating Scale // Journal of Usability Studies. 2009. Vol. 4, no. 3. P. 114–123.
дипломов

