Телефон: 8-800-350-22-65
Напишите нам:
MAX:
WhatsApp:
Telegram:
Прием заявок круглосуточно
График работы офиса: с 9:00 до 21:00 Нск (с 5:00 до 19:00 Мск)

Статья опубликована в рамках: Научного журнала «Студенческий» № 28(366)

Рубрика журнала: Информационные технологии

Библиографическое описание:
Колбин И.Д. ИНТЕЛЛЕКТУАЛЬНАЯ СИСТЕМА ДИАГНОСТИКИ И РЕСТРУКТУРИЗАЦИИ СЕМАНТИЧЕСКИ ДЕЗОРГАНИЗОВАННЫХ ФАЙЛОВЫХ КОЛЛЕКЦИЙ // Студенческий: электрон. научн. журн. 2026. № 28(366). URL: https://sibac.info/journal/student/367/429555 (дата обращения: 24.08.2026).

ИНТЕЛЛЕКТУАЛЬНАЯ СИСТЕМА ДИАГНОСТИКИ И РЕСТРУКТУРИЗАЦИИ СЕМАНТИЧЕСКИ ДЕЗОРГАНИЗОВАННЫХ ФАЙЛОВЫХ КОЛЛЕКЦИЙ

Колбин Илья Дмитриевич

студент, кафедра «Автоматизированные системы обработки информации и управления», Ижевский государственный технический университет имени М. Т. Калашникова,

РФ, г.Ижевск

INTELLIGENT SYSTEM FOR DIAGNOSTICS AND RESTRUCTURING OF SEMANTICALLY DISORGANIZED FILE COLLECTIONS

 

Kolbin Ilya Dmitrievich

Student, Department of Automated Information Processing and Control Systems, Kalashnikov Izhevsk State Technical University,

Russia, Izhevsk

 

АННОТАЦИЯ

Рассматривается задача автоматического упорядочивания личных файловых коллекций, рост которых опережает возможности пользователя по поддержанию порядка. Предложена программная система, сочетающая фасетную категоризацию средствами локально развёрнутой большой языковой модели, графовую кластеризацию на основе алгоритма выделения сообществ Лувена и эвристическую диагностику семантической дезорганизации, построенную на плотных векторных представлениях содержимого файлов. Описанные решения реализованы в прототипе настольного приложения для ОС Windows, выполняющем обработку документов и изображений полностью на устройстве пользователя без обращения к облачным сервисам. Система строит иерархию папок с обязательным предпросмотром изменений (Dry Run) и журналируемым откатом выполненных операций, реализует гибридный семантический поиск, объединяющий плотную и лексическую (BM25) составляющие, и контролирует потребление оперативной памяти. Работа носит инженерно-методический характер: описываются архитектура системы, её алгоритмическое обеспечение и принятые проектные решения; безэталонный индекс дезорганизации предлагается как эвристический индикатор тематической неоднородности папки. Экспериментальная проверка предложенных решений выходит за рамки настоящей работы и составляет предмет дальнейших исследований.

ABSTRACT

The paper addresses the problem of automatically organizing personal file collections whose growth outpaces the user's ability to keep them in order. A software system is proposed that combines facet-based categorization performed by a locally deployed large language model, graph clustering based on the Louvain community detection algorithm, and heuristic diagnostics of semantic disorganization built on dense vector representations of file content. The solutions are implemented in a prototype Windows desktop application that processes documents and images entirely on the user's device without cloud services. The system builds a folder hierarchy with a mandatory Dry Run preview and journal-based rollback of applied operations, implements hybrid semantic search combining dense and lexical (BM25) retrieval, and monitors available RAM. The paper is of an engineering and methodological nature: it describes the system architecture, its algorithms and the design decisions adopted; the reference-free disorganization index is proposed as a heuristic indicator of the topical heterogeneity of a folder. Experimental evaluation of the proposed solutions is beyond the scope of this paper and is a subject for further research.

 

Ключевые слова: семантическая дезорганизация; файловая коллекция; реструктуризация; большая языковая модель; эмбеддинги; фасетная категоризация; графовая кластеризация; семантический поиск; локальная обработка данных.

Keywords: semantic disorganization; file collection; restructuring; large language model; embeddings; faceted categorization; graph clustering; semantic search; on-device processing.

 

Введение. Объём личных цифровых данных растёт быстрее, чем пользователь успевает их упорядочивать. Устойчивое накопление цифровых объектов при затруднённом их удалении, известное как цифровое накопительство, распространено далеко за пределами клинических выборок и сопровождается тревожностью [1, 2]. Согласно обзору, более 230 исследований по управлению файлами [3], при большом числе хранимых объектов пользователь перестаёт помнить о существовании отдельных файлов, а дублирование имён затрудняет их различение как при навигации, так и при поиске. Ручная реорганизация трудозатратна, и сама образует когнитивный барьер, поэтому упорядочивание файловых коллекций целесообразно автоматизировать.

Автоматизация, однако, осложняется требованием конфиденциальности: значительная часть личных коллекций содержит сведения, передача которых во внешние сервисы неприемлема. Глобальное исследование доверия к искусственному интеллекту фиксирует снижение воспринимаемой надёжности ИИ-систем на фоне роста использования технологии: 48 % опрошенных сотрудников признаются в загрузке конфиденциальной корпоративной или клиентской информации в публичные генеративные ИИ-сервисы; отдельно 44 % сообщают об использовании ИИ вопреки политикам своей организации [4]. Появление квантованных открытых больших языковых моделей (БЯМ), пригодных к запуску на потребительских видеокартах, делает возможной полностью локальную семантическую обработку и ослабляет это противоречие.

Существующие программные средства решают задачу лишь частично: одни анализируют только имена файлов, другие опираются на облачные модели, третьи не предоставляют ни семантического поиска, ни предпросмотра изменений, ни количественной оценки уровня беспорядка. Решение, сочетающее полностью локальную обработку, безэталонное структурирование с учётом сложившейся организации пользователя, обратимость операций и диагностику дезорганизации как самостоятельную функцию, среди рассмотренных аналогов выявлено не было; этим определяется актуальность работы.

Цель работы — разработка программной системы анализа и структурирования личных файловых коллекций на основе алгоритмов кластеризации и языковых моделей, предназначенной для снижения семантической дезорганизации таких коллекций при полностью локальной обработке данных. Работа ограничена проектированием и программной реализацией системы: предлагаемые решения создают техническую возможность перехода от плоского списка файлов к обозримой иерархии, тогда как вопрос о том, в какой мере это сказывается на ориентировании пользователя, требует экспериментальной проверки и в настоящей работе не рассматривается. Для достижения цели решены следующие задачи: обоснованы архитектура системы и выбор средств реализации; разработано информационное обеспечение; разработаны и реализованы алгоритмы построения векторных представлений, категоризации, диагностики беспорядка и семантического поиска; разработан графический интерфейс.

Объектом исследования являются личные файловые коллекции и процессы их организации; предметом исследования — методы семантического анализа, кластеризации и автоматической категоризации файлов на локальном устройстве пользователя. В работе применены методы обработки естественного языка (плотные векторные представления, большие языковые модели), теории графов (выделение сообществ) и инженерии программных систем. Научно-техническая особенность предлагаемого решения состоит в совместном использовании управляемой языковой моделью фасетной категоризации, графовой кластеризации и детерминированных валидаций, в идемпотентной двухшаговой схеме реструктуризации с приоритетом сложившейся таксономии пользователя и в выделении диагностики дезорганизации в самостоятельную функцию с безэталонным индексом (подробнее в заключении); практическая значимость определяется реализацией описанных алгоритмов в прототипе настольного приложения, рассчитанном на потребительское оборудование.

1. Анализ существующих решений и методов Рассмотренные аналоги условно делятся на три категории: интеллектуальные органайзеры файлов — AI File Sorter [5], Sparkle [6], Local-File-Organizer [7], LlamaFS [8]; системы управления личными знаниями с функциями искусственного интеллекта — TagSpaces [9], Reor [10]; встроенные интеллектуальные функции операционных систем — Windows Recall [11]. Классические файловые менеджеры из рассмотрения исключены, поскольку не работают с семантикой содержимого.

Сопоставление опиралось на документацию и описания перечисленных средств по состоянию на указанные даты обращения и характеризует заявленные их разработчиками возможности, а не результаты собственной проверки. По этим источникам рассмотренные средства покрывают отдельные аспекты целевой задачи: интеллектуальные органайзеры [5—8] сосредоточены на раскладке файлов по каталогам; Reor [10] описан разработчиками как локальное приложение для работы с заметками; Windows Recall [11] решает иную задачу — поиск по истории экранной активности на основе снимков экрана. Количественная оценка уровня беспорядка как самостоятельная функция ни в одном из рассмотренных описаний не заявлена. Совокупность свойств, положенных в основу настоящей работы, — полностью локальная обработка, структурирование без эталонной разметки с учётом сложившейся организации пользователя, обратимость операций и диагностика дезорганизации — в рассмотренных описаниях совместно не встречается.

Статистические модели представления текста (TF-IDF, BM25 [12]) опираются на точное совпадение термов и не улавливают смысловой близости различных формулировок, однако сохраняют практическую ценность при поиске редких терминов и собственных имён. Плотные векторные представления (эмбеддинги), получаемые сдвоенными кодировщиками класса Sentence-BERT [13], позволяют сравнивать документы косинусным сходством. В реализации используется ONNX-версия многоязычной модели jina-embeddings-v3 [14]. Выбор конкретной эмбеддинг-модели носит реализационный характер и не является обязательным элементом предлагаемого подхода: архитектура предусматривает возможность её замены на совместимую модель. Визуальная модальность приводится к тексту мультимодальной языковой моделью [15], что позволяет обрабатывать документы и изображения единым конвейером ценой потери части визуальной информации.

Система TagGPT [16] показала применимость zero-shot-подхода к мультимодальной разметке контента без дообучения, что делает его пригодным и для описания разнородных файлов. В отличие от экстрактивных методов извлечения ключевых фраз, БЯМ порождают метки и описания, отсутствующие в исходном тексте, что существенно для файлов с короткими именами и малым объёмом содержимого. В TnT-LLM [17] генерация окружена детерминированными проверками; необходимость таких процедур подтверждается отмеченным в Chain-of-Layer [18] риском появления «галлюцинированных» узлов при прямом построении таксономий языковой моделью.

Центроидные алгоритмы кластеризации (k-means++ [19]) требуют задания числа кластеров, заранее неизвестного для произвольной коллекции; плотностные методы, такие как HDBSCAN [20], автоматически определяют число групп и могут выделять шум. В данной системе выбран алгоритм Лувена [21], поскольку он работает непосредственно на уже построенном графе сходства и определяет число групп автоматически; вместе с тем результат этой жадной эвристики может зависеть от порядка обхода вершин, что требует учёта при встраивании в конвейер. Согласно М. Хёрст [22], кластеризация гибче и обнаруживает скрытые структуры, тогда как фасетные категории предсказуемее и понятнее пользователю; эти выводы получены для интерфейсов поиска, однако лежащее в их основе противопоставление учтено при выборе гибридной схемы категоризации.

Классические исследования организации личной информации показывают, что пользователи опираются на сложившуюся смысловую и пространственную структуру, выполняющую также функцию напоминания [23–25]. С учётом этого в системе приняты три проектных принципа: приоритет существующей пользовательской таксономии при категоризации, обязательный предпросмотр плана изменений (Dry Run) и журналируемый откат применённых операций.

2. Архитектура системы Предлагаемая система реализована в виде прототипа настольного приложения FileMentor для ОС Windows по гибридной двухпроцессной схеме (рис. 1). Хост-приложение на языке C# (WinUI 3) отвечает за графический интерфейс, сканирование и наблюдение за файловой системой, извлечение текстового содержимого через плагинную подсистему (поддерживаются плагины в виде сборок .NET и Python-модулей) и хранение структурированных метаданных в СУБД SQLite: сведений о файлах и каталогах, пользовательских категориях, сессиях реструктуризации и журнале применённых операций, обеспечивающем откат. Алгоритмическое ядро выполнено отдельным Python-процессом (воркером) и объединяет построение эмбеддингов (модель jina-embeddings-v3 средствами ONNX Runtime), инференс квантованной мультимодальной БЯМ (движок ExLlamaV3 с треллис-квантизацией QTIP [26]; модель Qwen3.5-9B [27] с 9 млрд параметров при битрейте около 4 бит на параметр), векторный индекс с лексической составляющей BM25 (библиотека txtai) и графовую кластеризацию. Межпроцессное взаимодействие организовано по именованным каналам с JSON-протоколом.

 

Рисунок 1. Архитектура системы

 

Полностью локальное выполнение продиктовано требованием конфиденциальности: после установки и первого запуска система работает без сетевого соединения, и содержимое файлов не покидает устройство пользователя. Мультимодальность языковой модели позволяет сосредоточить распознавание визуального содержимого в одном компоненте: изображения и сканированные страницы описываются текстом в рамках общего конвейера индексации без развёртывания отдельного OCR-тракта. Для соблюдения ограничений по ресурсам реализован мониторинг оперативной памяти: свободный объём контролируется на всех этапах конвейера, по истечении периода бездействия языковая модель и эмбеддер выгружаются из видеопамяти (основным её регулятором служит размер контекста языковой модели), а при приближении свободной ОЗУ к порогу 1,5 ГБ интенсивность обработки снижается вплоть до защитного завершения воркера; возобновление конвейера «на лету» не предусмотрено — устойчивость обеспечивается фиксацией результатов по мере готовности батча, что позволяет продолжить обработку с последней точки.

3. Алгоритмическое обеспечение

3.1. Индексация и семантическое описание файла Конвейер индексации включает извлечение содержимого, построение семантического описания и векторизацию. Для каждого файла извлекается текст; изображения описываются мультимодальной моделью. Затем БЯМ формирует структурированное описание файла: устойчивое читаемое имя; развёрнутый концепт — смысловую выжимку содержимого, служащую основой векторизации и поиска; однострочное резюме; фасетный дескриптор — набор меток вдоль заранее определённых осей, включая тип документа. Стохастичность вывода модели частично нивелируется фиксацией параметров декодирования и нормализацией меток. Концепт преобразуется эмбеддинг-моделью в плотный вектор, сохраняемый в индексе коллекции.

3.2. Фасетная адаптивная категоризация Определяющее требование к категоризации — предсказуемость, объяснимость и управляемость результата, поскольку построенная иерархия предъявляется пользователю для просмотра и правки до применения. Прямое поручение языковой модели построить дерево папок этому требованию, как правило, не отвечает: структура может меняться при незначительных изменениях входных данных. Чистая семантическая кластеризация даёт связные тематические группы, но не контролирует принцип деления на верхних уровнях иерархии. Поэтому принят фасетный подход: каждый файл при индексации получает метки вдоль набора независимых осей, а дерево строится выбором осей в порядке приоритета; языковая модель применяется не для произвольного изобретения структуры, а для заполнения категорий внутри выбранной оси. Состав осей, спроектированных как универсальный профиль по умолчанию, приведён в табл. 1.

Таблица 1.

Оси фасетной модели категоризации

Ось

Словарь / кардинальность

Способ разбиения

Роль в дереве

Сфера

закрытый список: работа, учёба, личное, бизнес, здоровье, финансы, хобби

детерминированный

корневая ось

Тип документа

почти замкнутый словарь

детерминированный

верхние уровни

Контейнер

проект, курс, клиент, организация

детерминированный

сильный группировщик

Домен

открытый, высокая кардинальность

группируется БЯМ

по умолчанию не участвует

Тема

открытый, высокая кардинальность

группируется БЯМ

по умолчанию не участвует

Дата

временной диапазон

детерминированный

по умолчанию не участвует

 

Категоризация выполняется двухшаговым конвейером с приоритетом сложившейся организации; общая схема конвейера приведена на рис. 2. Областью категоризации служит корень коллекции: на вход подаётся россыпь файлов, лежащих непосредственно в корневом каталоге, тогда как файлы, уже разложенные по подпапкам, система не индексирует и не перераспределяет. На первом шаге россыпь раскладывается по узлам готовых таксономий — корзинам, ранее созданным системой или размеченным пользователем вручную; пользовательские каталоги при этом остаются нетронутыми, а содержимое узлов-целей заново не пересматривается, что делает повторные запуски идемпотентными относительно уже размещённых файлов. Построенное дерево сохраняется как новая готовая таксономия и используется на первом шаге при последующих запусках, благодаря чему каждый сеанс пополняет таксономическую базу. На второй шаг передаются только файлы, не нашедшие места: для них иерархия достраивается адаптивно. Рекурсивный шаг ограничен предельной глубиной дерева и минимальным размером группы: узел, не удовлетворяющий этим условиям, далее не делится. Ось корневого уровня задана профилем, а на остальных узлах финальный выбор оси делегируется БЯМ единым структурированным промптом, в котором наравне с фасетными осями конкурирует семантический режим со своим приоритетом; оси потребляются по ходу спуска: выбранная для узла ось помечается использованной и в его поддереве более не рассматривается. Семантический режим оси не потребляет, но расходует отдельный лимит и допускается не более одного раза вдоль ветки и при числе файлов не ниже заданного минимума, поскольку тематические границы по природе размыты.

Разбиение по выбранной оси выполняется одним из двух способов: строгие оси делятся детерминированно по значениям метки, оси с признаком группировки — языковой моделью с указанием против чрезмерного дробления. На крупных узлах планирование опирается на предварительные выжимки батчей, а группировка выполняется по частям с последующим слиянием предварительных групп, что удерживает запрос в пределах контекста модели. В семантическом режиме тематическое деление выполняет графовая кластеризация: вершинами графа служат файлы, рёбра соединяют пары, косинусное сходство концептов которых превышает детерминированный порог; алгоритм Лувена выделяет сообщества, максимизируя модулярность. Построение графа детерминировано — оно является функцией матрицы сходств и порога и не зависит от формулировок промптов; сам же алгоритм Лувена представляет собой жадную эвристику, результат которой может зависеть от порядка обхода вершин, поэтому разбиение воспроизводимо лишь с точностью до этих факторов реализации, а его возможная нестабильность сглаживается последующими детерминированными валидациями. Отказ от предварительного понижения размерности устраняет дополнительный источник недетерминированности. Полученные узлы именуются языковой моделью по кратким резюме входящих документов, поскольку понятные имена повышают интерпретируемость результата [28]; при непригодном ответе модели сохраняется детерминированное имя.

Языковая модель и семантический граф — выразительные, но шумные компоненты, поэтому их решения обёрнуты детерминированными проверками, действующими на двух уровнях. На уровне узла предвалидация отбраковывает ось, относящую большинство файлов к категории «без значения» либо не образующую ни одной достаточно крупной группы; после группировки соседние категории одного уровня проходят горизонтальную валидацию, сливающую дубли и искусственно раздробленные категории; разбиение, давшее слишком много мелких групп, отменяется по порогу гранулярности, который контролируется минимальным числом групп и предельным средним размером группы и задаётся раздельно для фасетных осей и для семантического графа; при срабатывании порога ось или режим блокируется для текущего узла и планирование повторяется, а не прекращается. Поверх собранного дерева выполняется постобработка: вертикальная пост-валидация выявляет файлы, явно не соответствующие своему узлу, и переназначает их в соседний или родительский; защитная процедура схлопывает поддеревья с числом файлов ниже минимального, растворяет папки-прокладки с единственным дочерним узлом и восстанавливает инвариант, при котором каждый входной файл оказывается ровно в одном узле дерева либо в списке нераспределённых. Файл, не отнесённый ни к одной группе узла, поднимается в родительский узел, а нераспределённые файлы возвращаются вместе с деревом и остаются на прежнем месте. Поведение конвейера сведено к небольшому набору декларативных параметров и калибруется без изменения программного кода. Результатом является план реструктуризации, предъявляемый пользователю в режиме Dry Run: до подтверждения он не изменяет файловую систему и может быть отредактирован в интерфейсе, а при применении каждая операция предваряется записью журнала со снимком состояния до и после и данными обратного перемещения, что обеспечивает откат штатно выполненных операций.

 

Рисунок 2. Схема двухшагового конвейера фасетной адаптивной категоризации

 

3.3. Диагностика семантической дезорганизации. Наряду с реструктуризацией система выполняет эвристическую автоматическую оценку тематической неоднородности отдельной папки. Поскольку косинусная близость эмбеддингов отражает смысловую близость текстов, в качестве базового сигнала принято среднее попарное косинусное сходство содержимого папки — простой и интерпретируемый признак её тематической однородности, не требующий эталонной разметки. Индекс дезорганизации вычисляется по формуле

D = min(1, max(0, 1 − C)),   C = 2 / (n(n − 1)) · ∑1 ≤ i < j ≤ n cos(vi, vj),   (1)

где C — среднее попарное косинусное сходство; n — число файлов папки, имеющих текстовое представление (n ≥ 3); vi — векторное представление содержимого i-го файла. Чем разнороднее по смыслу содержимое, тем выше значение индекса; папка с тематически связными файлами получает низкий балл независимо от их количества. Поскольку косинусная мера принимает значения из отрезка [−1, 1], разность 1 − C формально может превысить единицу при отрицательном среднем сходстве, поэтому результат усекается в отрезок [0, 1], которым индекс и ограничен по построению. Если файлов с извлечённым текстом менее трёх, оценка не вычисляется, и папка помечается как пропущенная.

Векторы строятся по извлечённому тексту файлов, уплотнённому до выборки начала, середины и конца в пределах 2500 символов, а не по концептам, порождённым языковой моделью, поэтому оценка не зависит ни от результатов инференса, ни от структуры подпапок. Расчёт индекса требует повторного извлечения текста и построения эмбеддингов, поэтому диагностика запускается не на каждое файловое событие, а по накопленной активности: события файловой системы агрегируются счётчиками по папкам, сохраняются в базе данных (что позволяет учитывать активность между перезапусками приложения) и периодически сравниваются с порогом активности, задаваемым пользователем индивидуально для каждой наблюдаемой папки. При превышении индексом настраиваемого порога уведомления (значение по умолчанию — 0,60) папка предъявляется пользователю как кандидат на реструктуризацию; конкретное значение порога принято, как инженерное умолчание и требует экспериментальной проверки. Диагностика изолирована от индекса коллекции: её эмбеддинги строятся заново при каждой проверке и не сохраняются.

Индекс предлагается как эвристический безэталонный индикатор тематической неоднородности папки, а не как валидированная количественная мера воспринимаемого пользователем беспорядка. Он опирается на единственный сигнал — среднее попарное косинусное сходство, требует не менее трёх файлов с текстовым представлением, не учитывает структуру подпапок, типы и даты файлов и характеризует отдельную папку, а не коллекцию в целом. Его роль в системе сводится к привлечению внимания пользователя к папке-кандидату; соответствие значений индекса субъективному восприятию порядка в настоящей работе не проверялось и требует отдельного исследования.

3.4. Гибридный семантический поиск. Поиск по коллекции объединяет плотную и лексическую составляющие. Запрос преобразуется той же эмбеддинг-моделью в вектор и сопоставляется с векторами концептов файлов по косинусному сходству [13]; лексическая составляющая BM25 обеспечивает точное соответствие редких терминов и собственных имён, которые плотные представления склонны размывать. Оценки BM25 нормализуются в диапазон [0, 1], после чего итоговая релевантность вычисляется по формуле

S = 0,5 · Sdense + 0,5 · SBM25,        (2)

где Sdense и SBM25 — нормализованные оценки плотной и лексической составляющих соответственно. Перед выполнением запроса из выдачи исключаются файлы, утраченные файловой системой (удалённые или перемещённые вне приложения); их векторы при этом сохраняются в индексе, поэтому при возврате файла на прежнее место он вновь становится доступен для поиска без повторной индексации, а кандидаты запрашиваются с запасом на размер множества исключений.

4. Ограничения предлагаемого решения. Свойства предлагаемых решений обоснованы устройством конвейера, а не измерениями, и должны рассматриваться как проектные. Влияние стохастичности языковой модели ограничивается фиксацией параметров декодирования, нормализацией меток и детерминированными валидациями, однако не устраняется полностью: модель участвует в выборе оси деления, группировке открытых фасетов и именовании узлов. Алгоритм Лувена как жадная эвристика воспроизводим лишь с точностью до порядка обхода вершин. Приведение визуальной модальности к тексту средствами мультимодальной модели позволяет обрабатывать документы и изображения единым конвейером, но сопряжено с потерей части визуальной информации, что ограничивает возможности категоризации изображений.

Ресурсные ограничения обрабатываются защитными механизмами: при приближении объёма свободной оперативной памяти к заданному порогу интенсивность обработки снижается вплоть до защитного завершения воркера, а возобновление конвейера «на лету» не предусмотрено, поэтому на конфигурациях с малым объёмом свободной памяти обработка может прерываться, продолжаясь с последней зафиксированной точки. Диагностика дезорганизации остаётся эвристической (п. 3.3). Проверка того, в какой мере построенные иерархии соответствуют представлениям пользователей о порядке, а также оценка качества семантического поиска, удобства интерфейса и поведения системы под ресурсными ограничениями в настоящей работе не проводились и составляют предмет дальнейших исследований.

Заключение. Разработана программная система диагностики и реструктуризации семантически дезорганизованных файловых коллекций, выполняющая обработку полностью на устройстве пользователя. Описаны архитектура системы, её информационное обеспечение и алгоритмы индексации, фасетной адаптивной категоризации, эвристической диагностики тематической неоднородности и гибридного семантического поиска; принятые решения реализованы в разработанном прототипе для ОС Windows.

Научно-техническая особенность предложенного решения состоит в следующем. Во-первых, предлагается гибридная схема построения иерархии, в которой большая языковая модель выбирает ось фасетного деления, а само разбиение выполняется либо детерминированно по метке оси, либо графовой кластеризацией, причём каждое решение модели проверяется детерминированными валидациями двух уровней с блокировкой оси и повторным планированием узла; это ограничивает влияние стохастичности языковой модели на итоговую структуру, хотя и не устраняет его полностью, поскольку модель участвует также в группировке открытых фасетов и именовании узлов. Во-вторых, реструктуризация реализована как двухшаговый идемпотентный процесс с приоритетом сложившейся таксономии пользователя, при котором каждый сеанс пополняет таксономическую базу, а не пересобирает структуру заново. В-третьих, диагностика дезорганизации выделена в самостоятельную функцию с безэталонным эвристическим индексом и запуском по накопленной файловой активности, что предназначено для привлечения внимания пользователя к папке — кандидату на реструктуризацию. Среди рассмотренных в работе аналогов не выявлено решения, объединяющего эти свойства; в рамках разработанной системы они используются совместно и создают техническую возможность полностью локального структурирования коллекции без эталонной разметки.

Работа носит инженерно-методический характер: её результатом являются архитектурные и алгоритмические решения. Экспериментальная проверка этих решений в задачи работы не входила, поэтому приведённые свойства системы не следует трактовать как эмпирически подтверждённые; для суждения о влиянии предложенного подхода на работу пользователя необходимы отдельные исследования.

Направления дальнейшей работы включают экспериментальную проверку предложенных решений на реальных коллекциях; оценку точности семантического поиска, в том числе с переранжированием кросс-энкодером; обогащение индекса дезорганизации дополнительными сигналами (структура подпапок, типы и даты файлов) при сохранении его роли индикатора; повышение качества обработки визуальной модальности; перенос системы на другие платформы.

 

Список литературы:

  1. Neave N., Briggs P., McKellar K., Sillence E. Digital hoarding behaviours: Measurement and evaluation // Computers in Human Behavior. 2019. Т. 96. С. 72–77. DOI: 10.1016/j.chb.2019.01.037.
  2. Sweeten G., Sillence E., Neave N. Digital hoarding behaviours: Underlying motivations and potential negative consequences // Computers in Human Behavior. 2018. Т. 85. С. 54–60. DOI: 10.1016/j.chb.2018.03.031.
  3. Dinneen J. D., Julien C.-A. The ubiquitous digital file: A review of file management research // Journal of the Association for Information Science and Technology. 2020. Т. 71. № 1. С. E1–E32. DOI: 10.1002/asi.24222.
  4. Gillespie N., Lockey S., Ward T., Macdade A., Hassed G. Trust, attitudes and use of Artificial Intelligence: A global study 2025. University of Melbourne & KPMG, 2025. DOI: 10.26188/28822919.
  5. AI File Sorter // GitHub. [Электронный ресурс]. Режим доступа: https://github.com/hyperfield/ai-file-sorter (дата обращения: 24.04.2026).
  6. Gell B. 1,500,000 Files Organized and Counting (And Major Upgrades To Sparkle) // Every Studio. 2024. [Электронный ресурс]. Режим доступа: https://every.to/on-every/1-500-000-files-organized-and-counting-and-major-upgrades-to-sparkle (дата обращения: 24.04.2026).
  7. Local-File-Organizer: AI-Powered File Organization Tool // GitHub. [Электронный ресурс]. Режим доступа: https://github.com/QiuYannnn/Local-File-Organizer (дата обращения: 24.04.2026).
  8. LlamaFS: A self-organizing file system // GitHub. [Электронный ресурс]. Режим доступа: https://github.com/iyaja/llama-fs (дата обращения: 24.04.2026).
  9. TagSpaces documentation [Электронный ресурс]. Режим доступа: https://www.tagspaces.org/ (дата обращения: 24.04.2026).
  10. Reor: Private & Local AI Personal Knowledge Management App // GitHub. [Электронный ресурс]. Режим доступа: https://github.com/reorproject/reor (дата обращения: 24.04.2026).
  11. Windows Recall // Microsoft Learn. [Электронный ресурс]. Режим доступа: https://learn.microsoft.com/en-us/windows/ai/apis/recall (дата обращения: 24.04.2026).
  12. Robertson S., Zaragoza H. The Probabilistic Relevance Framework: BM25 and Beyond // Foundations and Trends in Information Retrieval. 2009. Т. 3. № 4. С. 333–389. DOI: 10.1561/1500000019.
  13. Reimers N., Gurevych I. Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks // Proceedings of EMNLP-IJCNLP 2019. 2019. С. 3982–3992. DOI: 10.18653/v1/D19-1410.
  14. Sturua S., Mohr I., Akram M. K., Günther M. et al. jina-embeddings-v3: Multilingual Embeddings With Task LoRA // arXiv:2409.10173. 2024. [Электронный ресурс]. Режим доступа: https://arxiv.org/abs/2409.10173 (дата обращения: 06.04.2026).
  15. Yin S., Fu C., Zhao S., Li K., Sun X., Xu T., Chen E. A survey on multimodal large language models // National Science Review. 2024. Т. 11. № 12. Art. nwae403. DOI: 10.1093/nsr/nwae403.
  16. Li C., Ge Y., Mao J. et al. TagGPT: Large Language Models are Zero-shot Multimodal Taggers // arXiv:2304.03022. 2023. [Электронный ресурс]. Режим доступа: https://arxiv.org/abs/2304.03022 (дата обращения: 09.04.2026).
  17. Wan M., Safavi T., Jauhar S. K. et al. TnT-LLM: Text Mining at Scale with Large Language Models // Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD '24). 2024. DOI: 10.1145/3637528.3671647.
  18. Zeng Q., Bai Y., Tan Z. et al. Chain-of-Layer: Iteratively Prompting Large Language Models for Taxonomy Induction from Limited Examples // Proceedings of CIKM '24. 2024. DOI: 10.1145/3627673.3679608.
  19. Arthur D., Vassilvitskii S. k-means++: The Advantages of Careful Seeding // Proceedings of the 18th Annual ACM-SIAM Symposium on Discrete Algorithms (SODA 2007). 2007. С. 1027–1035.
  20. Campello R. J. G. B., Moulavi D., Sander J. Density-Based Clustering Based on Hierarchical Density Estimates // Advances in Knowledge Discovery and Data Mining (PAKDD 2013). LNCS 7819. 2013. С. 160–172. DOI: 10.1007/978-3-642-37456-2_14.
  21. Blondel V. D., Guillaume J.-L., Lambiotte R., Lefebvre E. Fast unfolding of communities in large networks // Journal of Statistical Mechanics: Theory and Experiment. 2008. P10008. DOI: 10.1088/1742-5468/2008/10/P10008.
  22. Hearst M. A. Clustering versus Faceted Categories for Information Exploration // Communications of the ACM. 2006. Т. 49. № 4. С. 59–61. DOI: 10.1145/1121949.1121983.
  23. Malone T. W. How do people organize their desks? Implications for the design of office information systems // ACM Transactions on Office Information Systems. 1983. Т. 1. № 1. С. 99–112. DOI: 10.1145/357423.357430.
  24. Barreau D. K., Nardi B. A. Finding and reminding: file organization from the desktop // ACM SIGCHI Bulletin. 1995. Т. 27. № 3. С. 39–43. DOI: 10.1145/221296.221307.
  25. Bergman O., Whittaker S. The Science of Managing Our Digital Stuff. Cambridge, MA: MIT Press, 2016. 296 с.
  26. Tseng A., Sun Q., Hou D., De Sa C. QTIP: Quantization with Trellises and Incoherence Processing // arXiv:2406.11235. 2024. [Электронный ресурс]. Режим доступа: https://arxiv.org/abs/2406.11235 (дата обращения: 06.04.2026).
  27. Qwen3.5-9B // Hugging Face. [Электронный ресурс]. Режим доступа: https://huggingface.co/Qwen/Qwen3.5-9B (дата обращения: 16.04.2026).
  28. Preiss A. J., Arbeit C. A., Berghammer A. et al. Evaluation of Text Cluster Naming with Generative Large Language Models // Journal of Data Science. 2024. Т. 22. № 3. С. 376–392. DOI: 10.6339/24-JDS1149.