Статья опубликована в рамках: Научного журнала «Студенческий» № 27(365)
Рубрика журнала: Информационные технологии
Скачать книгу(-и): скачать журнал
МЕТА-КАЛИБРОВКА УВЕРЕННОСТИ В ДИАГНОСТИКЕ ОБРАЗОВАТЕЛЬНЫХ ПРОГРАММ: АГЕНТНЫЙ ПОДХОД НА ОСНОВЕ БОЛЬШИХ ЯЗЫКОВЫХ МОДЕЛЕЙ И СОПОСТАВЛЕНИЕ С НЕКАЛИБРОВАННЫМ МНОГОМОДЕЛЬНЫМ АНАЛИЗОМ
АННОТАЦИЯ
В статье описан агентный способ диагностики образовательных программ по открытым учебным материалам с использованием техники мета-калибровки уверенности. В отличие от обычного запроса к языковой модели, предложенный конвейер разносит анализ по стадиям извлечения фактов, оценки по восьми критериям, самооценки надёжности вывода, самопроверки и финальной корректировки отчёта. В качестве материала рассмотрены шесть программ российских университетов, ранее уже описанные в некалиброванном многомодельном обзоре. Сопоставление показало, что обычный обзор позволяет быстро сформулировать сильные и слабые стороны программ, но не отделяет недостатки самой программы от неполноты источников и не фиксирует границы достоверности вывода. Мета-калиброванный агент делает эти границы явными, связывает каждое суждение с основаниями в тексте документов и переводит итог в форму, пригодную для последующей экспертной проверки. Наиболее устойчивым оказался критерий практической направленности: по всем шести программам он получил уровень «высокая». Напротив, прозрачность материалов в четырёх из шести случаев, проверяемость образовательного результата в трёх и баланс нагрузки и контроля в четырёх были оценены как ограниченные или низкие. Предложенный подход делает такие различия воспроизводимыми и методически контролируемыми.
ABSTRACT
This article describes an agent-based approach to diagnosing educational programs using openly available teaching materials and a meta-calibration of confidence technique. Unlike a standard prompt to a language model, the proposed pipeline distributes the analysis across several stages: fact extraction, evaluation according to eight criteria, self-assessment of inference reliability, self-verification, and final report revision. The study examines six programs from Russian universities that had previously been analyzed in an uncalibrated multi-model review. The comparison showed that a conventional review can quickly identify the strengths and weaknesses of programs, but it does not distinguish shortcomings of the programs themselves from limitations of the available sources, nor does it define the boundaries of inference reliability. The meta-calibrated agent makes these boundaries explicit, links each judgment to textual evidence from the documents, and transforms the final output into a form suitable for subsequent expert verification. Across all six programs, practical orientation was rated high; transparency of materials was low or limited in four of six cases, verifiability of learning outcomes in three, and workload balance in four. The proposed approach makes such distinctions reproducible and methodologically controllable.
Ключевые слова: мета-калибровка уверенности, диагностика образовательных программ, большие языковые модели, образовательная аналитика, агентный подход, учебный план, рабочая программа дисциплины, самооценка качества, интерпретируемость, экспертная верификация.
Keywords: meta-calibration of confidence, educational program diagnostics, large language models, educational analytics, agent-based approach, curriculum, course syllabus, quality self-assessment, interpretability, expert verification.
1. Введение
Интерес к автоматизированной оценке образовательных программ растёт по двум причинам. Во-первых, в открытом доступе накапливаются учебные планы, рабочие программы дисциплин, описания практик и иные документы, пригодные для сопоставительного анализа. Во-вторых, большие языковые модели позволяют быстро извлекать из таких материалов содержательные признаки и формулировать обобщённые выводы [5].
Однако прямой запрос к модели плохо согласуется с самой природой задачи. Диагностика образовательной программы требует не только перечислить сильные и слабые стороны, но и отделить реально обнаруженные свойства программы от ограничений источника, явно обозначить степень надёжности вывода и показать, какие элементы документации не позволяют сделать более сильное суждение. Без такого режима модель склонна смешивать неполноту документов с дефектами программы и выдавать категоричные оценки там, где доказательная база ограничена [3, 4].
Для задач рассуждения и самопроверки в последние годы предложен ряд техник, в которых сложная операция разносится на несколько шагов, а промежуточный результат используется для последующей коррекции вывода [2–5]. В отечественной рамке метакогнитивной промпт-инженерии техника «мета-калибровка уверенности» описывается как способ заставить модель оценивать границы собственной надёжности и явно работать с неопределённостью [1].
Научная новизна работы состоит в переносе техники мета-калибровки уверенности с уровня единичного ответа языковой модели на уровень полного диагностического конвейера образовательной аналитики, в сопоставлении такого режима с некалиброванным многомодельным обзором и во введении процедурных индикаторов, позволяющих сравнивать режимы анализа по степени интерпретируемости и контролируемости вывода.
В настоящей работе эта техника переносится из режима единичного ответа в режим полного диагностического конвейера для анализа образовательных программ. В отличие от ранее предложенной многостадийной архитектуры ретроспективной мета-аналитики диалогов [6], где декомпозиция строилась вокруг уровней смыслового анализа, здесь она выстроена вокруг документационного исследования: извлечения фактов, оценки по критериям, калибровки уверенности, самопроверки и финальной коррекции отчёта.
Материалом послужили открытые документы шести российских образовательных программ и два типа аналитических продуктов, полученных на их основе: некалиброванный многомодельный обзор и отчёты агента, использующего мета-калибровку уверенности. Это позволяет сравнить не просто содержание выводов, а два режима работы с неопределённостью.
Цель статьи — разработать и апробировать агентный конвейер диагностики образовательных программ с мета-калибровкой уверенности и на едином корпусе материалов сопоставить калиброванный режим с некалиброванным многомодельным обзором. Практическая значимость подхода связана с возможностью его применения в задачах внутреннего аудита образовательных программ, процедур аккредитации, методической экспертизы и образовательной аналитики, где особенно важны прослеживаемость выводов. Для достижения цели решались четыре задачи: описать архитектуру агентного конвейера; сопоставить два режима аналитики на одном предметном поле; выделить типовые эффекты явной работы с границами достоверности вывода; провести пилотную верификацию с участием обучающегося на анализируемой программе (один кейс). Гипотеза исследования: режим мета-калибровки обеспечивает (а) явную привязку выводов к источникам, (б) дифференциацию по уровням уверенности, (в) распознавание ограничений источников как отдельную категорию — свойства, отсутствующие в базовом режиме. Её проверка выполняется и анализом структуры калиброванных выводов.
2. Материалы и методы
2.1. Исследовательский замысел и материал
Исследование выполнено в логике проектно-ориентированного разбора случая. Сравнивались два режима аналитики на сопоставимом корпусе открытых материалов по шести образовательным программам российских университетов: НИЯУ МИФИ, НИУ ВШЭ, НИТУ МИСИС, МГУ имени М. В. Ломоносова, МГТУ имени Н. Э. Баумана, Иннополис. Для калиброванного режима по всем рассматриваемым программам в единый корпус включались только открытые учебные планы в формате PDF. Выбор именно этих шести программ был обусловлен несколькими факторами: доступностью открытых материалов, различием типов университетов и образовательных профилей, а также возможностью сопоставить фундаментально-ориентированные и прикладные траектории подготовки. Такой дизайн позволяет получить разнообразные варианты, но одновременно ограничивает возможность статистического обобщения результатов.
Первый режим представлял собой некалиброванный многомодельный обзор. Обращения к моделям выполнялись в период апрель–май 2026 года. Использовались DeepSeek, GigaChat, Gemini и GPT-5 в конфигурациях, доступных через публичные интерфейсы на момент исследования. Из-за различий в политике поставщиков полное выравнивание параметров не обеспечивалось, что рассматривается как ограничение исследования; однако для всех моделей использовались сопоставимые по структуре запросы и единый корпус материалов. В нём модели DeepSeek, GigaChat, Gemini и GPT-5 формулировали сравнительные характеристики программ без явной шкалы уверенности, без разделения качества программы и качества источников и без отдельного шага самопроверки.
Второй режим реализован в публичном программном проекте как агент диагностики образовательных программ [6]. Агент принимает материалы в форматах PDF, DOCX, текста и веб‑ссылки, извлекает из них текст и формирует отчёт по восьми критериям. В основе логики оценивания лежит техника «мета-калибровка уверенности»: система не ограничивается формулировкой вывода, а отдельно оценивает, насколько этому выводу можно доверять по доступным материалам.
Критерии второй стадии представляют собой авторскую операционализацию для анализа открытых учебных планов: они опираются на принципы декомпозиции суждения, привязки к источнику и явной калибровки уверенности из [1] и выведены по смыслу типовых разделов учебной документации (профиль, содержание, траектория, практика, нагрузка и контроль, результаты обучения, прозрачность материалов, итоговая ценность программы).
В работе сознательно не раскрываются системные инструкции, точные шаблоны запросов и внутренние эвристики защитной обработки. Эти элементы описываются на уровне функций и ролей, что достаточно для понимания метода и не затрагивает закрытые детали реализации.
2.2. Архитектура предложенного конвейера
Предлагаемый конвейер состоит из пяти последовательно связанных стадий.
Первая стадия — извлечение и нормализация текста. На этом этапе документы разных форматов приводятся к единому текстовому представлению, из которого можно выделять названия дисциплин, практик, формы контроля, указания на трудоёмкость, компетенции и иные опорные элементы.
Вторая стадия — первичная диагностика по восьми критериям: «Профиль и фокус программы», «Актуальность и содержательная ценность», «Целостность учебной траектории», «Практическая направленность», «Баланс нагрузки и контроля», «Проверяемость образовательного результата», «Прозрачность предоставленных материалов», «Итоговая образовательная ценность». Для каждого критерия формируются четыре поля: вывод, уровень уверенности, основания в материале и рекомендации по улучшению. Частичные отчёты сохраняются в структурированном виде, где каждому критерию соответствует отдельный блок с фиксированными полями. Это обеспечивает сопоставимость результатов между случаями и позволяет напрямую сравнивать калиброванный режим с некалиброванным обзором, в котором аналогичная структура отсутствует.
Третья стадия — собственно мета-калибровка уверенности. Уровень уверенности выбирается не произвольно, а на основе четырёх факторов: доступности данных, сложности интерпретации, наличия альтернативных трактовок и контекстных ограничений. Используется качественная шкала из четырёх значений: «высокая», «достаточная», «ограниченная», «низкая». Выбор именно качественной, а не процентной шкалы нужен для того, чтобы не создавать иллюзию ложной точности там, где речь идёт о текстовой интерпретации.
Четвёртая стадия — самопроверка отчёта. Система повторно просматривает собственные выводы и ищет внутренние противоречия, чрезмерные обобщения, завышенную уверенность, а также случаи, когда отсутствие данных ошибочно трактуется как недостаток образовательной программы.
Пятая стадия — финальная корректировка. После самопроверки агент ослабляет слишком сильные формулировки, уточняет основания и собирает итоговый отчёт в пригодной для чтения форме.
Таблица 1.
Стадии калиброванного агентного конвейера диагностики образовательных программ
|
Стадия |
Функция |
Результат |
|
1 |
Извлечение и нормализация материалов |
Единый текстовый корпус по каждой программе |
|
2 |
Оценка по восьми диагностическим критериям |
Частные выводы, основания и рекомендации |
|
3 |
Мета-калибровка уверенности |
Качественная оценка надёжности каждого вывода |
|
4 |
Самопроверка отчёта |
Список замечаний и возможных искажений |
|
5 |
Финальная корректировка |
Итоговый диагностический отчёт |
2.3. Реализация и процедура сопоставления
Программная реализация выполнена на языке Python. Высокоуровнево система включает модуль извлечения текста, модуль анализа и мета-калибровки, граф управления стадиями и интерфейс взаимодействия через мессенджер. Внешнее обращение к языковой модели организовано через совместимый прикладной интерфейс; хранение кейсов и промежуточных состояний вынесено в отдельный слой. Такой уровень описания достаточен для статьи и не раскрывает закрытые детали проектирования. В текущей реализации используются ограничения LLM_MAX_INPUT_CHARS = 12000 символов для входного контекста, LLM_MAX_OUTPUT_TOKENS = 4096 токенов для ответа модели и REQUEST_TIMEOUT_S = 120 секунд. Основной экземпляр ChatOpenAI создаётся с параметром temperature = 0.2, тогда как для repair-запросов применяется temperature = 0, что снижает вариативность финальной корректировки.
Сопоставление режимов проводилось по пяти аналитическим измерениям: полнота покрытия диагностических критериев, явность оснований в документах, наличие шкалы уверенности, способность различать неполноту материалов и недостатки программы, а также наличие самопроверки. Дополнительно из калиброванных отчётов извлекались сводные показатели по шести кейсам: преобладающий уровень уверенности, число критериев, требующих осторожности, и число замечаний самопроверки.
Поскольку первый режим представлял собой не строгий стендовый эксперимент на одной и той же модели, а обзор, собранный из нескольких моделей, исследование не претендует на классическое сравнение точности. Его задача — показать методическую разницу между некалиброванным и калиброванным типом вывода и проследить, как эта разница влияет на структуру и интерпретируемость результата.
2.4. Пилотная верификация с участием обучающегося
Для частичной проверки прикладной ценности калиброванного формата выполнена пилотная верификация по одному кейсу. Респондентом выступил обучающийся на программе МГУ имени М. В. Ломоносова (профиль «Математические и компьютерные методы решения задач естествознания»), не участвовавший в разработке агента. Ему были предоставлены калиброванный отчёт агента и материалы базового многомодельного обзора по той же программе — тому же корпусу открытых документов, на котором строились оба аналитических продукта. Обучающийся заполнил короткую анкету из трёх вопросов: (1) какой формат удобнее для аудита образовательной программы; (2) согласуется ли заявленная уверенность агента с оценкой обоснованности выводов; (3) есть ли в калиброванном отчёте явные логические ошибки. Дополнительно он дал развёрнутый качественный комментарий о различиях форматов; его сжатое изложение приведено в §3.4.
3. Результаты
3.1. Что даёт базовый обзор без мета-калибровки
Некалиброванный многомодельный обзор справился с первой задачей — быстро сформулировал содержательные характеристики программ. Во всех шести случаях были выделены профиль, сильные и слабые стороны, а также общее мнение о карьерной траектории выпускника. Так, в сравнительном обзоре МИФИ описывается как программа с сильным пересечением инженерии, искусственного интеллекта и когнитивных наук, ВШЭ — как наиболее гибкая и индустриально ориентированная программа, МИСИС — как прикладной инженерно-математический трек с современными технологическими курсами, МГУ — как фундаментальная научная школа, Иннополис — как современный инженерный трек с высокой вариативностью элективов, МГТУ имени Н. Э. Баумана — как классическая фундаментальная программная инженерия с развитым блоком практик и курсовых работ.
Однако этот тип отчёта не даёт ответа на вопрос, насколько надёжен каждый вывод и какие элементы документации действительно подтверждают интерпретацию. Суждения о слабых местах программы и о неполноте источника оказываются записаны в одной плоскости. В результате читатель получает полезный обзор, но не получает механизма для его верификации.
3.2. Что меняется после включения мета-калибровки уверенности
Калиброванный агент переводит тот же предмет в иной режим анализа. Каждый отчёт строится по восьми критериям и для каждого критерия содержит не только вывод, но и его основание в тексте, уровень уверенности, объяснение этого уровня и рекомендации по уточнению материалов. В отчёт также включается отдельный блок самопроверки, где фиксируются замечания к собственным формулировкам.
По шести рассмотренным кейсам было получено 48 критериальных оценок. Из них 13 получили уровень «высокая», 11 — «достаточная», 22 — «ограниченная» и 2 — «низкая». Иначе говоря, агент не сводит весь анализ к уверенной или неуверенной позиции, а распределяет надёжность по разным аспектам программы.
Наиболее устойчивый результат относится к практической направленности: по этому критерию все шесть программ получили уровень «высокая». Напротив, прозрачность материалов оказалась проблемной зоной: в четырёх из шести случаев она была оценена как «низкая» или «ограниченная». Проверяемость образовательного результата также оказалась ограниченной в трёх кейсах. Баланс нагрузки и контроля был признан ограниченно подтверждённым в четырёх случаях из шести.
Итоговая образовательная ценность в пяти из шести кейсов не была оценена ниже «достаточной»; исключением стал кейс Иннополиса, где по этому критерию был выставлен уровень «ограниченная» из-за отсутствия целей, детализации содержания и временной структуры программы. Следует учитывать, что все эти уровни уверенности, включая оценку по данному критерию, присвоены тем же агентом, который выполняет мета-калибровку и самопроверку; без внешней верификации это утверждение интерпретируется ограниченно — как характеристика отчётов конвейера, а не как установленный минимум качества программ.
В двух кейсах преобладающий уровень уверенности оказался высоким, в четырёх – ограниченным. Существенно, что это распределение определялось не статусом университета, а полнотой и структурированностью предоставленных документов. Там, где были доступны распределение по семестрам, формы контроля и логика модульной организации, агент позволял себе более сильные выводы. Там, где отсутствовали цели программы, результаты обучения или целостная архитектура плана, уверенность закономерно снижалась.
Самопроверка сформировала в сумме 33 замечания по шести кейсам. Дополнительно было зафиксировано, что в 24 из 48 критериальных оценок итоговый уровень находится в зоне повышенной осторожности, то есть относится к уровням «ограниченная» или «низкая». В 35 из 48 случаев агент не сохраняет имплицитно «высокую» уверенность базового обзора, а снижает её до «достаточной», «ограниченной» или «низкой». Это подтверждает, что мета-калибровка не усиливает категоричность вывода, а напротив, делает её более сдержанной и контекстно обусловленной. Замечания самопроверки касались прежде всего возможной завышенной уверенности, слабой подтверждённости профиля программы, отсутствия явных результатов обучения и риска смешения ограничений источника с ограничениями самой программы.
Для сводного представления результатов по шести рассматриваемым примерам были выделены три прикладных показателя калиброванного отчёта: преобладающий уровень уверенности, число критериев, требующих осторожной интерпретации, и число замечаний самопроверки. Эти показатели позволяют увидеть, как уровень уверенности связан с полнотой и структурированностью доступных материалов.
3.2.1. Сопоставительный пример: калиброванный отчёт и базовый обзор по одной программе
Для наглядной демонстрации различия форматов приведён сопоставительный фрагмент по программе НИУ ВШЭ (01.03.02 «Прикладная математика и информатика», ФКН) — по материалам калиброванного отчёта агента и по фрагменту некалиброванного многомодельного обзора (DeepSeek). Выбран критерий «Баланс нагрузки и контроля», поскольку он наглядно показывает расхождение: базовый обзор уверенно характеризует нагрузку, тогда как калиброванный отчёт фиксирует границы доказуемости.
Калиброванный отчёт агента (критерий «Баланс нагрузки и контроля»)
Вывод: программа предусматривает значительную нагрузку за счёт проектных и практико-ориентированных форм, однако отсутствие детального распределения по семестрам не позволяет оценить равномерность нагрузки и баланс между формами контроля.
Уровень уверенности: ограниченная. Обоснование уровня уверенности: общие объёмы трудоёмкости известны, но отсутствие распределения по семестрам и форм контроля (зачёт/экзамен) не позволяет оценить баланс и равномерность нагрузки.
Основание в материале: указаны суммарные трудоёмкости модулей и отдельных дисциплин (в т.ч. «Теория и практика многопоточной синхронизации», практический модуль «Практика», «Преддипломная практика»), но без помесячного/семестрового распределения и без сводной таблицы форм контроля.
Базовый многомодельный обзор (DeepSeek, фрагмент по НИУ ВШЭ)
Слабые стороны: «Чрезвычайно высокая аудиторная и самостоятельная нагрузка, особенно на 1–2 курсах, где пиковые математические семестры сочетаются с интенсивным программированием».
Сопоставление показывает типичный контраст: базовый обзор формулирует оценку нагрузки категорично и без явной шкалы достоверности; калиброванный отчёт не отрицает высокую проектную вовлечённость, но снижает уверенность до «ограниченной», поскольку в предоставленных материалах нет семестрового распределения. Именно связка «вывод — уверенность — основание — рекомендация» делает результат пригодным для аудита; аналогичная структура воспроизводится по всем восьми критериям [6].
3.3. Результаты пилотной верификации с участием обучающегося
По итогам анкетирования обучающийся оценил калиброванный отчёт как существенно более пригодный для аудита, чем фрагменты некалиброванного многомодельного обзора (DeepSeek, GigaChat, Gemini). В калиброванном формате он отметил: разбиение по критериям; для каждого вывода — уровень уверенности и объяснение его выбора; привязку суждений к фрагментам исходных материалов; блок самопроверки и явную фиксацию ограничений данных; отделение рекомендаций от интерпретаций. Это воспринимается не как «мнение модели», а как заключение с трассируемостью аргументов.
Некалиброванные ответы, напротив, обучающийся охарактеризовал как склонные к репутационным и культурным суждениям о МГУ и ВМК, к экстраполяции на основе априорных представлений о «классическом фундаментальном факультете» и к подмене анализа документа стереотипами о вузе (latent prior substitution). В частности, отмечены уверенные выводы о DL/NLP/MLOps при отсутствии соответствующих сведений в предоставленных материалах (DeepSeek); интерпретации традиционного образа ВМК без прямой опоры в плане (Gemini); добавление не подтверждённых в данном плане сведений о модульности и вариативности (GigaChat), хотя этот обзор оказался наиболее осторожным.
Согласованность уверенности и доказательной базы в калиброванном отчёте обучающийся оценил положительно: модель неоднократно снижает уверенность при недостаточности данных (например, высокая уверенность по практической направленности при явно перечисленных практиках; ограниченная — по результатам обучения при отсутствии явно сформулированных результатов обучения; достаточная, но не высокая — по траектории при неполной привязке модулей к семестрам). Существенных логических ошибок не выявлено; отмечена отдельная шаблонность формулировок.
Обучающийся также указал ограничения калиброванного формата: (1) отдельные «основания в материалах» выглядят механически вставленными и не всегда напрямую подтверждают вывод; (2) повторяемость рекомендаций («явно сформулировать», «продемонстрировать соответствие») создаёт ощущение отчасти стандартизированной оценки; (3) отчёт оценивает документируемость программы, но не может заменить суждение о качестве преподавания, научных групп, востребованности выпускников — при этом агент в целом честно обозначает границы своей компетенции. Сводные ответы по анкете приведены в таблице 2.
С позиции методики оценки программ главный выигрыш мета-калибровки, по мнению обучающегося, состоит не в «повышении содержательной умности» выводов, а в снижении ложной уверенности, явной локализации пробелов данных, отделении наблюдений от интерпретаций и возможности проверять ход рассуждения — что для аудита программы ценнее неконтролируемых, но насыщенных суждений базового режима.
Таблица 2.
Сводные ответы обучающегося по пилотной анкете
|
Вопрос анкеты |
Оценка обучающегося |
|
Какой формат удобнее для аудита образовательной программы? |
Калиброванный отчёт значительно удобнее |
|
Согласуется ли заявленная уверенность с обоснованностью выводов? |
В калиброванном отчёте — в целом да; в базовом обзоре — нет (завышенная уверенность при слабой опоре на документ) |
|
Есть ли явные логические ошибки в калиброванном отчёте? |
Существенных нет; отмечена отдельная шаблонность формулировок и слабая опора отдельных «оснований» |
4. Обсуждение
Главный результат исследования заключается не в том, что агент начал «лучше понимать» образовательную программу, а в том, что он стал лучше оформлять границы своего понимания. Для экспертной диагностики это критично: практикующему аналитику важен не только сам вывод, но и то, на каком основании он сделан, где именно он слаб, и какие документы стоит запросить для усиления проверки.
С методической точки зрения предложенная архитектура реализует и обобщает технику «мета-калибровка уверенности», описанную в книге Р. В. Душкина, перенося её с уровня единичного ответа на уровень полного исследовательского цикла [1]. Если в исходной технике внимание сосредоточено на самооценке конкретного вывода, то здесь калибровка включена в конвейер целиком: она определяет формулировку частных суждений, работу самопроверки и финальную редакцию отчёта.
В этом отношении наша работа родственна архитектуре ретроспективной мета-аналитики [6], но расширяет её в другую предметную область. Там структурирование служило средством углубления анализа диалогов; здесь оно служит средством дисциплинирования документального анализа, где особенно велика опасность подменить нехватку источников сильной интерпретацией. Результаты также соотносятся с более широкой международной повесткой по калибровке уверенности и интерпретируемости больших языковых моделей, где особое внимание уделяется самопроверке, объяснимости и управлению неопределённостью вывода [2–5, 7-9]. В этом контексте предложенный подход можно рассматривать как прикладную адаптацию идей метарассуждения и самоуточнения вывода к задаче образовательной аналитики.
Отдельно предложенный подход соотносится с работами о вербализованной неопределённости и самооценке языковых моделей. В них показано, что языковые модели могут выражать степень уверенности в ответе в словесной или числовой форме, а специально извлекаемые оценки уверенности помогают отличать более надёжные ответы от менее надёжных [7–9]. Для настоящей работы это важно потому, что мета-калибровка рассматривается как способ явно зафиксировать границы доказательности вывода.
Таким образом, перенос метода оказался функциональным: одна и та же метакогнитивная рамка работает на разных объектах, если центр тяжести анализа смещён к соответствующему типу неопределённости.
Работа имеет и ограничения. Во-первых, рассмотрены только шесть кейсов, поэтому выводы о частоте тех или иных проблем носят пилотный характер. Во-вторых, базовый обзор получен на моделях DeepSeek, GigaChat, Gemini, GPT-5 через публичные интерфейсы, а калиброванный — на ChatOpenAI с temperature = 0,2. Любые наблюдаемые различия могут объясняться различиями моделей, а не свойствами метода мета-калибровки. Строгое контролируемое сравнение на одной и той же модели — задача отдельного исследования. В-третьих, пилотная верификация выполнена по одному кейсу (МГУ) и одному обучающемуся на этой программе (см. §2.4, §3.4); её результаты не позволяют статистически обобщать оценку удобства формата, но подтверждают прикладную пригодность калиброванного отчёта для аудита и согласованность уверенности с доказательной базой в рассмотренном случае. Для полноценной верификации необходимо расширить число респондентов, программ и стандартизировать шкалу оценки. Тем не менее даже в таком объёме видно, что калиброванный режим обладает важным прикладным преимуществом. Он даёт результат, который легче проверять, обсуждать и дорабатывать совместно с предметным экспертом. Для задач внутреннего аудита программ, методической экспертизы и первичного отбора материалов это может оказаться важнее, чем небольшое ускорение анализа.
Этическая сторона задачи также требует отдельного упоминания. В данной работе использовались открытые документы образовательных программ. Однако при переносе подхода на внутренние материалы, отзывы обучающихся или рабочую переписку необходимы анонимизация, согласие участников и внутренние регламенты обработки данных. Мета-калибровка не снимает этих требований, но помогает честнее обозначать пределы интерпретации и снижать риск необоснованно сильных заключений.
5. Заключение
В статье показано, что техника мета-калибровки уверенности может быть продуктивно перенесена в задачу диагностики образовательных программ по открытым документам. Предложенный агентный конвейер не отменяет содержательный анализ, а организует его таким образом, чтобы каждый вывод сопровождался основаниями, оценкой надёжности, самопроверкой и финальной коррекцией.
Сопоставление с некалиброванным многомодельным обзором показало, что прямой анализ хорошо подходит для быстрого обобщения, но слабо работает с неопределённостью. Мета-калиброванный режим делает неопределённость видимой и тем самым повышает проверяемость результата. На рассмотренных кейсах это особенно заметно в вопросах прозрачности материалов, проверяемости результатов обучения и баланса учебной нагрузки.
Перспектива дальнейшей работы состоит в построении более широкого корпуса программ, введении внешней экспертной оценки полезности отчётов и сравнении нескольких языковых моделей в едином калиброванном каркасе. Также перспективным направлением является пилотирование подхода в рамках внутренних процедур НИЯУ МИФИ и партнёрских университетов для поддержки методической экспертизы образовательных программ. Именно такой следующий шаг позволит перейти от пилотного разбора случая к более строгой верификации метода.
Благодарности
Вычислительная часть, представленная в данной статье, была выполнена с использованием платформы Yandex Cloud, в частности, следующих сервисов: Yandex AI Studio. Данное исследование проводилось при грантовой поддержке Центра Yandex Cloud по технологиям для общества: https://yandex.cloud/ru/research-education-program.
Список литературы:
- Душкин Р. В. Метакогнитивная промпт-инженерия: как научить искусственный интеллект думать о своём собственном мышлении. — Москва: ДМК Пресс, 2025.
- Wei J., Wang X., Schuurmans D. et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models // Advances in Neural Information Processing Systems. — 2022. — Vol. 35. — P. 24824 — 24837.
- Madaan A., Tandon N., Clark P. et al. Self-Refine: Iterative Refinement with Self-Feedback // Advances in Neural Information Processing Systems. — 2023. — Vol. 36. — P. 46534 — 46594.
- Shinn N., Labash B., Gopinath A. et al. Reflexion: Language Agents with Verbal Reinforcement Learning // Advances in Neural Information Processing Systems. — 2023. — Vol. 36. — P. 8634 — 8652.
- Liu P., Yuan W., Fu J. et al. Pre-train, Prompt, and Predict: A Systematic Survey of Prompting Methods in Natural Language Processing // ACM Computing Surveys. — 2023. — Vol. 55, № 9. — Art. 195.
- AI_bot_for_education: GitHub-репозиторий проекта. URL: https://github.com/rodmandf/AI_bot_for_education (дата обращения: 15.05.2026).
- Lin S., Hilton J., Evans O. Teaching Models to Express Their Uncertainty in Words. — arXiv:2205.14334, 2022.
- Kadavath S., Conerly T., Askell A. et al. Language Models (Mostly) Know What They Know. — arXiv:2207.05221, 2022.
- Tian K., Mitchell E., Zhou A. et al. Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback // Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing. — 2023. — P. 5433–5442.

