Телефон: 8-800-350-22-65
Напишите нам:
WhatsApp:
Telegram:
MAX:
Прием заявок круглосуточно
График работы офиса: с 9:00 до 21:00 Нск (с 5:00 до 19:00 Мск)

Статья опубликована в рамках: CXXVI Международной научно-практической конференции «Экспериментальные и теоретические исследования в современной науке» (Россия, г. Новосибирск, 29 июня 2026 г.)

Наука: Филология

Скачать книгу(-и): Сборник статей конференции

Библиографическое описание:
Балов В.Ю., Шихалиева С.Х. ФОРМАЛЬНОЕ МОДЕЛИРОВАНИЕ СТРУКТУР ГРАММАТИКИ: КОНТЕКСТ ПРОФИЛЯ ЛИНГВИСТИЧЕСКОЙ КОМПЕТЕНЦИИ // Экспериментальные и теоретические исследования в современной науке: сб. ст. по матер. CXXVI междунар. науч.-практ. конф. № 6(118). – Новосибирск: СибАК, 2026. – С. 77-83.
Проголосовать за статью
Дипломы участников
У данной статьи нет
дипломов

ФОРМАЛЬНОЕ МОДЕЛИРОВАНИЕ СТРУКТУР ГРАММАТИКИ: КОНТЕКСТ ПРОФИЛЯ ЛИНГВИСТИЧЕСКОЙ КОМПЕТЕНЦИИ

Балов Владимир Юрьевич

аспирант, ОЧУ ВО «Московский университет им. А.С. Грибоедова»,

РФ, г. Москва

Шихалиева Сабрина Ханалиевна

д-р филол. наук, профессор кафедры лингвистики и переводоведения факультета лингвистики ОЧУ ВО «Московский университет им. А.С. Грибоедова»,

РФ, г. Москва

FORMAL MODELING OF GRAMMAR STRUCTURES: THE CONTEXT OF THE LINGUISTIC COMPETENCE PROFILE

 

Balov Vladimir Yuryevich

Postgraduate student, Moscow University after A.S. Griboedov

Russia, Moscow;

Shikhalieva Sabrina Khanalievna

Doctor of Sciences (Philology), Professor of the department of linguistics and translation studies, Moscow University after A.S. Griboedov,

Russia, Moscow

 

АННОТАЦИЯ

В статье обсуждается метод автоматической языковой диагностики и обработки естественного языка для оценки уровня лингвистической компетенции. Его реализация подтверждает возможность использования современных методов обработки естественного языка для оценки профиля лингвистической компетенции. С целью достижения заданного объема текста оценка профиля лингвистической компетенции осуществлялась на основе количества синтаксических характеристик.

ABSTRACT

This article discusses a method of automatic language diagnostics and natural language processing for assessing linguistic competence. Its implementation confirms the feasibility of using modern natural language processing methods to assess linguistic competence profiles. The linguistic competence profile was assessed based on the number of syntactic characteristics to achieve a specified text volume.

 

Ключевые слова: дискурс, метод автоматической языковой диагностики, перевод, английский язык.

Keywords: discourse, automatic language diagnostics, translation, English language

 

В последние десятилетия лингвистика переосмысливается через призму инженерного подхода. Язык перестает быть исключительно объектом описания и становится системой, поддающейся формализации. Этот процесс выходит за рамки узкотехнического термина, он включает в себя преобразование языковых явлений в структурированные модели анализа и генерации текстов. Отправной точкой для этой трансформации стали работы Ноама Хомского, который в «Syntactic Structures» предложил концепцию порождающей грамматики, заложив основы формализации синтаксиса [1, с. 11-21]. Его термин «порождающая» оказался актуальным: сегодня основы формализации синтаксиса воплощены в машинных моделях, которые создают тексты – от простых фраз до сложных диалогов. Актуальность исследования обусловлена несколькими аспектами. Прежде всего, английский язык, будучи одним из наиболее распространённых языков международного общения, характеризуется высокой степенью структурной упорядоченности, что делает его подходящим для формального моделирования [2, с. 23-30]. Целью исследования является разработка методики автоматического определения уровня владения английским языком на основе анализа синтаксических структур с использованием современных алгоритмов обработки естественного языка. Достижение цели предполагает решение задач: описать основы алгоритмизации синтаксических структур и представить модели реализации алгоритма с описанием технических и методологических аспектов. Объектом исследования выступает процесс автоматизированного анализа синтаксических структур английского языка. Предметом исследования являются трансформерные модели, используемые для оценки уровня владения английским языком на основе письменных текстов. Методологическую основу составляют методы корпусного анализа, синтаксического парсинга, сравнительно-сопоставительного подхода, стратифицированной выборки, а также применение предобученных трансформерных моделей для классификации текстов. Научная значимость работы заключается в систематизации синтаксических структур английского языка с точки зрения их алгоритмизации и выявлении их роли в задачах автоматической оценки языковой компетенции. Практическая значимость определяется возможностью применения предложенной методики в образовательных платформах и системах языковой диагностики.

Современные практики в области образования демонстрируют устойчивую тенденцию к интеграции автоматизированных методов оценки языковой компетенции. Особенно актуально данная практика представляется в контексте определения уровня владения английским языком в соответствии с общеевропейской шкалой (CEFR). Разработанная методика направлена на автоматическое выявление уровня языковой подготовки студентов (в пределах уровней B1, B2 и C1) с помощью анализа синтаксических конструкций, обнаруженных в корпусе их письменных текстов. Обучение проводилось в 5 этапов: этап 1. {формализация цели и выбор синтаксических признаков}; этап 2. {сбор и подготовка корпуса}; 3 этап. {обучение модели BERT}; этап 4. {интеграция DeepSeek API}; этап 5. {интерпретация и ограничения}. На начальном этапе исследования было принято работать с массивом текстов из открытого датасета CEFR Levelled English Texts, доступного на платформе Kaggle. Данный датасет содержит 1500 текстов на английском языке, аннотированных по уровням CEFR (A1, A2, B1, B2, C1, C2). Тексты представляют смесь различных форматов, включая диалоги, рассказы, статьи и другие жанры. Датасет был сформирован путем сбора свободно доступных текстов с CEFR-метками. В начале была проведена очистка данных. Исходный датасет включал “шум”, в частности варианты ответов, формулировки заданий, пояснения к вопросам, таблицы, оглавления, а также технические артефакты – лишние пробелы, избыточные знаки препинания и служебные символы. В процессе очистки были устранены только формальные помехи, не несущие лингвистической ценности, при этом полностью сохранен “естественный шум”, присущий аутентичным текстам: вводные конструкции, стилистические вариации, синтаксические особенности и прочие элементы, отражающие реальное языковое разнообразие. Сохранение “естественного шума” позволило избежать искусственной «стерильности» массива текстов и способствовало формированию более устойчивых и точных лингвистических паттернов у модели.

Далее была проведена балансировка массива текстов по объему для уровней A2, B1, B2 и C1, для точности последующего обучения. Далее реализации алгоритма определения уровня владения английским языком было принято решение использовать трансформер BERT, который, как было уже описано в параграфе 1.3, лучше всего подходит для языкового анализа. В начале работы с моделью была использована облегченная версия TinyBERT. За счет скорости обучения уменьшенной модели можно быстро оптимизировать входные данные и разобрать все ошибки и в дальнейшем, при необходимости (например, недостаточной точности) заменим ее на базовую модель BERT. Так для модели был сформирован корпус, включающий 13 274 предложения, которые были токенезированы инструментами BERT и разделены на обучающую, валидационную и тестовую выборки: 10 619, 1 328 и 1 327 примеров соответственно (80, 10 и 10% соответственно). Все предложения получали метку, соответствующую уровню своего исходного массива – A1, B1, B2 и C1. Такой подход был выбран с расчетом на то, чтобы сохранить аутентичность языкового материала и избежать чрезмерной фильтрации по жёстким лингвистическим признакам. В результате в корпус были включены предложения, варьирующиеся по сложности – от базовых конструкций до высказываний, содержащих модальные глаголы, условные формы, сложные времена и пассивные обороты. Это обеспечивало приближение к реальному распределению языковых явлений в пределах каждого уровня [3].

Дообучение модели TinyBERT проводилось на подготовленном корпусе в течение трех этапов. Результаты тестирования показали точность классификации на уровне 58,87%, что значительно ниже целевого диапазона 80 – 90%, характерного для сбалансированных данных, Метрика Macro-F1 была равна 58.87%. Подготовленный корпус был разделен на три выборки: обучающую (382 фрагмента, 80%), валидационную (48 фрагментов, 10%) и тестовую (48 фрагментов, 10%). Использовался также стратифицированный метод, обеспечивающий сохранение пропорций классов на всех этапах. Архитектура TinyBERT, несмотря на свою упрощенную структуру, была сохранена. Обучение проводилось в течение 3 этапов, а итоговая модель отбиралась на основе наилучших показателей на валидационной выборке. Показатель Training Loss сократился с 1.1482 до 0.7559, а Validation Loss – с 1.0883 до 0.7155. Эти результаты указывают на успешное обучение без признаков переобучения. На тестовой выборке значение ошибки составило 0.6945, а точность классификации достигла 77.08%. Данный показатель существенно превосходит первоначальный результат (58.87%), однако остается ниже целевого диапазона 80 – 90%. Метрика Macro-F1, равная 74.64%, отражает относительно равномерную производительность по всем уровням сложности, несмотря на отдельные неточности. Фрагменты, относящиеся к уровням A2 (11 из 11) и C1 (13 из 13), были классифицированы корректно. Основные трудности возникли при различении промежуточных уровней. В частности, два фрагмента уровня B1 были ошибочно отнесены к уровню B2, а девять из двенадцати фрагментов уровня B2 – к уровню C1. Подобные ошибки обусловлены наличием в текстах уровня B2 сложных синтаксических конструкций и идиоматических выражений, которые модель интерпретировала как характерные для уровня C1. На данном этапе проявились ограничения модели TinyBERT в задаче классификации текстов по уровням CEFR. Обучение модели BERT проводилось на том же корпусе из 478 фрагментов с сохранением стратифицированного разделения на обучающую, валидационную и тестовую выборки. В ходе обучения значение Training Loss сократилось с 0.2978 на первом этапе до 0.1348 на третьем, а Validation Loss – с 0.2269 до 0.0571. Эти показатели свидетельствуют о высокой стабильности модели и ее способности к обобщению. На тестовой выборке ошибка составила 0.5107, что существенно ниже аналогичного показателя для TinyBERT (0.6945). Точность классификации достигла 91.67%, а метрика Macro-F1 также составила 91.67%, подтверждая сбалансированную производительность модели по всем четырем уровням сложности. Все фрагменты, относящиеся к уровням A2 (11 из 11) и C1 (13 из 13), были идентифицированы корректно. При разграничении смежных уровней сохранялись минимальные неточности. В частности, два фрагмента уровня B1 были ошибочно отнесены к уровню B2, а два фрагмента уровня B2 – к уровню C1. По сравнению с моделью TinyBERT, для которой было зафиксировано девять ошибок в классификации фрагментов уровня B2 как C1, результаты BERT демонстрируют ощутимое сокращение ошибок, и точность модели полностью соответствовала целевой точности (80-90%). Для того, чтобы убедиться в корректности работы алгоритма, были отобраны 12 эссе студентов, соответствующих уровням A2, B1, B2 и C1 из корпуса студенческих эссе [4]. На них модель показала точность в 37.5%, что не удовлетворяло ожидаемых результатов. Было принято решение, обучить модель на новом массиве текстов, который состоял исключительно из письменных работ студентов, разделенных на необходимые уровни сложности A2, B1, B2, C1. Работы были взяты открытого массива KUPA-KEYS (King's College London & Université Paris City Keys). Он содержит тексты, написанные 1006 участниками краудсорсингового исследования. Задание 1 включало в себя копирование текста; задание 2 включало в себя написание эссе (в среднем 250-300 слов) в ответ на приглашение "Just for fun" от Write & Improve (W&I), использованное с разрешения автора. В массив включены данные о нажатиях клавиш для этих текстов, а также метаданные и оценки на уровне CEFR для эссе с произвольным текстом [4]. После разметки по уровням тексты были выровнены по количеству слов, аналогично первому массиву, который был использовал (см. выше) [5]. Так целевое количество слов на уровень стало 35100 слов, где для уровня B1: выбрано 150 эссе, 35718 слов; для уровня B2 выбрано 203 эссе, 35100 слов; и для C1 выбрано 105 эссе на 35100 слов. Для обучения была оставлена модель BERT-base-uncased. Такой подход позволяет модели уделять больше внимания тем примерам, которые представлены в обучающем корпусе в меньшем количестве. В нашем случае класс B2 встречается почти в два раза чаще, чем C1 (203 эссе против 105), и почти в полтора раза чаще, чем B1 (203 против 150), что может привести к тому к тому, что модель без корректировки будет чаще "угадать" B2 и реже – C1 или B1 [6]. Детальный анализ метрик по уровням CEFR выявил следующие показатели. См. Таблицу 1

Таблица 1.

Анализ метрик по уровням CEFR

Уровень

Точность

Полнота

F1-оценка

B1

0.79

1.00

0.88

B2

0.94

0.71

0.81

C1

0.82

0.90

0.86

 

Как видно из таблицы для уровня B1 полнота 1.00 свидетельствует о корректной идентификации всех фрагментов, хотя точность 0.79 указывает на присутствие ложноположительных предсказаний. Уровень B2 характеризуется высокой точностью (0.94), но более низкой полнотой (0.71), что может отражать пропуск части фрагментов. Уровень C1 демонстрирует сбалансированные значения точности (0.82) и полноты (0.90), подчеркивая стабильную классификацию текстов высокой сложности. Общая точность модели на тестовой выборке составила 85% процентов. Такой подход отличается от традиционных методов, ориентированных преимущественно на лексический и тематический анализ.

В данной работе обсуждены основные этапы развития методов обработки естественного языка (NLP), включая переход от контекстно-свободных грамматик и статистических подходов к современным нейросетевым моделям, таким как BERT, применяемым для задач синтаксического анализа; целесообразность использования синтаксических признаков в качестве основного критерия для автоматической классификации письменных текстов обоснована по уровням CEFR (B1– C1).

 

Список литературы:

  1. Chomsky N. Syntactic Structures. – The Hague: Mouton, 1957. – 116 p.
  2. Chomsky N. Aspects of the Theory of Syntax. – Cambridge, MA: MIT Press, 1965. – 251 p.
  3. Council of Europe. Common European Framework of Reference for Languages: Learning, Teaching, Assessment. – Cambridge: Cambridge University Press, 2001. – 260 p.
  4. CEFR-levelled English Texts [Электронный ресурс] // Kaggle. – 2022. – URL: https://www.kaggle.com/datasets/amontgomerie/cefr-levelled-english-texts (дата обращения: 21.04.2025).
  5. KUPA-KEYS: Korean University-Prepared Academic English for Youth and Students [Электронный ресурс] // Hugging Face – 2023. – URL: https://huggingface.co/datasets/ALTACambridge/KUPA-KEYS (дата обращения: 1.05.2025).
  6. Rogers A., Kovaleva O., Rumshisky A. A Primer in BERTology: What We Know About How BERT Works // Transactions of the Association for Computational Linguistics. – 2020. – Vol. 8. – P. 842 – 866
Проголосовать за статью
Дипломы участников
У данной статьи нет
дипломов