Модель оценки читаемости английского текста на основе когнитивных признаков для обучения в вузе

Настоящее исследование представляет собой инновационный подход к оценке сложности английских текстов, интегрирующий традиционные лингвистические показатели с когнитивн...

Материал носит информационный характер и не заменяет консультацию психолога или врача.

Модель оценки читаемости английского текста на основе когнитивных признаков для обучения в вузе

По теме

Когнитивные и эмоциональные факторы принятия VR в культурном...

Исследование посвящено анализу когнитивных и эмоциональных факторов, влияющих на намерение туристов ...

ChatGPT предсказывает результаты тестов личности: как ИИ соз...

Исследование показывает, что ChatGPT (GPT‑4) может генерировать психологические опросники из любых т...

Оценка когнитивного восприятия 3D-форм методом иерархическог...

Научно-экспериментальное исследование когнитивных механизмов распознавания трехмерных объектов с исп...

Малые игровые форматы повышают моторную креативность начинаю...

Рандомизированное контролируемое исследование сравнивает влияние манипуляции задачами через малые иг...

Как повышается надежность оценок эффективности сотрудников? ...

Новое метаанализ показывает, что надежность производственных оценок (PAs) при участии непосредственн...

Корейский тест DigitsInNoise дополняет тест HearingInNoise п...

В данном исследовании сравниваются два корейских теста — DigitsInNoise (KDiNT) и HearingInNoise (KHi...

Введение: Проблема оценки читаемости в современном обучении

Оценка читаемости текстов является критически важным компонентом обучения английскому языку в высшей школе. Она напрямую влияет на подбор учебных материалов, адаптацию текстов под уровень знаний студентов и, в конечном итоге, на эффективность процесса обучения. Традиционные формулы оценки читаемости, такие как индекс Флеша-Кинкейда (Flesch-Kincaid) или индекс Ридинг (Reading Ease), основываются на surface-level (поверхностных) лингвистических признаках. К ним относятся длина предложений, длина слов, количество слогов и частота употребления слов. Однако научные исследования показывают, что эти формулы часто не могут адекватно отразить реальные когнитивные нагрузки, возникающие у читателя при восприятии текста. Они не accounted for (не учли) сложные когнитивные процессы, такие как логическое мышление, понимание структуры текста и интеграция новой информации с уже существующими знаниями. Это приводит к ограничениям в точности классификации текстов по уровню сложности, что особенно остро стоит вопрос при работе со студентами, чьи навыки чтения находятся на грани перехода с одного уровня CEFR (Common European Framework of Reference for Languages — Общеевропейская система компетенций) на другой.

Цель исследования: Интеграция когнитивных признаков

Для преодоления указанных ограничений авторами статьи предложена новая, data-driven (основанная на данных) модель оценки читаемости. Её ключевая идея — интеграция трех когнитивно мотивированных, извлекаемых из текста индикаторов с традиционными лингвистическими признаками. Эти индикаторы призваны количественно оценить те аспекты текста, которые влияют на когнитивную нагрузку читателя, но игнорируются surface-level формулами. В частности, в модель включены:

  • Rarity Index (Индекс редкости): Мера редкости лексики, используемой в тексте. Высокий индекс указывает на наличие необычных или специализированных слов, которые могут требовать дополнительных когнитивных ресурсов для распознавания и понимания.
  • Logical Complexity Index (Индекс логической сложности): Показатель, основанный на структуре knowledge network (сети знаний). Он оценивает, насколько сложна логическая структура текста, включая количество и сложность отношений между концепциями, которые читателю необходимо осознать для полного понимания.
  • Understanding Difficulty Index (Индекс сложности понимания): Отражает трудности, связанные с последовательностью изложения текста. Он учитывает, насколько естественно и предсказуемо текст структурирован, как легко читателю можно предсказать следующую идею или часть текста на основе предыдущей.

Методология и эксперименты: Сравнительный анализ

Для проверки эффективности предложенной модели были проведены эксперименты на четырёх широко используемых в научных исследованиях датасетах (наборах данных):

  • CEFR: Датасет, размеченный по стандартам Общеевропейской системы компетенций (Common European Framework of Reference). Позволяет проверить модель на соответствие международным стандартам уровня владения языком.
  • CLEC: Коллекция эссе китайских изучающих английский язык (Chinese Learner English Corpus). Использовалась для оценки модели на данных, отражающих особенности речи конкретной группы учащихся.
  • OneStopEnglish: Популярный ресурс для обучения английскому языку, где тексты адаптируются под разные уровни сложности. Отлично подходит для тестирования на разнородных данных.
  • RACE: Датасет, состоящий из тестов по чтению (Reading Comprehension), часто используемый для оценки моделей машинного обучения. Позволяет проверить модель на задачах, близких к реальным экзаменационным условиям.

Сравнение проводилось с четырьмя категориями моделей: традиционными формулами читаемости, conventional (обычными) моделями машинного обучения, pretrained (предобученными) языковыми моделями (такими как BERT, RoBERTa) и гибридными моделями, включающими как лингвистические, так и когнитивные признаки. Для оценки качества работы моделей использовались следующие метрики:

  • Accuracy (ACC): Точность — доля правильно предсказанных случаев от общего числа.
  • F1-score: Гармоническое среднее точности и полноты, позволяющее оценить сбалансированность модели при работе с несбалансированными классами.
  • Quadratic Weighted Kappa (QWK): Коэффициент карпы (квадратически взвешенный каппа) — мера согласованности, которая учитывает не только совпадение предсказаний с истинными значениями, но и степень их близости. Широко используется в задачах оценки по шкале с упорядоченными категориями (например, уровни CEFR).
  • Mean Absolute Error (MAE): Средняя абсолютная ошибка — среднее значение абсолютных разностей между предсказанными и реальными значениями.
  • RRNSS: Специализированная метрика, оценивающая улучшение модели относительно базового уровня.

Результаты и интерпретация: Достоверное улучшение

Особое внимание в исследовании уделяется ablation study (анализу отключения признаков). Были проведены 24 парных сравнения, где одинаковые модели оценивались до и после добавления блока когнитивных признаков (CogCore). Результаты впечатляют:

  • Quadratic Weighted Kappa (QWK): Улучшился во всех 24 сравнениях. Это свидетельствует о том, что когнитивные признаки последовательно повышают согласованность предсказаний модели с человеческими оценками сложности.
  • Accuracy (ACC): Улучшилась в 22 из 24 сравнений.
  • F1-score: Улучшился в 23 из 24 сравнений.
  • Mean Absolute Error (MAE): Снизился в 23 из 24 сравнений, что указывает на повышение общей точности предсказаний.

Лучшей гибридной моделью признана модель RoBERTa + CogCore. RoBERTa — это предобученная модель на основе архитектуры BERT (Bidirectional Encoder Representations from Transformers), которая оптимизирована для работы с большими объемами данных. Добавление к ней когнитивного блока CogCore позволило достичь наивысшей средней точности (ACC) среди всех протестированных моделей — 0.648. Более того, гибридная модель показала улучшение по сравнению с исходной RoBERTa на всех четырёх датасетах. Это подтверждает, что когнитивные признаки добавляют model interpretability (интерпретируемость) и informational value (информационную ценность), которые отсутствуют в чёрных ящиках сложных нейросетевых моделей.

Обсуждение и практическое применение

Предложенная модель не претендует на то, чтобы напрямую измерять внутренние когнитивные состояния человека. Однако её главная ценность — в предоставлении интерпретируемых и мотивированных научными данными индикаторов, которые могут быть использованы преподавателями и разработчиками учебных материалов. Модель может стать полезным инструментом для:

  • Автоматизированной адаптации текстов: Подбор или модификация текстов для студентов с разным уровнем подготовки.
  • Контроля качества учебной литературы: Проверка соответствия уровня сложности текста целям курса и аудитории.
  • Исследований в области прикладной лингвистики: Изучение того, какие именно аспекты текста делают его сложным или простым для понимания.
«Наши результаты демонстрируют, что интеграция когнитивно мотивированных textual proxies ( текстовых прокси) в модели оценки читаемости обеспечивает значимое и интерпретируемое улучшение по сравнению с традиционными подходами. Это поддерживает идею о том, что понимание текста — это не просто декодирование символов, а сложный когнитивный процесс, который может быть частично смоделирован через анализ структуры и лексики текста.»

Заключение и перспективы

Исследование представляет собой важный шаг в направлении создания более точных и научно обоснованных инструментов для оценки читаемости. Интеграция когнитивных признаков, таких как редкость лексики, логическая структура и последовательность изложения, позволяет существенно улучшить качество предсказаний по сравнению с методами, полагающимися только на superficial (поверхностные) лингвистические признаки. Предложенная гибридная модель, особенно в конфигурации RoBERTa + CogCore, демонстрирует высокую эффективность и интерпретируемость. В будущем исследователи могут расширять набор когнитивных признаков, включая, например, анализ метафоричности текста, эмоциональной окраски или уровня абстрактности концепций. Также перспективно применение модели к другим языкам и задачам, связанным с оценкой сложности устной речи или визуального контента. Данная работа открывает новые возможности для более индивидуализированного и эффективного подхода к обучению чтению на английском языке в условиях высшей школы.

Короткие версии статей можно найти в телеграм-канале.

Посмотреть канал
Кликните еще раз для перехода
💡 Редакция Psy-Update | Обзор рецензируемых исследований

Материал подготовлен редакционной коллегией Psy-Update на основе публикаций в ведущих научных журналах. Публикация содержит сведения ознакомительного характера.

Дисклеймер: Любые психологические и медицинские рекомендации требуют обязательной консультации профильного специалиста.