Классификация движений глаз: сравнение CNN, LSTM и гибридной модели на основе person‑independent оценки

В статье представлен person‑independent и кросc‑датасетный анализ трёх архитектур глубокого обучения (1D‑CNN, LSTM и их гибрид) для четырёхклассовой классификации движ...

Материал носит информационный характер и не заменяет консультацию психолога или врача.

Классификация движений глаз: сравнение CNN, LSTM и гибридной модели на основе person‑independent оценки

По теме

ИИ расшифровывает активность мозга: как нейросети читают мыс...

Новый алгоритм искусственного интеллекта CEBRA расшифровывает активность мозга с точностью 95%, пред...

Как измерение моргания помогает ранней диагностике аутизма?

Узнайте, как частота моргания может служить объективным biomarker‑ом для раннего выявления аутизма у...

Как мозг вычисляет средний размер объектов: нейронные и пове...

Комплексное исследование нейробиологов демонстрирует, что зрительная система человека оценивает сред...

Что считается угрозой при сталкинге в Facebook: юридические ...

Анализ резонансного судебного прецедента «Кантерман против штата Колорадо» и подробный разбор тяжелы...

Как анорексия влияет на мозг: нарушения памяти, внимания и м...

Научный разбор влияния нервной анорексии на когнитивные способности мозга: как истощение нарушает па...

ADHD и интимность: почему сложно сосредоточиться во время се...

Статья объясняет, почему люди с СДВГ часто сталкиваются с отвлечением во время секса, как проявляетс...

Введение

Анализ движений глаз является фундаментальным этапом в изучении визуального восприятия, когнитивной нагрузки и неврологических состояний. Классификация отдельных типов движений — фиксаций, саккад и гладкого преследования — позволяет извлечь информацию о том, где и как долго взгляд удерживается на объекте интереса, насколько быстро происходит переключение внимания и насколько плавно следует за движущимся стимулом. Традиционно для этой задачи использовались пороговые методы на основе скорости и ускорения, однако recent advances in deep learning показали, что нейронные сети способны捕捉 более сложные временные зависимости в последовательностях gaze‑data.

Несмотря на успехи, большинство опубликованных работ оценивают модели на окнах, где участники присутствуют и в обучающем, и в тестовом наборе. Такой подход завышает обобщающую способность моделей, поскольку они могут «запоминать» индивидуальные особенности конкретных людей. В данной работе мы проводим строгую person‑independent оценку, используя leave‑one‑person‑out кросс‑валидацию, чтобы определить, насколько хорошо архитектуры обобщаются на новых субъектов.

Материалы и методы

Датасеты

Основной набор данных — GazeCom, содержащий записи движения глаз 54 участников, собранные с частотой 250 Гц. Метки предоставлены экспертами на уровне отдельных кадров и включают четыре класса: фиксация, саккада, гладкое преследование и другие (микросаккады, дрожь). Для проверки кросc‑датасетной обобщаемости использовался публичный набор Lund2013, записанный в аналогичных условиях, но с разной популяцией участников.

Входные представления

Мы тестировали два типа входных признаков:

  • Raw gaze position — непосредственные координаты X и Y глаза во времени.
  • Derived kinematic set — к позициям добавлены вычисленные первые и вторые производные (скорость, ускорение)以及 угловое изменение направления взгляда. Этот набор позволяет модели непосредственно оперировать динамическими характеристиками движения.

Архитектуры моделей

Мы сравнили три нейросетевых архитектуры:

  • Одномерная сверточная нейронная сеть (1D‑CNN) — несколько слоев свертки с последующим глобальным pooling и полносвязным классификатором.
  • Долгосрочная краткосрочная память (LSTM) — один или два рекуррентных слоя, captur­ирующих долгосрочные зависимости во временных рядах.
  • Гибрид CNN‑LSTM — сверточный блок, извлекающий локальные паттерны, за которым следует LSTM для агрегации временной информации.

Все модели обучались с использованием кросс‑энтропийной функции потерь, оптимизатора Adam с начальным темпом обучения 0.001 и планом снижения learning rate на плато. Количество параметров варьировалось: у LSTM ≈ 1,2 М, у гибрида ≈ 2,0 М (≈70 % больше), у CNN ≈ 0,9 М.

Протокол обучения и оценки

Для каждого участника выполнялась leave‑one‑person‑out кросс‑валидация: модель обучалась на данных оставшихся 53 человек и тестировалась на оставленном участнике. Процедура повторялась 54 раза, после чего собирались метрики на уровне участников. Основной метрикой выбора был macroF1, усреднённый по четырём классам. Статистическая значимость различий оценивалась парными t‑тестами по 54 фолдам с поправкой Холма для множественных сравнений.

В качестве базовых линий мы реализовали три неглубоких метода, настроенных на каждом фолде:

  • Порог скорости (velocity threshold).
  • Velocity‑dispersion algorithm.
  • Random Forest, обученный на наборе kinematic признаков (позиция, скорость, ускорение, угловое изменение).

Все методы оценивались по одной и той же схеме, что позволило честно сравнить их эффективность.

Результаты

Влияние типа входных признаков

Добавление kinematic признаков (скорость, ускорение, угловое изменение) улучшило производительность всех трёх архитектур. Наихудший результат показал чистый CNN с сырыми позициями (macroF1≈0,62), тогда как с derived набором он поднялся до 0,71. LSTM продемонстрировал более существенный рост: с сырыми позициями macroF1≈0,75, с derived — около 0,82. Гибрид CNN‑LSTM следовал очень близко к LSTM, показывая macroF1≈0,81–0,82 в зависимости от набора признаков.

Сравнение архитектур

При derived вводе разница между LSTM и гибридом была статистически незначимой (разница <0,01 macroF1, p>0,05 после поправки Холма). Это указывает на то, что 추가적인 сверточный фронт не предоставляет полезной информации, которую LSTM не может извлечь самостоятельно из kinematic последовательности. Напротив, разница между LSTM (или гибридом) и чистым CNN оставалась значительной для всех участников (средняя разница ≈0,11 macroF1, p<0,001). Таким образом, рекуррентное моделирование является ключевым фактором, отделяющим сильные модели от слабых.

Базовые методы

Все три неглубоких алгоритма показывали схожие результаты, колеблясь в диапазоне macroF1 0,53–0,54 независимо от типа входных признаков. Это существенно ниже, чем результаты любых из протестированных глубоких моделей, подтверждая преимущество обучения представлений непосредственно из данных.

Кросc‑датасетная проверка

Модели, обученные на GazeCom, были применены к Lund2013 без дополнительной дообучения. При оценке против экспертной разметки macroF1 снизился примерно на 0,07–0,09 пункта для всех архитектур, однако относительный порядок сохранялся: LSTM≈гибрид>CNN. Это демонстрирует, что выученные представления обладают определенной степенью обобщаемости между разными наборами записей, хотя и подвержены влиянию различий в оборудовании и условии проведения эксперимента.

Обсуждение

Полученные результаты подтверждают гипотезу о том, что для классификации движений глаз важным является учет временных зависимостей, которые лучше захватываются рекуррентными структурами. Сверточные слои эффективны для извлечения локальных паттернов в пространстве признаков, но в случае с kinematic набором, где уже присутствуют производные, такая локальная избыточность не приносит выигрыша.

Класс гладкого преследования остаётся наиболее сложным для всех моделей, что согласуется с wcześniejsними исследованиями, указывающими на высокую вариабельность плавных движений и их зависимость от предиктивных механизмов. Улучшение работы именно по этому классу может быть достигнуто через включение внимания к долгосрочным контекстам (например, внимание‑based механизмы) или использованием более сложных временных сверток (dilated, глубинно‑сеparable).

Кроме того, наблюдаемая стабильность порядка архитектур при переносе на Lund2013 указывает на то, что основные закономерности,捕捉ленные моделями (например, связь между скоростью и вероятностью саккады), являются относительно инвариантными к изменению популяции и оборудования.

Выводы

1. Reкуррентные сети (LSTM) обеспечивают высокую производительность в задаче четырёхклассовой классификации движений глаз при person‑independent оценке, достигая macroF1≈0,82 с использованием kinematic признаков.

2. Добавление сверточного frontend к LSTM не дает статистически значимого улучшения; гибридная модель избыточна по параметрам без выигрыша в точности.

3. Чистый CNN уступает рекуррентным моделям независимо от типа входных данных, подчеркивая важность временного моделирования.

4. Базовые методы на основе порогов скорости и velocity‑dispersion остаются значительно менее эффективными, чем глубокие сети.

5. Класс гладкого преследования представляет главный источник ошибок и является перспективным направлением для будущих работ, потенциально включающих механизмы внимания или более сложные временные архитектуры.

В итоге, для практического применения в системах отслеживания взгляда достаточно использовать относительно простую LSTM модель с набором kinematic признаков, что обеспечивает хороший баланс между производительностью, вычислительной эффективностью и обобщаемостью на новые субъекты и датасеты.

Короткие версии статей можно найти в телеграм-канале.

Посмотреть канал
Кликните еще раз для перехода
💡 Редакция Psy-Update | Обзор рецензируемых исследований

Материал подготовлен редакционной коллегией Psy-Update на основе публикаций в ведущих научных журналах. Публикация содержит сведения ознакомительного характера.

Дисклеймер: Любые психологические и медицинские рекомендации требуют обязательной консультации профильного специалиста.