По теме
Как общение с собаками улучшает работу мозга и снижает стрес...
Узнайте, как научно доказано общение с собаками влияет на активность головного мозга, снижает уровен...
Психологическая сила затмения: как солнечные затмения влияют...
В этой статье рассматривается глубокое психологическое воздействие солнечных затмений на человеческу...
Нейронные реакции на контент, созданный искусственным интелл...
Статья посвящена нейрофизиологическому исследованию восприятия контента, генерируемого искусственным...
Осознанность и творческая самоэффективность в принятии решен...
Исследование на выборке из 549 британских специалистов изучает, как черты осознанности, творческая с...
Послеродовой психоз и уголовная ответственность: Правовые ас...
Подробный анализ дела Линдси Клэнси и его правовых последствий в контексте послеродового психоза. Ст...
Эпидемия одиночества среди американцев среднего возраста: пр...
Подробный разбор масштабного исследования проблемы одиночества среди жителей США и Европы. Узнайте, ...
Введение
Распознавание эмоций в естественных разговорах является одной из центральных задач аффективных вычислений и находит применение в широком спектре практических сценариев: от интеллектуальных ассистентов и систем поддержки клиентов до медицинских диагностических инструментов и образовательных платформ. Современные подходы всё чаще опираются на мультимодальные данные, поскольку комбинация текста, голоса и видео позволяет уловить как семантическую, так и паралингвистическую информацию. Тем не менее, эффективное слияние разнородных модальностей остаётся нетривиальной задачей, требующей учёта различных масштабов признаков, наличия шумов и неравномерной информативности каналов.
В данной статье мы представляем Multimodal Attention Fusion Transformer (MAFT) — новую архитектуру, построенную на основе замороженных предобученных кодировщиков и механизма гейтированного перекрёстного внимания. Основные цели работы:
- Преодоление дисбаланса классов, характерного для большинства корпусов эмоциональных диалогов;
- Обеспечение устойчивости к типичным искажениям данных (загрязнение аудио смехом, частая смена ракурса камеры, перекрытие лиц);
- Автоматическое адаптивное распределение значимости модальностей в зависимости от контекста конкретной реплики;
- Демонстрация высокой производительности на общепризнанном бенчмарке MELD (Multimodal EmotionLines Dataset).
Результаты экспериментов показывают, что MAFT повышает взвешенную F1‑меру с 57,3% до 69,2% по сравнению с базовым прототипом, не использующим описанные механизмы.
Обзор существующих исследований
За последнее десятилетие было предложено множество методов мультимодального распознавания эмоций. Ранние работы преимущественно полагались на сцепление признаков (feature concatenation) с последующим применением классических классификаторов, таких как SVM или случайный лес. С ростом доступности глубоких нейронных сетей акцент сместился на:
- Раннее слияние (early fusion), при котором признаки объединяются на уровне входных данных;
- Позднее слияние (late fusion), при котором независимые модели обучаются для каждой модальности, а их выходы агрегируются;
- Гибридные архитектуры, комбинирующие элементы раннего и позднего слияния.
С появлением моделей‑трансформеров и механизмов внимания стало возможным эффективно моделировать долгосрочные зависимости и межмодальные взаимодействия. Например, работы Tsai et al. (2019) предложили Multimodal Transformer, использующий кросс‑модальное внимание для согласования текстовых и аудио‑визуальных представлений. Тем не менее, такие модели зачастую требуют тонкой настройки всех параметров, что увеличивает вычислительные затраты и риск переобучения на ограниченных данных.
Наша работа отличается от предшествующих подходов тем, что мы замораживаем тяжёлые предобученные кодировщики, сохраняя их богатые представления, и добавляем лёгкие адаптивные модули, которые обучаются на целевом корпусе. Кроме того, мы вводим сигмоидные вентили для динамического отключения зашумлённых каналов и учебную программу уровня класса для корректной обработки несбалансированных данных.
Формальная постановка задачи
Пусть имеется набор диалогов D, каждый из которых состоит из последовательности высказываний U = {u₁, u₂, …, u_N}. Каждое высказывание u_i представлено тремя модальностями:
- Текстовая последовательность t_i длиной L_t;
- Аудиосигнал a_i длиной L_a;
- Видеопоследовательность v_i, содержащая L_v кадров.
Цель состоит в том, чтобы для каждого u_i предсказать метку эмоции y_i ∈ {радость, грусть, гнев, страх, отвращение, удивление, нейтральность}. Мы формулируем задачу как многоклассовую классификацию с использованием функции потерь L = L_focal + λ·L_contrast, где L_focal — фокальная потеря, а L_contrast — контролируемая контрастивная потеря, λ — гиперпараметр баланса.
Архитектура MAFT
Предобученные кодировщики
Каждая модальность обрабатывается отдельным кодировщиком, предобученным на масштабных внешних корпусах и впоследствии замороженным:
- RoBERTa‑large (1024‑мерный эмбеддинг). Модель основана на архитектуре Transformer и обучена на большом корпусе текстов с использованием маскированного языкового моделирования. Мы используем выход CLS‑токена в качестве глобального представления текста.
- HuBERT‑large (1024‑мерный эмбеддинг). Гибридная модель, сочетающая свёрточные слои для извлечения низкоуровневых акустических признаков и трансформерные слои для моделирования долгосрочных зависимостей в речи. Выход последнего слоя трансформера служит представлением аудио.
- MARLIN (768‑мерный эмбеддинг). Специализированный видеокодировщик, разработанный для захвата пространственно‑временных особенностей лицевых экспрессий. Архитектура включает трёхмерные свёртки (3D‑CNN) и механизм self‑attention для учёта динамики мимики.
Заморозка весов указанных моделей позволяет:
- Избежать катастрофического забывания знаний, накопленных при предобучении;
- Сократить число обучаемых параметров, что ускоряет сходимость и снижает риск переобучения;
- Обеспечить стабильность представлений при работе с различными условиями записи.
Механизм перекрёстного внимания
Для объединения информации из разных модальностей мы применяем перекрёстное внимание (cross‑attention). Пусть H_t, H_a, H_v — выходные представления текстового, аудио‑ и видеокодировщиков соответственно. Мы вычисляем три попарных attention‑матрицы:
- Attention_{t←a} — текст обращает внимание на аудио;
- Attention_{t←v} — текст обращает внимание на видео;
- Attention_{a←v} — аудио обращает внимание на видео (и аналогично для обратных направлений).
Каждая attention‑операция реализуется как масштабированное скалярное произведение (scaled dot‑product attention):
Attention(Q, K, V) = softmax(QK^T / √d_k) · V,
где Q, K, V — матрицы запросов, ключей и значений, соответственно получаемые линейными проекциями из представлений соответствующих модальностей. Мы используем 8 голов внимания для каждой пары, что позволяет модели одновременно фокусироваться на различных аспектах взаимодействия.
После получения попарных контекстных векторов они конкатенируются с исходными модальными представлениями и пропускаются через полносвязный слой для получения обогащённого представления каждой модальности.
Сигмоидные вентили (аварийные выключатели)
Чтобы динамически обнулять ненадёжные модальные каналы, мы вводим сигмоидные вентили. Для каждой модальности m ∈ {t, a, v} вычисляется скалярный гейт:
g_m = σ(W_g·concat(H_m, C_context) + b_g),
где C_context — вектор глобального контекста диалога, полученный усреднением представлений предшествующих высказываний. Результирующее представление модальности:
H_m' = g_m ⊙ H_m,
где ⊙ — поэлементное умножение. Если гейт близок к нулю, канал фактически отключается, что предотвращает распространение шума в итоговое предсказание.
Адаптивное перераспределение весов модальностей
Изначально веса модальностей фиксированы и установлены в соотношении 0,5 / 0,3 / 0,2 для текста, аудио и видео соответственно. Однако в реальных диалогах значимость каналов может существенно варьироваться. Для учёта этого мы разработали лёгкий многослойный персептрон (MLP), который получает на вход:
- Вектор контекста диалога C_context;
- Текущие модальные представления H_t', H_a', H_v';
- Дополнительные мета‑признаки (например, длина реплики, наличие смеха в аудио).
MLP состоит из двух скрытых слоёв с размерностями 256 и 3, функцией активации ReLU и выходным слоем softmax, что даёт набор весов α_t, α_a, α_v, суммирующихся до единицы. Итоговое мультимодальное представление вычисляется как взвешенная сумма:
H_fused = α_t·H_t' + α_a·H_a' + α_v·H_v'.
Итоговый классификатор
Объединённое представление H_fused подаётся на вход линейного классификатора, который определяет вероятность каждой эмоции. В качестве функции активации используется softmax.
Технические детали реализации
Модель реализована на базе фреймворка PyTorch 1.12 с использованием библиотеки transformers для загрузки предобученных весов RoBERTa и HuBERT. Видеокодировщик MARLIN был адаптирован из открытой реализации, предоставляемой авторами статьи. Все линейные проекции для перекрёстного внимания имеют размерность 512, что обеспечивает баланс между вычислительной сложностью и ёмкостью модели.
Обучение проводилось на 4 GPU NVIDIA A100 (80 ГБ видеопамяти) с использованием смешанной точности (float16) для ускорения и снижения потребления памяти. Размер батча составлял 32 при общей длительности одной эпохи около 2 часов.
Средняя длина последовательности для текста не превышала 128 токенов, для аудио — 4 секунды (с дискретизацией 16 кГц), для видео — 8 кадров, извлекаемых с интервалом 250 мс. Все модальности были приведены к одной частоте дискретизации с помощью линейных проекций.
Обучение
Функции потерь
Мы применяем комбинацию фокальной потери и контролируемой контрастивной потери. Фокальная потеря определяется как:
L_focal = -∑_i (1 - p_i^γ)·log(p_i),
где p_i — предсказанная вероятность истинного класса, γ — коэффициент фокусировки (в экспериментах γ = 2). Фокальная потеря снижает вес легко классифицируемых примеров и усиливает внимание к трудным.
Контрастивная потеря формулируется следующим образом:
L_contrast = -∑_i ∑_{j∈P(i)} log( exp(sim(H_i, H_j)/τ) / ∑_{k∈N(i)} exp(sim(H_i, H_k)/τ) ),
где P(i) — множество позитивных примеров (высказывания с той же эмоцией), N(i) — негативные примеры (остальные классы), sim — косинусное сходство, τ — температурный параметр. Контрастивная потеря способствует формированию более компактных и разнесённых кластеров в пространстве эмбеддингов.
Расписание обучения: учебная программа уровня класса с косинусным отжигом
Для решения проблемы несбалансированности мы используем учебную программу уровня класса. На начальном этапе (первые ~10 эпох) модель акцентируется на доминирующих классах (нейтральный). Затем в течение последующих ~20 эпох постепенно увеличивается вес редких эмоций. Оставшиеся ~20 эпох модель обучается на всём наборе данных без дополнительных весов. Изменение весов осуществляется по закону косинусного отжига:
w_e = w_min + 0.5·(w_max - w_min)·(1 + cos(π·e/E_max)),
где e — текущая эпоха, E_max — общее число эпох (50), w_min и w_max — минимальный и максимальный вес для редких классов.
Оптимизатор и регуляризация
Обучение проводится с использованием AdamW (lr = 1e‑4, weight_decay = 0.01). Для предотвращения переобучения применяются:
- Dropout (p = 0.3) на выходах перекрёстного внимания и в адаптивном MLP;
- Метка сглаживания (label smoothing = 0.1) для снижения чрезмерной уверенности модели;
- Ранняя остановка на основе валидационной взвешенной F1‑меры.
Гиперпараметры и тонкая настройка
Основные гиперпараметры:
- Размерность скрытого слоя перекрёстного внимания: 512;
- Количество голов внимания: 8;
- Коэффициент фокальной потери γ = 2;
- Температурный параметр контрастивной потери τ = 0.07;
- Вес контрастивной потери λ = 0.1;
- Коэффициент затухания весов учебной программы w_min = 0.2, w_max = 1.0.
Аугментация данных
Для повышения устойчивости к вариациям в аудио и видео применяются следующие техники:
- Аудио: случайное обрезание фрагмента (0.9–1.0 от исходной длины), временной сдвиг (±10% от длительности), добавление гауссовского шума (σ = 0.005).
- Видео: случайное горизонтальное отражение, обрезка лица (0.8–1.0 от исходного размера), цвет‑джиттер (яркость ±10%).
Эксперименты
Набор данных
Мы проводим эксперименты на MELD — мультимодальном корпусе диалогов, собранном из популярного телесериала «Друзья». Корпус содержит 13 088 высказываний, каждое из которых снабжено текстовой транскрипцией, аудиофайлом и видеоклипом. Распределение по эмоциям:
- Нейтральный — ~49%;
- Радость — ~16%;
- Грусть — ~12%;
- Гнев — ~10%;
- Удивление — ~7%;
- Страх — ~3%;
- Отвращение — ~3%.
Данные разделены на обучающую, валидационную и тестовую выборки в соотношении 80/10/10.
Балансировка и метрики
Помимо взвешенной F1‑меры (primary metric) мы также отслеживаем макро‑F1, точность и полноту для каждого класса. Для оценки статистической значимости различий между моделями применяется тест Стьюдента (p < 0.05).
Базовые модели
Сравнение проводится с несколькими базовыми архитектурами:
- Текст‑трансформер: RoBERTa‑large без дополнительных модальностей;
- Аудио‑трансформер: HuBERT‑large на аудио‑данных;
- Видео‑сеть: MARLIN на видеоданных;
- Простое слияние: конкатенация признаков с последующим полносвязным слоем;
- Мультимодальный трансформер без гейтов: перекрёстное внимание без сигмоидных вентилей и адаптивных весов.
Результаты
Как видно из таблицы 1, MAFT значительно превосходит все рассмотренные базовые модели. Ключевые показатели:
- Взвешенная F1‑мера: 69,2% (против 57,3% у базового прототипа);
- Макро‑F1: 65,8% (против 53,1%);
- Точность: 70,5% (против 58,9%);
- Полнота для редких классов (страх, отвращение) выросла на ~8–10%.
Тест Стьюдента подтверждает статистическую значимость улучшения (p < 0.01).
«Адаптивное распределение весов позволяет системе автоматически увеличивать значимость аудио‑канала в ситуациях, когда текст содержит иронию или сарказм», — отмечается в статье.
Анализ вклада компонентов
Абляционное исследование показало:
- Удаление перекрёстного внимания снижает взвешенную F1 на 4,3%;
- Отключение сигмоидных вентилей приводит к падению на 3,1%;
- Отказ от адаптивного MLP уменьшает показатель на 2,7%;
- Использование только фокальной потери (без контрастивной) даёт снижение на 1,8%;
- Применение учебной программы уровня класса улучшает результат на 2,4%.
Сравнение с другими методами
В сравнении с наиболее современными подходами на том же бенчмарке MAFT занимает лидирующую позицию. Например, мультимодальная модель Multimodal Emotion Recognition (MER) достигает 66,8% взвешенной F1, а гибридная архитектура Late Fusion with Attention (LFA) — 65,4%. Наш результат в 69,2% превосходит указанные работы на 2,4–3,8 процентных пункта.
Анализ устойчивости к шумам
Для оценки робастности мы искусственно добавляли загрязнение смехом к аудио‑дорожкам и размытие к видеокадрам. MAFT продемонстрировал снижение F1‑меры лишь на 1,2% в условиях сильного шума, тогда как базовая модель теряла до 5,7%. Это подтверждает эффективность сигмоидных вентилей в подавлении искажённых каналов.
Ошибки и ограничения
Анализ ошибок выявил несколько типичных случаев:
- Неоднозначные высказывания: фразы, которые могут быть интерпретированы как нейтральные или ироничные, чаще ошибочно классифицируются как нейтральные;
- Короткие реплики: при длине менее 3 слов модель склонна к предсказанию доминирующего класса;
- Сильное перекрытие лиц: в случаях, когда более 50% лица скрыто, видеоканал практически отключается гейтом, что может приводить к потере информации о мимике.
Эти ограничения указывают на необходимость дальнейшего улучшения обработки низкоресурсных ситуаций и разработки более надёжных стратегий аугментации.
Обсуждение
Результаты демонстрируют, что замороженные предобученные кодировщики являются эффективным инструментом для переноса знаний из крупных мономодальных корпусов в задачу мультимодальной классификации эмоций. При этом механизм перекрёстного внимания позволяет модели учиться взаимосвязям между модальностями без необходимости полной перестройки тяжёлых кодировщиков.
Сигмоидные вентили выполняют роль аварийного выключателя, что особенно важно в реальных условиях, где данные неизбежно содержат артефакты (смех, шумы, размытые кадры). Адаптивный MLP, обучающийся на контексте диалога, обеспечивает гибкость и способность модели переключаться между модальностями в зависимости от содержания реплики.
Применение учебной программы уровня класса в сочетании с фокальной потерей решает проблему дисбаланса, не прибегая к сложным стратегиям ресемплинга. Контрастивная потеря дополнительно улучшает разделение эмоциональных кластеров, что подтверждается ростом макро‑F1.
Практические рекомендации
Для успешного внедрения MAFT в производственные системы рекомендуется:
- Использовать современные GPU с поддержкой смешанной точности для снижения времени обучения и инференса;
- Проводить аудит качества данных, уделяя особое внимание чистоте аудио‑ и видеозаписей;
- Реализовать модуль мониторинга гейтов для отслеживания доли отключённых каналов — это может служить индикатором качества входных данных;
- При необходимости адаптировать веса учебной программы под специфический дисбаланс целевого корпуса.
Этические соображения
При разработке систем распознавания эмоций важно учитывать потенциальные этические риски:
- Конфиденциальность: сбор и обработка аудио‑ и видеоданных должны соответствовать законодательству о защите персональных данных (GDPR, ФЗ‑152);
- Предвзятость моделей: модели могут наследовать предвзятости, присутствующие в обучающих данных, что требует систематической оценки на предмет公平ности (fairness) по полу, возрасту, этнической принадлежности;
- Использование в реальном времени: развёртывание модели в ассистентах или системах мониторинга должно сопровождаться механизмами контроля и возможностью отключения.
Мы настоятельно рекомендуем проводить аудит моделей на предмет систематических ошибок и внедрять процедуры обратной связи для пользователей.
Будущие направления
Перспективы развития MAFT включают:
- Расширение на другие наборы данных, такие как IEMOCAP, EmoryNLP, что позволит оценить обобщающую способность модели;
- Интеграция дополнительных модальностей: физиологические сигналы (ЭКГ, ГСК), текстовые эмодзи, жестовая информация;
- Исследование интерпретируемости: визуализация внимания и гейтов для объяснения решений модели;
- Оптимизация для реального времени: квантизация и дистилляция знаний для развёртывания на мобильных устройствах;
- Мультиязычное обучение: адаптация к языкам с низким ресурсом путём использования многоязычных предобученных моделей.
Заключение
В данной работе предложен MAFT — мультимодальный трансформер слияния внимания, в котором замороженные предобученные кодировщики комбинируются с лёгкими механизмами перекрёстного внимания, сигмоидными вентилями и адаптивным перераспределением весов модальностей. Обучение осуществляется с использованием фокальной и контрастивной потерь в сочетании с учебной программой уровня класса, что позволяет эффективно справляться с несбалансированностью данных и разнообразными шумами.
Эксперименты на бенчмарке MELD подтвердили значительное улучшение показателей: взвешенная F1‑мера возросла с 57,3% до 69,2%. Результаты абляционного исследования подчёркивают важность каждого компонента архитектуры. В будущем планируется расширение подхода на дополнительные модальности и задачи, а также проведение углублённого анализа公平ности модели.
Благодарности
Авторы выражают благодарность Шри Мате Амританандамайи Деви (Амма), канцлеру Амрита Висва Видьapeетхам, за вдохновение и финансовую поддержку в виде оплаты обработки статьи (APC). Открытый доступ к публикации обеспечен при поддержке Амрита Висва Видьapeетхам.