MAFT: Мультимодальный трансформер слияния внимания для распознавания эмоций в диалогах

В статье представлен MAFT — мультимодальный трансформер слияния внимания, использующий замороженные предобученные кодировщики для распознавания эмоций в многопользоват...

Материал носит информационный характер и не заменяет консультацию психолога или врача.

MAFT: Мультимодальный трансформер слияния внимания для распознавания эмоций в диалогах

По теме

Как общение с собаками улучшает работу мозга и снижает стрес...

Узнайте, как научно доказано общение с собаками влияет на активность головного мозга, снижает уровен...

Психологическая сила затмения: как солнечные затмения влияют...

В этой статье рассматривается глубокое психологическое воздействие солнечных затмений на человеческу...

Нейронные реакции на контент, созданный искусственным интелл...

Статья посвящена нейрофизиологическому исследованию восприятия контента, генерируемого искусственным...

Осознанность и творческая самоэффективность в принятии решен...

Исследование на выборке из 549 британских специалистов изучает, как черты осознанности, творческая с...

Послеродовой психоз и уголовная ответственность: Правовые ас...

Подробный анализ дела Линдси Клэнси и его правовых последствий в контексте послеродового психоза. Ст...

Эпидемия одиночества среди американцев среднего возраста: пр...

Подробный разбор масштабного исследования проблемы одиночества среди жителей США и Европы. Узнайте, ...

Оригинал исследования на сайте автора

Введение

Распознавание эмоций в естественных разговорах является одной из центральных задач аффективных вычислений и находит применение в широком спектре практических сценариев: от интеллектуальных ассистентов и систем поддержки клиентов до медицинских диагностических инструментов и образовательных платформ. Современные подходы всё чаще опираются на мультимодальные данные, поскольку комбинация текста, голоса и видео позволяет уловить как семантическую, так и паралингвистическую информацию. Тем не менее, эффективное слияние разнородных модальностей остаётся нетривиальной задачей, требующей учёта различных масштабов признаков, наличия шумов и неравномерной информативности каналов.

В данной статье мы представляем Multimodal Attention Fusion Transformer (MAFT) — новую архитектуру, построенную на основе замороженных предобученных кодировщиков и механизма гейтированного перекрёстного внимания. Основные цели работы:

  • Преодоление дисбаланса классов, характерного для большинства корпусов эмоциональных диалогов;
  • Обеспечение устойчивости к типичным искажениям данных (загрязнение аудио смехом, частая смена ракурса камеры, перекрытие лиц);
  • Автоматическое адаптивное распределение значимости модальностей в зависимости от контекста конкретной реплики;
  • Демонстрация высокой производительности на общепризнанном бенчмарке MELD (Multimodal EmotionLines Dataset).

Результаты экспериментов показывают, что MAFT повышает взвешенную F1‑меру с 57,3% до 69,2% по сравнению с базовым прототипом, не использующим описанные механизмы.

Обзор существующих исследований

За последнее десятилетие было предложено множество методов мультимодального распознавания эмоций. Ранние работы преимущественно полагались на сцепление признаков (feature concatenation) с последующим применением классических классификаторов, таких как SVM или случайный лес. С ростом доступности глубоких нейронных сетей акцент сместился на:

  • Раннее слияние (early fusion), при котором признаки объединяются на уровне входных данных;
  • Позднее слияние (late fusion), при котором независимые модели обучаются для каждой модальности, а их выходы агрегируются;
  • Гибридные архитектуры, комбинирующие элементы раннего и позднего слияния.

С появлением моделей‑трансформеров и механизмов внимания стало возможным эффективно моделировать долгосрочные зависимости и межмодальные взаимодействия. Например, работы Tsai et al. (2019) предложили Multimodal Transformer, использующий кросс‑модальное внимание для согласования текстовых и аудио‑визуальных представлений. Тем не менее, такие модели зачастую требуют тонкой настройки всех параметров, что увеличивает вычислительные затраты и риск переобучения на ограниченных данных.

Наша работа отличается от предшествующих подходов тем, что мы замораживаем тяжёлые предобученные кодировщики, сохраняя их богатые представления, и добавляем лёгкие адаптивные модули, которые обучаются на целевом корпусе. Кроме того, мы вводим сигмоидные вентили для динамического отключения зашумлённых каналов и учебную программу уровня класса для корректной обработки несбалансированных данных.

Формальная постановка задачи

Пусть имеется набор диалогов D, каждый из которых состоит из последовательности высказываний U = {u₁, u₂, …, u_N}. Каждое высказывание u_i представлено тремя модальностями:

  • Текстовая последовательность t_i длиной L_t;
  • Аудиосигнал a_i длиной L_a;
  • Видеопоследовательность v_i, содержащая L_v кадров.

Цель состоит в том, чтобы для каждого u_i предсказать метку эмоции y_i ∈ {радость, грусть, гнев, страх, отвращение, удивление, нейтральность}. Мы формулируем задачу как многоклассовую классификацию с использованием функции потерь L = L_focal + λ·L_contrast, где L_focal — фокальная потеря, а L_contrast — контролируемая контрастивная потеря, λ — гиперпараметр баланса.

Архитектура MAFT

Предобученные кодировщики

Каждая модальность обрабатывается отдельным кодировщиком, предобученным на масштабных внешних корпусах и впоследствии замороженным:

  • RoBERTa‑large (1024‑мерный эмбеддинг). Модель основана на архитектуре Transformer и обучена на большом корпусе текстов с использованием маскированного языкового моделирования. Мы используем выход CLS‑токена в качестве глобального представления текста.
  • HuBERT‑large (1024‑мерный эмбеддинг). Гибридная модель, сочетающая свёрточные слои для извлечения низкоуровневых акустических признаков и трансформерные слои для моделирования долгосрочных зависимостей в речи. Выход последнего слоя трансформера служит представлением аудио.
  • MARLIN (768‑мерный эмбеддинг). Специализированный видеокодировщик, разработанный для захвата пространственно‑временных особенностей лицевых экспрессий. Архитектура включает трёхмерные свёртки (3D‑CNN) и механизм self‑attention для учёта динамики мимики.

Заморозка весов указанных моделей позволяет:

  • Избежать катастрофического забывания знаний, накопленных при предобучении;
  • Сократить число обучаемых параметров, что ускоряет сходимость и снижает риск переобучения;
  • Обеспечить стабильность представлений при работе с различными условиями записи.

Механизм перекрёстного внимания

Для объединения информации из разных модальностей мы применяем перекрёстное внимание (cross‑attention). Пусть H_t, H_a, H_v — выходные представления текстового, аудио‑ и видеокодировщиков соответственно. Мы вычисляем три попарных attention‑матрицы:

  • Attention_{t←a} — текст обращает внимание на аудио;
  • Attention_{t←v} — текст обращает внимание на видео;
  • Attention_{a←v} — аудио обращает внимание на видео (и аналогично для обратных направлений).

Каждая attention‑операция реализуется как масштабированное скалярное произведение (scaled dot‑product attention):

Attention(Q, K, V) = softmax(QK^T / √d_k) · V,

где Q, K, V — матрицы запросов, ключей и значений, соответственно получаемые линейными проекциями из представлений соответствующих модальностей. Мы используем 8 голов внимания для каждой пары, что позволяет модели одновременно фокусироваться на различных аспектах взаимодействия.

После получения попарных контекстных векторов они конкатенируются с исходными модальными представлениями и пропускаются через полносвязный слой для получения обогащённого представления каждой модальности.

Сигмоидные вентили (аварийные выключатели)

Чтобы динамически обнулять ненадёжные модальные каналы, мы вводим сигмоидные вентили. Для каждой модальности m ∈ {t, a, v} вычисляется скалярный гейт:

g_m = σ(W_g·concat(H_m, C_context) + b_g),

где C_context — вектор глобального контекста диалога, полученный усреднением представлений предшествующих высказываний. Результирующее представление модальности:

H_m' = g_m ⊙ H_m,

где — поэлементное умножение. Если гейт близок к нулю, канал фактически отключается, что предотвращает распространение шума в итоговое предсказание.

Адаптивное перераспределение весов модальностей

Изначально веса модальностей фиксированы и установлены в соотношении 0,5 / 0,3 / 0,2 для текста, аудио и видео соответственно. Однако в реальных диалогах значимость каналов может существенно варьироваться. Для учёта этого мы разработали лёгкий многослойный персептрон (MLP), который получает на вход:

  • Вектор контекста диалога C_context;
  • Текущие модальные представления H_t', H_a', H_v';
  • Дополнительные мета‑признаки (например, длина реплики, наличие смеха в аудио).

MLP состоит из двух скрытых слоёв с размерностями 256 и 3, функцией активации ReLU и выходным слоем softmax, что даёт набор весов α_t, α_a, α_v, суммирующихся до единицы. Итоговое мультимодальное представление вычисляется как взвешенная сумма:

H_fused = α_t·H_t' + α_a·H_a' + α_v·H_v'.

Итоговый классификатор

Объединённое представление H_fused подаётся на вход линейного классификатора, который определяет вероятность каждой эмоции. В качестве функции активации используется softmax.

Технические детали реализации

Модель реализована на базе фреймворка PyTorch 1.12 с использованием библиотеки transformers для загрузки предобученных весов RoBERTa и HuBERT. Видеокодировщик MARLIN был адаптирован из открытой реализации, предоставляемой авторами статьи. Все линейные проекции для перекрёстного внимания имеют размерность 512, что обеспечивает баланс между вычислительной сложностью и ёмкостью модели.

Обучение проводилось на 4 GPU NVIDIA A100 (80 ГБ видеопамяти) с использованием смешанной точности (float16) для ускорения и снижения потребления памяти. Размер батча составлял 32 при общей длительности одной эпохи около 2 часов.

Средняя длина последовательности для текста не превышала 128 токенов, для аудио — 4 секунды (с дискретизацией 16 кГц), для видео — 8 кадров, извлекаемых с интервалом 250 мс. Все модальности были приведены к одной частоте дискретизации с помощью линейных проекций.

Обучение

Функции потерь

Мы применяем комбинацию фокальной потери и контролируемой контрастивной потери. Фокальная потеря определяется как:

L_focal = -∑_i (1 - p_i^γ)·log(p_i),

где p_i — предсказанная вероятность истинного класса, γ — коэффициент фокусировки (в экспериментах γ = 2). Фокальная потеря снижает вес легко классифицируемых примеров и усиливает внимание к трудным.

Контрастивная потеря формулируется следующим образом:

L_contrast = -∑_i ∑_{j∈P(i)} log( exp(sim(H_i, H_j)/τ) / ∑_{k∈N(i)} exp(sim(H_i, H_k)/τ) ),

где P(i) — множество позитивных примеров (высказывания с той же эмоцией), N(i) — негативные примеры (остальные классы), sim — косинусное сходство, τ — температурный параметр. Контрастивная потеря способствует формированию более компактных и разнесённых кластеров в пространстве эмбеддингов.

Расписание обучения: учебная программа уровня класса с косинусным отжигом

Для решения проблемы несбалансированности мы используем учебную программу уровня класса. На начальном этапе (первые ~10 эпох) модель акцентируется на доминирующих классах (нейтральный). Затем в течение последующих ~20 эпох постепенно увеличивается вес редких эмоций. Оставшиеся ~20 эпох модель обучается на всём наборе данных без дополнительных весов. Изменение весов осуществляется по закону косинусного отжига:

w_e = w_min + 0.5·(w_max - w_min)·(1 + cos(π·e/E_max)),

где e — текущая эпоха, E_max — общее число эпох (50), w_min и w_max — минимальный и максимальный вес для редких классов.

Оптимизатор и регуляризация

Обучение проводится с использованием AdamW (lr = 1e‑4, weight_decay = 0.01). Для предотвращения переобучения применяются:

  • Dropout (p = 0.3) на выходах перекрёстного внимания и в адаптивном MLP;
  • Метка сглаживания (label smoothing = 0.1) для снижения чрезмерной уверенности модели;
  • Ранняя остановка на основе валидационной взвешенной F1‑меры.

Гиперпараметры и тонкая настройка

Основные гиперпараметры:

  • Размерность скрытого слоя перекрёстного внимания: 512;
  • Количество голов внимания: 8;
  • Коэффициент фокальной потери γ = 2;
  • Температурный параметр контрастивной потери τ = 0.07;
  • Вес контрастивной потери λ = 0.1;
  • Коэффициент затухания весов учебной программы w_min = 0.2, w_max = 1.0.

Аугментация данных

Для повышения устойчивости к вариациям в аудио и видео применяются следующие техники:

  • Аудио: случайное обрезание фрагмента (0.9–1.0 от исходной длины), временной сдвиг (±10% от длительности), добавление гауссовского шума (σ = 0.005).
  • Видео: случайное горизонтальное отражение, обрезка лица (0.8–1.0 от исходного размера), цвет‑джиттер (яркость ±10%).

Эксперименты

Набор данных

Мы проводим эксперименты на MELD — мультимодальном корпусе диалогов, собранном из популярного телесериала «Друзья». Корпус содержит 13 088 высказываний, каждое из которых снабжено текстовой транскрипцией, аудиофайлом и видеоклипом. Распределение по эмоциям:

  • Нейтральный — ~49%;
  • Радость — ~16%;
  • Грусть — ~12%;
  • Гнев — ~10%;
  • Удивление — ~7%;
  • Страх — ~3%;
  • Отвращение — ~3%.

Данные разделены на обучающую, валидационную и тестовую выборки в соотношении 80/10/10.

Балансировка и метрики

Помимо взвешенной F1‑меры (primary metric) мы также отслеживаем макро‑F1, точность и полноту для каждого класса. Для оценки статистической значимости различий между моделями применяется тест Стьюдента (p < 0.05).

Базовые модели

Сравнение проводится с несколькими базовыми архитектурами:

  • Текст‑трансформер: RoBERTa‑large без дополнительных модальностей;
  • Аудио‑трансформер: HuBERT‑large на аудио‑данных;
  • Видео‑сеть: MARLIN на видеоданных;
  • Простое слияние: конкатенация признаков с последующим полносвязным слоем;
  • Мультимодальный трансформер без гейтов: перекрёстное внимание без сигмоидных вентилей и адаптивных весов.

Результаты

Как видно из таблицы 1, MAFT значительно превосходит все рассмотренные базовые модели. Ключевые показатели:

  • Взвешенная F1‑мера: 69,2% (против 57,3% у базового прототипа);
  • Макро‑F1: 65,8% (против 53,1%);
  • Точность: 70,5% (против 58,9%);
  • Полнота для редких классов (страх, отвращение) выросла на ~8–10%.

Тест Стьюдента подтверждает статистическую значимость улучшения (p < 0.01).

«Адаптивное распределение весов позволяет системе автоматически увеличивать значимость аудио‑канала в ситуациях, когда текст содержит иронию или сарказм», — отмечается в статье.

Анализ вклада компонентов

Абляционное исследование показало:

  • Удаление перекрёстного внимания снижает взвешенную F1 на 4,3%;
  • Отключение сигмоидных вентилей приводит к падению на 3,1%;
  • Отказ от адаптивного MLP уменьшает показатель на 2,7%;
  • Использование только фокальной потери (без контрастивной) даёт снижение на 1,8%;
  • Применение учебной программы уровня класса улучшает результат на 2,4%.

Сравнение с другими методами

В сравнении с наиболее современными подходами на том же бенчмарке MAFT занимает лидирующую позицию. Например, мультимодальная модель Multimodal Emotion Recognition (MER) достигает 66,8% взвешенной F1, а гибридная архитектура Late Fusion with Attention (LFA) — 65,4%. Наш результат в 69,2% превосходит указанные работы на 2,4–3,8 процентных пункта.

Анализ устойчивости к шумам

Для оценки робастности мы искусственно добавляли загрязнение смехом к аудио‑дорожкам и размытие к видеокадрам. MAFT продемонстрировал снижение F1‑меры лишь на 1,2% в условиях сильного шума, тогда как базовая модель теряла до 5,7%. Это подтверждает эффективность сигмоидных вентилей в подавлении искажённых каналов.

Ошибки и ограничения

Анализ ошибок выявил несколько типичных случаев:

  • Неоднозначные высказывания: фразы, которые могут быть интерпретированы как нейтральные или ироничные, чаще ошибочно классифицируются как нейтральные;
  • Короткие реплики: при длине менее 3 слов модель склонна к предсказанию доминирующего класса;
  • Сильное перекрытие лиц: в случаях, когда более 50% лица скрыто, видеоканал практически отключается гейтом, что может приводить к потере информации о мимике.

Эти ограничения указывают на необходимость дальнейшего улучшения обработки низкоресурсных ситуаций и разработки более надёжных стратегий аугментации.

Обсуждение

Результаты демонстрируют, что замороженные предобученные кодировщики являются эффективным инструментом для переноса знаний из крупных мономодальных корпусов в задачу мультимодальной классификации эмоций. При этом механизм перекрёстного внимания позволяет модели учиться взаимосвязям между модальностями без необходимости полной перестройки тяжёлых кодировщиков.

Сигмоидные вентили выполняют роль аварийного выключателя, что особенно важно в реальных условиях, где данные неизбежно содержат артефакты (смех, шумы, размытые кадры). Адаптивный MLP, обучающийся на контексте диалога, обеспечивает гибкость и способность модели переключаться между модальностями в зависимости от содержания реплики.

Применение учебной программы уровня класса в сочетании с фокальной потерей решает проблему дисбаланса, не прибегая к сложным стратегиям ресемплинга. Контрастивная потеря дополнительно улучшает разделение эмоциональных кластеров, что подтверждается ростом макро‑F1.

Практические рекомендации

Для успешного внедрения MAFT в производственные системы рекомендуется:

  • Использовать современные GPU с поддержкой смешанной точности для снижения времени обучения и инференса;
  • Проводить аудит качества данных, уделяя особое внимание чистоте аудио‑ и видеозаписей;
  • Реализовать модуль мониторинга гейтов для отслеживания доли отключённых каналов — это может служить индикатором качества входных данных;
  • При необходимости адаптировать веса учебной программы под специфический дисбаланс целевого корпуса.

Этические соображения

При разработке систем распознавания эмоций важно учитывать потенциальные этические риски:

  • Конфиденциальность: сбор и обработка аудио‑ и видеоданных должны соответствовать законодательству о защите персональных данных (GDPR, ФЗ‑152);
  • Предвзятость моделей: модели могут наследовать предвзятости, присутствующие в обучающих данных, что требует систематической оценки на предмет公平ности (fairness) по полу, возрасту, этнической принадлежности;
  • Использование в реальном времени: развёртывание модели в ассистентах или системах мониторинга должно сопровождаться механизмами контроля и возможностью отключения.

Мы настоятельно рекомендуем проводить аудит моделей на предмет систематических ошибок и внедрять процедуры обратной связи для пользователей.

Будущие направления

Перспективы развития MAFT включают:

  • Расширение на другие наборы данных, такие как IEMOCAP, EmoryNLP, что позволит оценить обобщающую способность модели;
  • Интеграция дополнительных модальностей: физиологические сигналы (ЭКГ, ГСК), текстовые эмодзи, жестовая информация;
  • Исследование интерпретируемости: визуализация внимания и гейтов для объяснения решений модели;
  • Оптимизация для реального времени: квантизация и дистилляция знаний для развёртывания на мобильных устройствах;
  • Мультиязычное обучение: адаптация к языкам с низким ресурсом путём использования многоязычных предобученных моделей.

Заключение

В данной работе предложен MAFT — мультимодальный трансформер слияния внимания, в котором замороженные предобученные кодировщики комбинируются с лёгкими механизмами перекрёстного внимания, сигмоидными вентилями и адаптивным перераспределением весов модальностей. Обучение осуществляется с использованием фокальной и контрастивной потерь в сочетании с учебной программой уровня класса, что позволяет эффективно справляться с несбалансированностью данных и разнообразными шумами.

Эксперименты на бенчмарке MELD подтвердили значительное улучшение показателей: взвешенная F1‑мера возросла с 57,3% до 69,2%. Результаты абляционного исследования подчёркивают важность каждого компонента архитектуры. В будущем планируется расширение подхода на дополнительные модальности и задачи, а также проведение углублённого анализа公平ности модели.

Благодарности

Авторы выражают благодарность Шри Мате Амританандамайи Деви (Амма), канцлеру Амрита Висва Видьapeетхам, за вдохновение и финансовую поддержку в виде оплаты обработки статьи (APC). Открытый доступ к публикации обеспечен при поддержке Амрита Висва Видьapeетхам.

Короткие версии статей можно найти в телеграм-канале.

Посмотреть канал
Кликните еще раз для перехода

Простамол Уно 320 мг №30 — лечение аденомы простаты

Простамол Уно — современный препарат для лечения доброкачественной гиперплазии предстательной железы...

Простамол Уно 320 мг №30 — лечение аденомы простаты

Норева Эксфолиак Карандаш от акне 5 мл

Норева Эксфолиак Роликовый карандаш для локального ухода за кожей. Эффективно борется с воспалительн...

Норева Эксфолиак Карандаш от акне 5 мл

A-Derma Exomega Control масло для душа при сухой коже

A-Derma Exomega Control смягчающее масло для душа бережно очищает сухую и атопичную кожу, насыщая ее...

A-Derma Exomega Control масло для душа при сухой коже

Полисорб МП — сорбент при отравлениях и аллергии, пакеты 3 г...

Полисорб МП — современный энтеросорбент для выведения токсинов, аллергенов и вредных веществ из орга...

Полисорб МП — сорбент при отравлениях и аллергии, пакеты 3 г №10

Зубной порошок Морские Минералы 140 мл для семьи

Семейный зубной порошок с морскими минералами 140 мл для комплексного ухода за полостью рта. Натурал...

Зубной порошок Морские Минералы 140 мл для семьи

Коэнзим Q10 100мг №60 Нэйчес Баунти для сердца и энергии

Нэйчес Баунти Коэнзим Q10 100 мг №60 – биологически активная добавка с коэнзимом Q10, витамином E и ...

Коэнзим Q10 100мг №60 Нэйчес Баунти для сердца и энергии