Мультимодальная нейросеть: как ИИ предсказывает удовлетворённость телом по селфи

Учёные разработали инновационную мультимодальную нейросеть на основе BERT и свёрточных сетей, которая с точностью 83% предсказывает уровень удовлетворённости своим тел...

Материал носит информационный характер и не заменяет консультацию психолога или врача.

Мультимодальная нейросеть: как ИИ предсказывает удовлетворённость телом по селфи

По теме

Просоциальное поведение подростков с проблемами поведения: р...

Статья посвящена исследованию просоциального поведения подростков с проблемами поведения (conduct pr...

СДВГ как континуум: современное понимание нейроразвития

Узнайте, почему СДВГ рассматривается не как изолированная болезнь, а как дименсиональное состояние, ...

Как переосмысление прошлого улучшает психическое здоровье: м...

Научная статья о методе когнитивной терапии воспоминаниями (CRT), разработанном исследователями Унив...

Нутрициологическая психиатрия: комплексный подход к лечению ...

Статья раскрывает, как физическая активность, питание, лабораторная диагностика и нейробиоуправление...

Многомерное восприятие доверия к ИИ-медицинским разговорным ...

Научное исследование посвящено разработке и валидации многомерной шкалы восприятия доверия к искусст...

Кетогенная диета при биполярном расстройстве: революция мета...

Как кетогенная диета помогает при лечении тяжелых психических заболеваний, включая биполярное расстр...

Оригинал исследования на сайте автора

Введение: почему важно предсказывать удовлетворённость телом по селфи

В эпоху цифровых технологий и социальных сетей селфи стали неотъемлемой частью повседневной жизни миллионов людей. Они отражают не только внешний облик, но и эмоциональное состояние, самооценку и восприятие собственного тела. Удовлетворённость телом (body satisfaction) — это ключевой психологический показатель, напрямую связанный с самооценкой, эмоциональным благополучием и риском развития расстройств пищевого поведения, депрессии и тревожных состояний.

Точное предсказание того, насколько человек доволен своим телом на основе селфи, имеет огромное значение для понимания восприятия тела, профилактики психологических проблем и разработки персонализированных сервисов в сфере здоровья. Однако традиционные подходы к оценке удовлетворённости телом основаны на опросниках и самоотчётах, которые субъективны и трудоёмки. Авторы нового исследования предложили инновационное решение — мультимодальную нейросеть, способную автоматически анализировать как изображение, так и текст.

Что такое мультимодальная нейросеть и как она работает

Мультимодальная нейросеть — это модель машинного обучения, которая одновременно обрабатывает несколько типов данных (модальностей), таких как изображения, текст, аудио или видео. В данном исследовании используется архитектура, объединяющая две мощные технологии: BERT (Bidirectional Encoder Representations from Transformers — двунаправленные представления кодировщика на основе трансформеров) и свёрточную нейронную сеть (CNN, Convolutional Neural Network).

Цель модели — достичь более точного вывода психологического состояния пользователя путём глубокой интеграции мультимодальной информации. Модель применяет двухветвевую архитектуру (dual-branch architecture), где каждая ветвь отвечает за обработку своего типа данных.

Текстовая ветвь: семантический анализ описаний

Текстовая ветвь использует предобученную модель BERT для извлечения глубоких семантических признаков из текстовых описаний, сопровождающих селфи. BERT — это языковая модель, основанная на архитектуре трансформера, которая понимает контекст слов в предложении, учитывая как левый, так и правый контекст. Это позволяет модели улавливать тонкие нюансы: эмоциональные тенденции, самоиронию, заниженную или завышенную самооценку в описаниях.

Визуальная ветвь: анализ изображений

Визуальная ветвь использует ResNet-50 (Residual Network-50 — остаточная нейронная сеть с 50 слоями) в сочетании с механизмом внимания каналов (channel attention mechanism). ResNet-50 — это глубокая свёрточная нейронная сеть, которая решает проблему исчезающего градиента за счёт остаточных связей, позволяя обучать очень глубокие сети. Механизм внимания каналов помогает модели сосредоточиться на ключевых визуальных признаках: мимике, позе тела, общей композиции снимка.

Ключевая инновация: модуль перекрёстного внимания

Центральной инновацией исследования является модуль перекрёстного внимания (cross-modal attention fusion module), который обеспечивает тонкую (fine-grained) взаимосвязь между текстовыми и визуальными признаками через механизм двунаправленного внимания. Это означает, что модель не просто объединяет признаки, а учится выявлять, какие элементы изображения соответствуют каким словам в описании, и наоборот.

Дополнительно используется адаптивный гейтинг (adaptive gating unit) — механизм, который динамически регулирует вес вклада каждой модальности в финальное предсказание. Это важно, потому что в одних случаях текст может быть более информативным (например, при явном выражении недовольства), а в других — визуальные сигналы (например, напряжённая поза или грустное выражение лица).

«Адаптивный гейтинг позволяет модели гибко балансировать между модальностями, производя более дискриминативное совместное представление, которое учитывает сильные стороны каждого типа данных»

Результаты экспериментов: точность 83%

Эксперименты проводились на наборе данных Selfit — специализированном датасете, содержащем селфи с текстовыми аннотациями и оценками удовлетворённости телом. Результаты впечатляют:

  • Средняя абсолютная ошибка (MAE, Mean Absolute Error): 0,310 — показатель, отражающий среднее отклонение предсказания от истинного значения;
  • Средняя квадратичная ошибка (MSE, Mean Squared Error): 0,211 — показатель, сильнее штрафующий крупные ошибки;
  • Точность классификации (accuracy): 83,0% при преобразовании непрерывных предсказанных значений в дискретные уровни удовлетворённости;
  • Взвешенный F1-score (weighted F1 score): 0,828 — гармоническое среднее точности и полноты с учётом дисбаланса классов.

Эти результаты значительно превосходят как одномодальные подходы (когда используется только текст или только изображение), так и существующие современные мультимодальные базовые модели (state-of-the-art multimodal fusion baselines). Это подтверждает, что глубокая интеграция текста и изображения даёт синергетический эффект.

Практическое значение и области применения

Исследование не только подтверждает эффективность глубокой интеграции текста и изображения для предсказания удовлетворённости телом, но и предлагает методологическую основу для мультимодальных психологических вычислений в целом. Потенциальные области применения обширны:

  • Цифровая оценка психического здоровья (digital mental health assessment): автоматический скрининг пользователей, которые могут нуждаться в психологической помощи;
  • Интеллектуальное понимание контента (intelligent content understanding): анализ пользовательского контента в социальных сетях для выявления тревожных тенденций;
  • Персонализированные рекомендации: подбор контента, упражнений или ресурсов на основе психологического состояния пользователя;
  • Мониторинг общественного здоровья: отслеживание тенденций в восприятии тела на популяционном уровне.

Научный контекст и междисциплинарность

Работа находится на пересечении нескольких научных дисциплин: инженерии, компьютерных наук, нейронауки и психологии. Это подтверждается тем, что статья индексирована в разделах «Инженерия», «Математика и вычисления», «Нейронаука» и «Психология».

Об авторах

Исследование выполнено международным коллективом учёных из Китая:

  • Хуа Ву (Hua Wu) — Школа психологии Северо-Западного педагогического университета (Ланьчжоу) и Университет керамики Цзиндэчжэнь (Цзянси);
  • Цюян Хуан (Qiuyang Huang) — Школа современных услуг Цзянсиского института искусств и керамических технологий (Цзиндэчжэнь);
  • Яньмэй Чжао (Yanmei Zhao) — Школа иностранных языков Юйсийского педагогического университета (Юйси);
  • Вэньлин Ли (Wenling Li) — Школа педагогических наук Гуансийского педагогического университета для национальных меньшинств (Чунцзо);
  • Сютао Лю (Xutao Liu) — Школа физического воспитания Цзянсуского университета науки и технологий (Чжэньцзян).

Публикационные данные и открытый доступ

Статья опубликована в научном журнале Scientific Reports (издательская группа Springer Nature) и распространяется по лицензии Creative Commons Attribution-NonCommercial-NoDerivatives 4.0 International License (CC BY-NC-ND 4.0). Это означает, что материал можно свободно использовать в некоммерческих целях при указании авторства. DOI статьи: 10.1038/s41598-026-68842-7. Дата публикации: 29 августа 2026 года.

Финансирование и этические аспекты

Исследование не получало внешнего финансирования. Авторы заявляют об отсутствии конфликта интересов. Статья не содержит исследований с участием людей или животных, все методы соответствуют релевантным руководствам и регламентам.

Заключение

Предложенная модель демонстрирует, что объединение текстового и визуального анализа с помощью механизмов перекрёстного внимания и адаптивного гейтинга позволяет значительно повысить точность предсказания психологических состояний. В мире, где цифровой контент всё больше отражает внутренний мир человека, такие технологии становятся мощным инструментом для заботы о психическом здоровье. Исследование открывает путь к более точным, масштабируемым и персонализированным системам психологической поддержки.

Короткие версии статей можно найти в телеграм-канале.

Посмотреть канал
Кликните еще раз для перехода

Пеха-Хафт бинт эластичный когезивный 8см x 4м

Пеха-Хафт эластичный когезивный бинт 8см x 4м — надежное средство для фиксации повязок и медицинских...

Пеха-Хафт бинт эластичный когезивный 8см x 4м

Тампоны Kotex Мини для незначительных выделений уп. №8

Тампоны Котекс Мини №8 созданы для дней с незначительными выделениями. Ультратонкая форма обеспечива...

Тампоны Kotex Мини для незначительных выделений уп. №8

Weleda Миндальное молочко для тела 200 мл - для чувствительн...

Молочко для тела Weleda с миндалем для чувствительной кожи. Легкая текстура быстро впитывается, обес...

Weleda Миндальное молочко для тела 200 мл - для чувствительной кожи

Масло Антицеллюлитное Массажное Фл. 150Мл

...

Масло Антицеллюлитное Массажное Фл. 150Мл

Сульфацил натрия 20% глазные капли Альбуцид 10 мл

Сульфацил натрия (Альбуцид) 20% глазные капли — антимикробное средство для местного применения, эффе...

Сульфацил натрия 20% глазные капли Альбуцид 10 мл

Фукус-Плюс Гран 20Г - Гомеопатический препарат №1

Гомеопатический препарат Фукус-Плюс Гран 20Г Уп №1 от проверенного производителя. Эффективное средст...

Фукус-Плюс Гран 20Г - Гомеопатический препарат №1