По теме
Заменит ли искусственный интеллект очную психотерапию?
Узнайте, сможет ли искусственный интеллект заменить живого психотерапевта, каковы плюсы и минусы исп...
Меры энтропии как индикаторы путей связности в головном мозг...
Исследование применения показателей теории информации и алгоритмов сложности для анализа функциональ...
Усталость семейных уходильщиков, социальные роли и психическ...
Это двухцентровое кросс-секционное исследование пациентов, перенесших панкреатэктомию при раке подже...
Доверие к кулинарным роботам: рискобезопасный подход к взаим...
Исследование показывает, как эмпатия, компетентность, взаимность и гарантии влияют на доверие к робо...
Что такое биполярное расстройство: симптомы, типы и диагност...
Подробное руководство о биполярном расстройстве: узнайте основные типы заболевания (БАР 1, БАР 2, ци...
Биполярное расстройство: симптомы, типы (1, 2, циклотимия) и...
Биполярное расстройство — серьезное психическое заболевание, затрагивающее 1–5% населения. Узнайте о...
Введение: Проблема алгоритмической предвзятости в эру генеративного ИИ
Люди по своей природе предвзяты — это установленный факт современной психологии и когнитивной науки. Но переносится ли эта предвзятость на машины, работающие на базе больших языковых моделей (Large Language Models, LLM)? Новое фундаментальное исследование Гарвардского университета дает тревожный ответ: да, языковые модели искусственного интеллекта предвзяты так же, как люди, и делают выводы о компетентности и надежности человека, основываясь исключительно на его лице.
«Вопреки обещаниям улучшить человеческие решения, эти выводы раскрывают безрассудство использования языковых моделей в контекстах отбора», — пишут Махзарин Банаджи (Mahzarin Banaji), Стивен Лер (Steven Lehr) и Яш Лоте (Yash Lothe), авторы исследования, недавно опубликованного в PNAS Nexus — журнале Национальной академии наук США (Proceedings of the National Academy of Sciences, PNAS).
Исторический контекст: От эффекта ореола к когнитивным искажениям
Долгое время установлено, что люди подвержены систематическим ошибкам восприятия. Например, в современной психологии американский психолог Эдвард Ли Торндайк (Edward Lee Thorndike, 1874–1949) ввел понятие эффекта ореола (halo effect) — тенденции общего впечатления о человеке искажать суждение о его отдельных чертах характера. Это произошло в его работе «Постоянная ошибка в психологических оценках» (A constant error in psychological ratings), опубликованной в 1920 году в Journal of Applied Psychology (Журнал прикладной психологии).
В исследовании Торндайка выяснилось, что когда командирам просили оценить подчиненных без личного общения, они давали более высокие оценки уму и военным качествам более высоким и привлекательным военнослужащим. Эффект ореола — лишь одно из множества когнитивных искажений (cognitive biases), термин, введенный в 1970-х годах психологами Амосом Тверски (Amos Tversky) и Даниэлем Канеманом (Daniel Kahneman), позже ставшим лауреатом Нобелевской премии по экономике.
Мгновенные суждения по лицу: Скорость и автоматичность
Фактически, люди часто делают выводы на основе внешности других, и делают это с поразительной скоростью. Всего за одну десятую секунды (100 миллисекунд) человек может сформировать впечатление о другом человеке, согласно другому классическому исследованию, опубликованному два десятилетия назад в журнале Psychological Science исследователями Принстонского университета Джанис Уиллис (Janine Willis) и Александером Тодоровым (Alexander Todorov).
«Люди регулярно делают необоснованные выводы о характере, например, называют людей надежными или ненадежными, основываясь на чертах лица», — пишут профессор психологии Гарварда Банаджи и соавторы.
Для неподготовленного наблюдателя может показаться логичным, что машинный интеллект будет беспристрастным или по крайней мере менее предвзятым, чем «хаотичный биологический мозг», особенно учитывая, что разработчики LLM намеренно пытаются нейтрализовать потенциальные предвзятости. Другие могут согласиться, но по другим причинам. Более технически подкованные люди знают о быстрой эволюции LLM и осведомлены о том, что мультимодальные способности (multimodal abilities) — способность обрабатывать не только текст, но и изображения, аудио, видео — относительно новы по сравнению с предыдущими версиями. Так как же LLM, обученные в основном на тексте, могли приобрести предвзятость и делать выводы о характере по фотографиям лиц?
Как большие языковые модели обучаются и усваивают предвзятость
Большие языковые модели (Large Language Models, LLM) — это алгоритмы глубокого обучения (deep learning) искусственного интеллекта. Модели глубокого обучения представляют собой искусственные нейронные сети, где «глубокое» относится к множеству слоев обработки между входным и выходным слоями. LLM — это модели ИИ, обученные на массивах данных. Главное отличие машинного обучения ИИ заключается в том, что оно «учится» на колоссальных объемах обучающих данных, а не выполняет жестко заданные инструкции.
По словам исследователей Гарварда, «модели вроде GPT-4o тщательно обучались с использованием таких методов, как обучение с подкреплением (reinforcement learning), чтобы избегать социально нежелательных предвзятостей и более вообще достигать выравнивания (alignment) с человеческими целями и моральными сентиментами», — либо просто отказываются отвечать по замыслу разработчиков.
Если LLM учится в основном на тексте, как же она может приобрести предвзятость при анализе фотографий лиц? Как гласит знакомая поговорка, «дьявол кроется в деталях». Чтобы решить этот спор и определить, проявляют ли LLM человекоподобную предвзятость, делая выводы о характере по лицу, исследователи провели почти 8000 испытаний (trials).
Методология: 13 экспериментов, 4 модели, тысячи лиц
Команда создала 13 экспериментов для тестирования способности LLM оценивать надежность и компетентность по двумерным изображениям лиц. Оценивались четыре различные модели LLM:
- GPT-4o и GPT-5 — от компании OpenAI
- Claude Sonnet 4.5 — от компании Anthropic
- Gemini 3 Flash Preview — от компании Google
Все модели представляют собой передовую генерацию мультимодальных систем, способных обрабатывать как текст, так и визуальную информацию. Эксперименты включали демонстрацию моделям фотографий лиц людей с разными расами, полом, возрастом, эмоциональными выражениями и попросили оценить по шкале надежность и компетентность изображенных.
Результаты: LLM проявляют и даже превосходят человеческую предвзятость
Во всех тестах все LLM без исключения демонстрировали некорректные выводы о характере человека касательно его надежности и компетентности, основываясь на изображениях лиц. Ни одна из моделей не отвечала нейтрально, ни одна не отказалась выполнять запросы (промпты), несмотря на встроенные механизмы безопасности.
Интересно, что по всем четырем тестированным LLM они все показали большую величину предвзятости (higher magnitude of bias) по сравнению с людьми при оценке компетентности по фотографиям лиц. Исследователи предполагают, что LLM не просто отражают человеческие предвзятости, но и могут быть более экстремальными в их проявлении.
«Последовательность этих паттернов по чертам и типам лиц указывает на то, что модели вроде GPT не просто повторяют эти предвзятости, а усвоили их концептуально и включают их даже в решения с очевидными последствиями, такие как суждения об уголовной ответственности или достоинстве финансовых инвестиций», — пишут исследователи.
Механизмы возникновения предвзятости в мультимодальных моделях
Как именно текстовые модели, дообученные на изображениях, усваивают такие тонкие социальные стереотипы? Основные гипотезы исследователей включают:
- Статистические закономерности в обучающих данных: В масштабных наборах данных текст часто сопровождает изображения с подписями, альт-текстами, контекстом статей, где внешность коррелирует с описательными эпитетами (например, «успешный бизнесмен», «подозреваемый», «эксперт»). Модель выучивает эти ассоциации.
- Культурные нарративы: Литература, кино, СМИ, исторические тексты закрепляют стереотипы: «хорошие герои» часто симметричны, улыбаются; «злодеи» — имеют особые черты. LLM усваивает эти нарративы как статистические регуляризаторы.
- Эмерджентные способности (emergent abilities): При масштабировании модели возникают качественно новые свойства, не заложенные явно. Способность делать физиогномические суждения может быть таким эмерджентным феноменом.
- Отсутствие негативных примеров в RLHF: При обучении с подкреплением от обратной связи людей (Reinforcement Learning from Human Feedback, RLHF) аннотаторы редко показывают примеры «не делай выводов по лицу», поэтому модель не учится этого избегать.
Практические риски: От найма до уголовного правосудия
Последствия такой предвзятости далеки от теоретических. LLM всё чаще интегрируются в системы:
- HR-технологий: автоматический скрининг резюме с фото, видео-интервью с анализом мимики.
- Финтеха: скоринг заемщиков, оценка надежности по селфи (KYC — Know Your Customer).
- Правоохранительных системах: прогнозирование рецидива, предварительное заключение, анализ видео с камер наблюдения.
- Образовании: прокторнг, оценка заинтересованности студентов по веб-камере.
- Медицине: триаж пациентов, оценка боли по лицу, психодиагностика.
Во всех этих сценариях предубеждение по лицу может привести к систематической дискриминации защищенных групп, нарушению прав и усилению неравенства.
Сравнение с человеческой предвзятостью: Почему машины хуже?
Ученые выделяют ключевые различия, делающие алгоритмическую предвзятость потенциально более опасной:
- Масштаб и скорость: Модель может оценить миллионы лиц в секунду, закрепляя ошибку системно.
- Отсутствие метапознания: Человек может осознать свою предвзятость и скорректироваться (хотя и не всегда); LLM не имеет интроспекции.
- Ложная объективность: Решение алгоритма воспринимается как «научное», «математическое», что затрудняет оспаривание.
- Обратная связь и закрепление: Еслиbiased решения используются для генерации новых данных (например, отказы в кредите → менее успешные истории → подтверждение модели), возникает петля самоподтверждения.
- Трансфер на новые домены: Предвзятость, выученная на фото портретов, переносится на медицинские снимки, спутниковые фото, генерацию аватаров.
Текущие подходы к смягчению (Mitigation) и их ограничения
Индустрия и академия разрабатывают стратегии снижения предвзятости:
- Данные: Курирование сбалансированных датасетов, контрибуция контрпримеров, аугментация (изменение раса, пола, возраста на фото с сохранением контекста).
- Архитектура: Добавление модулей «независимости от защищенных атрибутов» (disentanglement), адверсариальное обучение (adversarial training) для удаления информации о расе/поле из скрытых представлений.
- Обучение: RLHF с явными инструкциями «не суди по лицу», 헌법ный ИИ (Constitutional AI) с принципами недискриминации.
- Пост-обработка: Калибровка выходов, установка порогов равенства шансов (equalized odds), демографический паритет.
- Аудит и регламентация: Третьесторонние аудиты (algorithmic auditing), стандарты вроде EU AI Act, ISO 42001, NIST AI RMF.
Однако исследование Гарварда показывает: текущие меры недостаточны. Модели продолжают «видеть» характер в лице даже после обширного RLHF. Требуются принципиально новые подходы — возможно, отказ от физиогномических задач вообще (refusal by design) или архитектурные гарантии инвариантности.
Этические и правовые последствия
Публикация в PNAS Nexus добавляет весомый научный аргумент в дебаты о регулировании ИИ:
- EU AI Act: Классифицирует системы биометрической категоризации и распознавания эмоций как высокорисковые. Физиогномические выводы LLM попадают под запрет или строгое регулирование.
- США: Executive Order on AI (исполнительный приказ Байдена) требует аудита на предвзятость для фундаментальных моделей.
- ISO/IEC 42001: Стандарт систем управления ИИ требует оценки рисков дискриминации.
- Судебная практика: Дела вроде EEOC v. iTutorGroup (дискриминация по возрасту в автонайме) создают прецеденты ответственности за алгоритмические решения.
Компании, развертывающие LLM для оценки людей, сталкиваются с растущими правовыми и репутационными рисками.
Направления будущих исследований
Авторы и независимые эксперты выделяют ключевые вопросы для дальнейшей работы:
- Интерпретируемость: Механистическое понимание (mechanistic interpretability) — где именно в весах модели кодируется «надежность по лицу»? Можно ли это локализовать и отредактировать (model editing)?
- Кросс-культурность: Как предвзятость варьируется по культурам? Обучающие данные затесняют западные стандарты красоты и надежности.
- Динамика версий: Уменьшается ли предвзятость от GPT-4 к GPT-4o к GPT-5? Ранние данные показывают неустойчивую динамику.
- Мультимодальность vs текст: Есть ли разница в предвзятости, если модель рассуждает о текстовом описании лица vs анализирует пиксели?
- Взаимодействие с людьми: Усиливает ли использование LLM человеческую предвзятость (automation bias) или может её снизить при правильном дизайне интерфейса?
- Генеративные аспекты: При генерации изображений (DALL-E, Midjourney, Imagen) те же стереотипы проявляются в созданных лицах — замкнутый цикл.
Рекомендации для практиков, разработчиков и политиков
На основе результатов исследования формулируются практические шаги:
- Не используйте LLM для оценки характера, компетентности, надежности по фото/видео лиц. Это ненадежно, этично недопустимо и zunehmend нелегально.
- Проводите независимый аудит предвзятости (bias audit) перед любым развертыванием в высокорисковых доменах. Используйте стандарты NIST AI RMF, ISO 42001.
- Внедряйте «human-in-the-loop» с обучением: Люди, принимающие решения на базе ИИ, должны проходить тренинг по распознаванию алгоритмической предвзятости.
- Требуйте прозрачности от вендоров: Model cards, system cards, результаты бенчмарков на предвзятость (вроде FairFace, UTKFace, BFW datasets).
- Инвестируйте в альтернативы: Оценка компетентности — через работы, тесты, портфолио, рекомендации; надежность — через историю платежей, референсы, верифицируемые факты.
- Поддерживайте регуляторные инициативы, запрещающие автоматическую физиогномику и требующие оценки воздействия на права человека (Human Rights Impact Assessment, HRIA).
Заключение: От осознанности к действию
Исследование Гарвардской команды под руководством проф. Махзарин Банаджи — важный веха в понимании природы машинного интеллекта. Оно демонстрирует, что претензии LLM на объективность невыполнимы, пока модели обучаются на данных, порожденных предвзятым человеческим обществом, и пока архитектуры позволяют эмерджентному усвоению социальных стереотипов.
«Консистентность этих паттернов указывает на то, что модели не просто попугайят предвзятости, а интегрировали их в свою концептуальную структуру», — подчеркивают авторы. Это означает, что поверхностные патчи (фильтры отказов, промпт-инжиниринг) не решают проблему коренным образом.
Путь вперед лежит через сочетание технической строгости (механистическая интерпретируемость, каузальное моделирование, формальная верификация справедливости), этического проектирования (value-sensitive design, participatory AI с вовлечением пострадавших сообществ) и правового принуждения (регуляция высокорисковых применений, ответственность разработчиков и деплоеров).
Только системный подход может предотвратить превращение ИИ в инструмент автоматизации и усиления вековых человеческих предрассудков под видом технологического прогресса.
Copyright © 2026 Cami Rosso. All rights reserved. Перевод и адаптация подготовлены специально для русскоязычной аудитории с расширением научного контекста и SEO-оптимизацией.