Рационален ли ChatGPT? Психологический анализ когнитивных искажений искусственного интеллекта

Рационален ли ChatGPT? Психологический анализ когнитивных искажений искусственного интеллекта
Тай-дизайн/Pixabay
Тай-дизайн/Pixabay
Thumbnail 1
Оригинал исследования на сайте автора

Введение в проблему рациональности искусственного интеллекта

С момента публичного релиза ChatGPT компанией OpenAI в ноябре 2022 года возможности больших языковых моделей (LLM — Large Language Models, сложные алгоритмы ИИ, обученные на гигантских массивах текстовых данных) оказались в центре внимания мировой общественности. Эти нейронные сети демонстрируют поразительные способности в написании текстов, программировании и решении сложных задач. Однако возникает фундаментальный вопрос: можно ли доверять результатам работы этих систем? Являются ли современные модели искусственного интеллекта (ИИ) рациональными в том смысле, в каком мы понимаем человеческую логику?

Новое исследование, проведенное учеными из Университетского колледжа Лондона (UCL — University College London), использует методы когнитивной психологии для изучения рациональности ИИ. Результаты этой работы заставляют серьезно задуматься о природе машинного мышления.

«Мы оцениваем рациональное мышление семи различных больших языковых моделей, используя серию задач из классической литературы по когнитивной психологии», — поясняет Мирко Музолези, профессор компьютерных наук и соавтор исследования Оливия Макмиллан-Скотт.

Методология исследования: Наследие Канемана и Тверски

Для оценки когнитивных способностей нейросетей ученые использовали тесты, которые десятилетиями применялись для изучения человеческого поведения. Большинство этих задач были разработаны двумя титанами в области психологии и поведенческой экономики — Даниэлем Канеманом (1934–2024) и Амосом Тверски (1937–1996).

Даниэль Канеман, заслуженный профессор психологии Принстонского университета, был всемирно признанным экспертом в области психологии принятия решений. В 2002 году он стал лауреатом Премии Шведского государственного банка по экономическим наукам памяти Альфреда Нобеля за интеграцию идей психологических исследований в экономическую науку. Его книга-бестселлер «Думай медленно… решай быстро» (Thinking, Fast and Slow) стала настольным пособием для всех, кто изучает механизмы человеческого суждения в условиях неопределенности.

Сотрудничество Канемана и Тверски, начавшееся в конце 1960-х годов, привело к открытию множества эвристик (психологических упрощений) и когнитивных искажений — систематических ошибок в мышлении, которые мешают человеку принимать рациональные решения. Именно эти концепции легли в основу тестирования современных нейросетей.

Основные когнитивные задачи, использованные в тесте

  • Задача Уотсона (Wason Selection Task): Тест на проверку логического правила, выявляющий склонность к подтверждению своей точки зрения (confirmation bias), когда человек ищет доказательства своей правоты, а не пытается опровергнуть гипотезу.
  • Задача о Линде (Linda Problem): Иллюстрирует ошибку конъюнкции (conjunction fallacy), когда люди ошибочно полагают, что специфическое событие более вероятно, чем общее.
  • Проблема Монти Холла: Известная задача по теории вероятностей, демонстрирующая «ошибку игрока» и неспособность интуитивно оценить шансы при изменении условий.
  • Задача о больницах: Проверяет нечувствительность к размеру выборки (insensitivity to sample size), когда люди игнорируют тот факт, что в малых группах отклонения от среднего значения случаются чаще.
  • Ошибка обратной вероятности (AIDS task): Тест на понимание условной вероятности, где испытуемые часто путают вероятность болезни при наличии симптома с вероятностью симптома при наличии болезни.

Результаты: ИИ против человеческой логики

Исследователи из Университетского колледжа Лондона протестировали модели от ведущих технологических гигантов: OpenAI (GPT-4, GPT-3.5), Google (Bard), Anthropic (Claude 2) и Meta (Llama 2 в различных модификациях). Каждой модели предлагалось решить задачи по 10 раз, чтобы оценить стабильность их ответов.

Результаты оказались неоднозначными:

  • GPT-4 от OpenAI показал лучшие результаты, предоставив правильные ответы и логические обоснования более чем в 69% случаев.
  • Claude 2 от Anthropic занял второе место с результатом 55%.
  • Llama 2 (версия 7b) от Meta продемонстрировала худшие показатели, давая неверные ответы в 77% случаев.

Специфическая иррациональность нейросетей

Самым интересным открытием стало то, что хотя большие языковые модели проявляют иррациональность, она отличается от человеческой. Люди, ошибаясь в этих тестах, обычно следуют определенным психологическим паттернам (когнитивным искажениям). ИИ же часто совершает ошибки, которые не имеют под собой никакой логической структуры.

Ученые обнаружили, что ответы ИИ крайне непоследовательны. Одна и та же модель в разных сессиях может дать как правильный, так и абсолютно абсурдный ответ. Часто нейросеть демонстрирует правильный ход рассуждений, но в конечном итоге выдает неверный результат. Это свидетельствует о том, что ИИ не «мыслит» в привычном понимании, а скорее манипулирует статистическими вероятностями слов.

Почему это важно для безопасности?

Выявленная иррациональность ИИ имеет серьезные последствия для безопасности в таких критически важных областях, как медицина и дипломатия. Если нейросеть склонна к логическим сбоям, которые невозможно предсказать или соотнести с человеческими ошибками, использование её в качестве советника может быть рискованным.

В медицине неправильная интерпретация условной вероятности (как в задаче о СПИДе) может привести к ложной диагностике. В дипломатии непоследовательность в принятии решений на основе данных может спровоцировать конфликты. Иррациональность ИИ — это не просто академический интерес, а серьезный вызов для разработчиков систем безопасности.

Будущее когнитивной оценки ИИ

Исследователи заключают, что предложенная ими методология может быть использована для более глубокого изучения когнитивных способностей будущих поколений нейросетей. Понимание того, как и почему «ошибается» ИИ, поможет создать более надежные и прозрачные системы.

Несмотря на прогресс, современные LLM все еще далеки от подлинной рациональности. Они могут имитировать человеческий стиль общения, но их внутренняя логика остается хрупкой и подверженной специфическим сбоям, которые когнитивная психология только начинает изучать.

Статья подготовлена на основе материалов исследования UCL. Все права защищены © 2024 Cami Rosso.

Короткие версии статей можно найти в телеграм-канале.

Посмотреть канал
Кликните еще раз для перехода

Синтомицин линимент 10% — лечение кожных инфекций

Синтомицин линимент 10% в тубе 25 г — антибиотик широкого спектра для наружного применения. Эффектив...

Синтомицин линимент 10% — лечение кожных инфекций

Солгар Пиколинат Хром 200мкг - контроль сахара, 90 капсул

Капсулы Солгар Пиколинат Хром 200мкг помогают контролировать уровень сахара в крови и снижают тягу к...

Солгар Пиколинат Хром 200мкг - контроль сахара, 90 капсул

Аэртал крем 1,5% 60г - противовоспалительное и обезболивающе...

Аэртал крем с ацеклофенаком 1,5% — эффективное противовоспалительное и обезболивающее средство для н...

Аэртал крем 1,5% 60г - противовоспалительное и обезболивающее

Шампунь Восстановление и Питание Гиалурон-Коллаген 250мл

Шампунь Золотой Шелк Нутришн с гиалуроновой кислотой и коллагеном глубоко питает и восстанавливает п...

Шампунь Восстановление и Питание Гиалурон-Коллаген 250мл

Vichy Minéral 89 Гель-Сыворотка 30 мл для увлажнения кожи

Гель-сыворотка Vichy Minéral 89 в объёме 30 мл укрепляет барьер кожи, насыщает минералами и интенсив...

Vichy Minéral 89 Гель-Сыворотка 30 мл для увлажнения кожи

Кондиционер Ducray Anaphase+ против выпадения волос 200 мл

Укрепляющий кондиционер Ducray Anaphase+ для борьбы с выпадением волос. Интенсивно питает и укрепляе...

Кондиционер Ducray Anaphase+ против выпадения волос 200 мл