Как LLM развивают социальное мышление: прорыв в энергоэффективном ИИ

Как LLM развивают социальное мышление: прорыв в энергоэффективном ИИ
Дельтаворкс/Пиксабей
Дельтаворкс/Пиксабей
Thumbnail 1
Оригинал исследования на сайте автора

LLM: Разгадка тайны человеческого мышления для создания энергоэффективного ИИ

Человеческий мозг значительно превосходит искусственный интеллект (ИИ) по энергоэффективности. Большие языковые модели (Large Language Models, LLM) требуют колоссальных объемов энергии. Поэтому понимание того, как они «думают», является ключевым конкурентным преимуществом для снижения вычислительных затрат и улучшения общей производительности.

Новое исследование выявило, как LLM развивают способности к социальному мышлению и формируют «теорию разума» (Theory of Mind, ToM). Это важное открытие, которое может привести к созданию более энергоэффективных систем ИИ в будущем.

Прорыв в понимании социального интеллекта ИИ

«Проливая свет на структурные основы социального интеллекта в ИИ, наше исследование заполняет пробел между глубоким обучением (deep learning), когнитивной наукой и этикой ИИ», — пишут соответствующие авторы исследования Денгхуэй Чжан (Denghui Zhang) и Чжаочжуо Сюй (Zhaozhuo Xu) из Института Технологий Стивенса (Stevens Institute of Technology), а также их соавторы Хэн Джи (Heng Ji) из Иллинойсского университета в Урбана-Шампейн (University of Illinois Urbana-Champaign), Зируй Лю (Zirui Liu) из Университета Миннесоты (University of Minnesota Twin Cities), Вентао Гуо (Wentao Guo) из Принстонского университета (Princeton University) и Юхэн Ву (Yuheng Wu) из Стэнфордского университета (Stanford University).

Что такое «Теория Разума» (ToM)?

Термин «теория разума» был введен в 1978 году Дэвидом Премаком (David Premack) и Гаем Вудраффом (Guy Woodruff) из Пенсильванского университета (University of Pennsylvania) с публикацией их статьи «Есть ли у шимпанзе теория разума?» («Does the chimpanzee have a theory of mind?») в журнале «Behavioral and Brain Sciences». В психологии теория разума относится к способности понимать, что собственные эмоции, восприятие, намерения, мысли, убеждения и желания отличаются от таковых у других. Это умение крайне важно для обработки социальных и эмоциональных ситуаций, а также для коммуникации.

Проще говоря, ToM — это способность к «чтению мыслей», также известному как ментализм. По данным Энциклопедии раннего детского развития (Encyclopedia on Early Childhood Development), люди развивают этот навык примерно в возрасте от 4 до 5 лет.

LLM: Черный ящик и необходимость прозрачности

Большие языковые модели (LLM), являясь подмножеством машинного обучения (machine learning) в рамках ИИ, обладают тревожной характеристикой: отсутствием прозрачности. По сути, они являются «черным ящиком» (black box).

Искусственные нейронные сети (Artificial Neural Networks, ANN) непрозрачны, когда речь идет о понимании того, как они приходят к своим предсказаниям и выводам. Любой прогресс в освещении внутренней работы глубоких нейронных сетей может не только привести к финансовой выгоде и повышению качества результатов, но и улучшить прозрачность, что является ключом в области этики ИИ.

«Исследуя, как LLM развивают способность делать выводы о ментальных состояниях, мы можем лучше согласовать системы LLM с человеческим социальным познанием, способствуя созданию более надежных и интерпретируемых взаимодействий», — пишут исследователи.

Методика исследования: Влияние параметров на ToM

Для проведения своего исследования команда ученых сосредоточилась на фундаментальных механизмах формирования теории разума в LLM, в частности, на параметрах ИИ-модели. Стратегия исследователей заключалась в том, чтобы изучить параметры моделей, чтобы выявить те, которые наиболее чувствительны и оказывают наибольшее влияние на производительность в задачах теории разума.

Для этого они разработали метод обнаружения паттернов в LLM с разреженной чувствительностью параметров (sparse parameter sensitivity), где большинство значений приближаются к нулю или равны ему, используя математические формулы.

Ключевые выводы: Малое влияние — большой эффект

«Воздействие всего лишь 0,001% параметров модели приводит к значительным изменениям в способностях к теории разума», — обнаружили исследователи. Это подчеркивает, насколько тонкая настройка может повлиять на сложное поведение ИИ.

Более того, команда не только обнаружила паттерны в разреженных параметрах, которые чрезвычайно чувствительны к способностям теории разума, но и выявила их связь с позиционным кодированием (positional encoding).

Позиционное кодирование: Порядок слов имеет значение

В моделях, содержащих роторное позиционное встраивание (Rotary Position Embedding, RoPE), исследователи обнаружили, что параметры, сильно реагирующие на ToM, тесно связаны с модулем позиционного кодирования.

В LLM позиционные кодирования, также известные как позиционные векторы (positional vectors), позволяют отслеживать позицию каждого слова в последовательности. Этот механизм отслеживания улавливает контекст и смысл. Порядок слов в предложении влияет на его значение.

Чтобы проиллюстрировать важность позиционных кодирований, рассмотрим пример:

  • Предложение «Фред кормит рыбу» (Fred feeds fish) имеет совершенно другое значение, чем
  • «Рыба кормит Фреда» (Fish feeds Fred).

Взаимосвязь ToM, внимания и понимания языка

Интересно, что ученые обнаружили, что параметры, сильно реагирующие на ToM, влияют на механизмы внимания (attention mechanisms) модели. Если эти механизмы активируются, они изменяют работу механизма внимания и могут снизить способности модели к пониманию языка и теории разума.

Пионерские исследователи применили принципы когнитивной науки и теорию разума на уровне параметров, чтобы понять внутреннюю работу больших языковых моделей ИИ и получить важные сведения.

emergentное поведение ИИ

Они обнаружили, что специфические параметры, влияющие на задачи теории разума, также влияют на понимание языка моделью и ее контекст. Полученные данные свидетельствуют о том, что **социальное мышление в LLM является emergentным (emergent)**, то есть оно возникает в результате взаимодействия между компонентами, а не запрограммировано напрямую.

«По мере развития LLM понимание того, как они приобретают, кодируют и манипулируют социальными рассуждениями, будет иметь решающее значение для обеспечения их прозрачности, надежности и соответствия человеческим ценностям», — заключили исследователи.

Это исследование открывает новые горизонты в разработке более интеллектуальных, эффективных и понятных систем ИИ, приближая нас к синергии человека и машины.

Copyright © 2025 Cami Rosso. Все права защищены.

Короткие версии статей можно найти в телеграм-канале.

Посмотреть канал
Кликните еще раз для перехода

Дюкрэ Скванорм Шампунь от сухой перхоти 200 мл

Шампунь Ducray Squanorm — эффективное средство от сухой перхоти для чувствительной кожи головы. Акти...

Дюкрэ Скванорм Шампунь от сухой перхоти 200 мл

Белодерм крем 30 г – лечение зуда, воспаления и аллергии

Белодерм крем 30 г — глюкокортикостероид для наружного применения с противовоспалительным, противозу...

Белодерм крем 30 г – лечение зуда, воспаления и аллергии

Унга-Ср бинт эластичный 10х300 см для профилактики варикоза

Эластичный медицинский бинт Унга-Ср 10х300 см обеспечивает мягкую компрессию I класса (до 14 мм рт. ...

Унга-Ср бинт эластичный 10х300 см для профилактики варикоза

Урьяж Дезодорант Тройного Действия 50Мл для чувствительной к...

Гипоаллергенный роликовый дезодорант Uriage для чувствительной кожи обеспечивает защиту от пота на 2...

Урьяж Дезодорант Тройного Действия 50Мл для чувствительной кожи

Быструмгель 2,5% 30г - Обезболивающий гель для суставов

Быструмгель 2,5% — эффективное обезболивающее и противовоспалительное средство для наружного примене...

Быструмгель 2,5% 30г - Обезболивающий гель для суставов

Настойка мяты перечной 25 мл — успокаивающее и спазмолитичес...

Настойка мяты перечной 25 мл — натуральное растительное средство с успокаивающим и спазмолитическим ...

Настойка мяты перечной 25 мл — успокаивающее и спазмолитическое