По теме
Дело Линдси Клэнси: послеродовой психоз и трагедия материнст...
Рассмотрение дела Линдси Клэнси, обвиняемой в убийстве троих детей, обращает внимание общества на пр...
Генетика против воспитания: что изучение близнецов говорит о...
Подробный разбор недавнего масштабного исследования близнецов с использованием функциональной магнит...
Как жизненные события меняют вашу личность: научное объяснен...
Научное исследование Университета Иллинойса доказало, что личность меняется не только из-за крупных ...
Почему похудение вызывает грусть и неудовлетворённость: псих...
Почему достижение целевого веса не приносит счастья? Исследуем физиологические последствия дефицита ...
Разница между головной болью напряжения и мигренью: диагност...
Узнайте, как современные методы машинного обучения помогают различать головную боль напряжения и миг...
Как общение с собаками улучшает работу мозга и снижает стрес...
Узнайте, как научно доказано общение с собаками влияет на активность головного мозга, снижает уровен...
Введение: Вероятностная природа больших языковых моделей
Классическая теория вероятностей долгое время служила эталоном для оценки логического вывода. Однако человеческое мышление часто отклоняется от строгих рамок Колмогорова (аксиоматика теории вероятностей, сформулированная Андреем Колмогоровым), демонстрируя такие феномены, как «ошибка конъюнкции» (неправильная оценка вероятности одновременного наступления двух событий) или влияние порядка постановки вопросов. Возникает закономерный вопрос: демонстрируют ли большие языковые модели (LLM — Large Language Models) схожие отклонения и какая математическая структура лучше всего их описывает?
Методология оценки
В ходе исследования были протестированы шесть открытых языковых моделей. Мы использовали задачи на оценку вероятности, адаптированные из области когнитивных исследований принятия решений. Выходы моделей рассматривались как поведенческие данные. Мы измеряли отклонения от классических вероятностных тождеств, таких как закон полной вероятности (математическая формула, связывающая вероятность события с условными вероятностями при различных гипотезах).
Систематические отклонения от классических вероятностных норм не объясняются единым механизмом, что указывает на сложность «мышления» современных нейросетей.
Основные результаты анализа
Результаты показывают, что классические тождества в LLM систематически нарушаются, причем наиболее уязвимыми оказались тождества разбиения. Важные выводы включают:
- Ошибка конъюнкции: Правило «квантовой последовательности» (quantum sequential rule), отдающее предпочтение более вероятным событиям, часто лучше реконструирует ошибки моделей, чем классические подходы.
- Эффект порядка: Данные по порядку вопросов не дают однозначного подтверждения квантовой модели поведения, так как небольшие остаточные отклонения (резидуалы) сопоставимы с ошибками в классических моделях.
- Природа шума: Байесовский шум (Bayesian sampler noise — модель, где ответы зависят от ограниченного числа внутренних «выборок») не объясняет наблюдаемые паттерны. Отклонения являются структурированными и зависят от специфики модели, а не от случайных погрешностей.
Механистический анализ внутренних представлений
Анализ нейронных слоев показал, что информация о порядке следования аргументов кодируется на разной глубине в зависимости от архитектуры конкретной модели. Геометрия «ошибки конъюнкции» развивается постепенно по мере прохождения данных через слои нейронной сети. Это доказывает, что мы наблюдаем не универсальную «квантовую сигнатуру», а модель-зависимые отступления от классической вероятности.
Значение для развития ИИ
Наши результаты призывают оценивать системы искусственного интеллекта не только по точности ответов, но и по внутренней согласованности их вероятностных суждений. Это открывает новый путь в области интерпретируемости нейронных сетей: вместо поиска идеального соответствия математическим формулам, исследователи должны изучать динамику рассуждений, которая формируется внутри скрытых слоев модели.
Заключение и диагностика шума
Важно отметить, что «шум» в ответах ИИ — это не просто хаотичные данные. Статистические тесты (такие как коэффициент бимодальности и статистика Шапиро–Уилка) показывают, что распределение вероятностных оценок моделей часто не является нормальным (гауссовым). Модели переключаются между дискретными режимами рассуждений, что еще раз подтверждает: отклонения от логики являются глубоко укорененными свойствами современных алгоритмов обработки естественного языка.