Как распознать ошибки ИИ: Лексические маркеры в цепочках рассуждений LLM

Как распознать ошибки ИИ: Лексические маркеры в цепочках рассуждений LLM
График точности рассуждений ИИ в зависимости от лексических маркеров
График точности рассуждений ИИ в зависимости от лексических маркеров
Схема анализа цепочек мыслей больших языковых моделей
Схема анализа цепочек мыслей больших языковых моделей
Диаграмма зависимости сложности задачи и длины рассуждений модели
Диаграмма зависимости сложности задачи и длины рассуждений модели
Thumbnail 1
Thumbnail 2
Thumbnail 3
Оригинал исследования на сайте автора
Читать короткую версию
Кликните еще раз для перехода

Введение в проблему интерпретируемости ИИ

Современные большие языковые модели (LLM — Large Language Models) демонстрируют впечатляющие способности, однако их склонность к «галлюцинациям» и самоуверенности при неверных ответах остается критической проблемой. Использование методов обучения с подкреплением для создания цепочек рассуждений (CoT — Chain-of-Thought) значительно улучшило показатели моделей в кодинге и математике. Тем не менее, в сверхсложных тестах, таких как HLE (Humanity’s Last Exam), модели часто демонстрируют необоснованно высокую уверенность, что указывает на плохую калибровку их внутренних систем оценки надежности.

Методология анализа цепочек рассуждений

Наше исследование сосредоточено на выявлении измеримых свойств CoT, которые служат внутренними сигналами уверенности модели. Мы проанализировали три основных класса характеристик:

  • Длина цепочки рассуждений: количество токенов, затраченных на процесс мышления.
  • Волатильность настроения внутри CoT: эмоциональные сдвиги в языке модели при пошаговом рассуждении.
  • Лексикографические маркеры: использование слов-хеджирований (выражений неуверенности, таких как «пожалуй», «возможно») и других языковых сигналов.

Мы протестировали модели DeepSeek R1, Claude 3.7 Sonnet и Qwen2-35B-Think на бенчмарках HLE, OmniMATH и GPQA Diamond.

Результаты: Лексика как индикатор неопределенности

Наше исследование показало, что лексические маркеры неопределенности (например, слова «угадать», «застрял», «сложно») являются одними из самых информативных индикаторов ошибки. В то время как изменения тональности текста дают менее выраженный, но полезный дополнительный сигнал, именно специфический выбор слов позволяет «заглянуть» в процесс мышления ИИ.

«Интересно, что сигналы неопределенности в цепочке рассуждений выражены гораздо ярче, чем маркеры высокой уверенности, что делает ошибки модели более легкими для автоматического детектирования, чем корректные ответы» — отмечают авторы исследования.

Длина CoT и границы компетенции модели

Анализ длины рассуждений показал парадоксальные результаты. В бенчмарках средней сложности (OmniMATH и GPQA, где точность составляет около 70%), длина CoT действительно коррелирует с правильностью ответа. Однако на экстремально сложных задачах (HLE, точность около 9%) длина цепочки перестает быть значимым предиктором. Это означает, что длина рассуждений предсказывает точность только внутри зоны демонстрации компетенции модели, но до момента достижения «предела насыщения» интеллекта системы.

Практическое применение: Постфактум-калибровка

Эти результаты открывают путь к созданию легких методов постфактум-калибровки (post-hoc calibration). Вместо того чтобы полагаться на встроенные механизмы самооценки модели, которые часто вводят в заблуждение, разработчики могут внедрять внешние фильтры, анализирующие «лексические подсказки» в процессе генерации. Это позволяет эффективно отсеивать ошибочные ответы, делая использование ИИ в критически важных сферах более безопасным и предсказуемым.

Заключение

Понимание того, как модели «мыслят» в процессе генерации CoT, позволяет нам лучше оценивать риски использования нейросетей. Лексический анализ — это мощный инструмент, который дополняет существующие методы проверки достоверности ИИ, обеспечивая более высокий уровень надежности в условиях неопределенности.

Данное исследование подчеркивает важность анализа прозрачности рассуждений моделей для развития безопасного искусственного интеллекта будущего.

Короткие версии статей можно найти в телеграм-канале.

Посмотреть канал
Кликните еще раз для перехода

SVR Физиопюр Мицеллярная Вода 400 мл — очищение и демакияж

SVR Физиопюр мицеллярная вода 400 мл — мягкое и эффективное средство для снятия макияжа и очищения к...

SVR Физиопюр Мицеллярная Вода 400 мл — очищение и демакияж

Сульсен Форте Паста 2% от перхоти, 75 мл

Сульсен Форте Паста 2% в тубе 75 мл эффективно борется с перхотью благодаря содержанию селениум суль...

Сульсен Форте Паста 2% от перхоти, 75 мл

Пихтовое Масло Фл 25Мл N1

...

Пихтовое Масло Фл 25Мл N1

Тонометр Вр А100 автоматический — точный контроль давления н...

Тонометр Вр А100 — надежный автоматический измеритель давления на плечо, подходит для регулярного ко...

Тонометр Вр А100 автоматический — точный контроль давления на плечо

Турбослим Кофе для снижения веса, 2г саше №10

Турбослим Кофе — натуральный напиток для контроля веса с экстрактами растений. Способствует снижению...

Турбослим Кофе для снижения веса, 2г саше №10

Сыворотка Esthederm Lift & Repair Абсолютная упругость 3...

Сыворотка Institut Esthederm Lift & Repair Абсолютная упругость — интенсивный уход для кожи лица, по...

Сыворотка Esthederm Lift & Repair Абсолютная упругость 30 мл