Интересное сегодня
Введение в проблему интерпретируемости ИИ
Современные большие языковые модели (LLM — Large Language Models) демонстрируют впечатляющие способности, однако их склонность к «галлюцинациям» и самоуверенности при неверных ответах остается критической проблемой. Использование методов обучения с подкреплением для создания цепочек рассуждений (CoT — Chain-of-Thought) значительно улучшило показатели моделей в кодинге и математике. Тем не менее, в сверхсложных тестах, таких как HLE (Humanity’s Last Exam), модели часто демонстрируют необоснованно высокую уверенность, что указывает на плохую калибровку их внутренних систем оценки надежности.
Методология анализа цепочек рассуждений
Наше исследование сосредоточено на выявлении измеримых свойств CoT, которые служат внутренними сигналами уверенности модели. Мы проанализировали три основных класса характеристик:
- Длина цепочки рассуждений: количество токенов, затраченных на процесс мышления.
- Волатильность настроения внутри CoT: эмоциональные сдвиги в языке модели при пошаговом рассуждении.
- Лексикографические маркеры: использование слов-хеджирований (выражений неуверенности, таких как «пожалуй», «возможно») и других языковых сигналов.
Мы протестировали модели DeepSeek R1, Claude 3.7 Sonnet и Qwen2-35B-Think на бенчмарках HLE, OmniMATH и GPQA Diamond.
Результаты: Лексика как индикатор неопределенности
Наше исследование показало, что лексические маркеры неопределенности (например, слова «угадать», «застрял», «сложно») являются одними из самых информативных индикаторов ошибки. В то время как изменения тональности текста дают менее выраженный, но полезный дополнительный сигнал, именно специфический выбор слов позволяет «заглянуть» в процесс мышления ИИ.
«Интересно, что сигналы неопределенности в цепочке рассуждений выражены гораздо ярче, чем маркеры высокой уверенности, что делает ошибки модели более легкими для автоматического детектирования, чем корректные ответы» — отмечают авторы исследования.
Длина CoT и границы компетенции модели
Анализ длины рассуждений показал парадоксальные результаты. В бенчмарках средней сложности (OmniMATH и GPQA, где точность составляет около 70%), длина CoT действительно коррелирует с правильностью ответа. Однако на экстремально сложных задачах (HLE, точность около 9%) длина цепочки перестает быть значимым предиктором. Это означает, что длина рассуждений предсказывает точность только внутри зоны демонстрации компетенции модели, но до момента достижения «предела насыщения» интеллекта системы.
Практическое применение: Постфактум-калибровка
Эти результаты открывают путь к созданию легких методов постфактум-калибровки (post-hoc calibration). Вместо того чтобы полагаться на встроенные механизмы самооценки модели, которые часто вводят в заблуждение, разработчики могут внедрять внешние фильтры, анализирующие «лексические подсказки» в процессе генерации. Это позволяет эффективно отсеивать ошибочные ответы, делая использование ИИ в критически важных сферах более безопасным и предсказуемым.
Заключение
Понимание того, как модели «мыслят» в процессе генерации CoT, позволяет нам лучше оценивать риски использования нейросетей. Лексический анализ — это мощный инструмент, который дополняет существующие методы проверки достоверности ИИ, обеспечивая более высокий уровень надежности в условиях неопределенности.
Данное исследование подчеркивает важность анализа прозрачности рассуждений моделей для развития безопасного искусственного интеллекта будущего.