MXRAG: Инновационная рамка для устранения галлюцинаций в мультимодальном искусственном интеллекте

В статье представлена инновационная архитектура MXRAG, предназначенная для устранения галлюцинаций при одновременной обработке изображений, текста и таблиц. Рассматрив...

Материал носит информационный характер и не заменяет консультацию психолога или врача.

MXRAG: Инновационная рамка для устранения галлюцинаций в мультимодальном искусственном интеллекте

По теме

Дело Линдси Клэнси: послеродовой психоз и трагедия материнст...

Рассмотрение дела Линдси Клэнси, обвиняемой в убийстве троих детей, обращает внимание общества на пр...

Генетика против воспитания: что изучение близнецов говорит о...

Подробный разбор недавнего масштабного исследования близнецов с использованием функциональной магнит...

Как жизненные события меняют вашу личность: научное объяснен...

Научное исследование Университета Иллинойса доказало, что личность меняется не только из-за крупных ...

Почему похудение вызывает грусть и неудовлетворённость: псих...

Почему достижение целевого веса не приносит счастья? Исследуем физиологические последствия дефицита ...

Разница между головной болью напряжения и мигренью: диагност...

Узнайте, как современные методы машинного обучения помогают различать головную боль напряжения и миг...

Как общение с собаками улучшает работу мозга и снижает стрес...

Узнайте, как научно доказано общение с собаками влияет на активность головного мозга, снижает уровен...

Оригинал исследования на сайте автора

Введение в мультимодальный искусственный интеллект и проблема галлюцинаций

Искусственный интеллект стремительно развивается, и на переднем крае этой революции находятся много модальные большие языковые модели (MLLMs). Эти сложные системы способны обрабатывать и анализировать различные типы данных одновременно, включая естественные изображения, свободный текст и структурированные таблицы. Однако, несмотря на впечатляющие результаты в задачах визуального вопросно-ответного анализа (VQA) и мультимодальных рассуждений, существует упорно не решаемая проблема: галлюцинации.

Галлюцинации в нейросетях возникают тогда, когда модель генерирует контент, который не имеет отношения к предоставленным входным данным или прямо противоречит им. Особенно опасны тримодальные галлюцинации, которые происходят, когда ответ требует одновременного синтеза доказательств из изображений, текста и таблиц. В таких случаях современные модели часто выдают информацию, не атрибутированную ни к одной из модальностей, что подрывает доверие к искусственному интеллекту.

Существующие подходы и их ограничения

Предыдущие методы борьбы с галлюцинациями в основном фокусировались на парах «изображение-текст». Кроме того, существующие системы генерации с дополненной выборкой (RAG) для мультимодальных сред не всегда включают поддерживающие доказательства и часто лишены атрибутируемой объяснимости. Это означает, что пользователь не может проследить, на каком именно фрагменте изображения или строке таблицы основан ответ нейросети.

Достоверность и интерпретируемость являются фундаментальными требованиями для внедрения искусственного интеллекта в критически важные области, такие как медицина и научные исследования.

Архитектура MXRAG: трехкомпонентное решение тримодальной проблемы

Для решения этой проблемы исследователи представили архитектуру MXRAG (Multimodal CrossModal Explainable Retrieval-Augmented Generation). Это новая парадигма работы с тримодальными данными, объединяющая три ключевых инновации, которые работают в тандеме для обеспечения максимальной точности и надежности.

Первый компонент: Извлекатель тримодальных доказательств (TER)

Первые́й инновационный элемент — это Извлекатель тримодальных доказательств (Trimodal Evidence Retriever, TER). Этот модуль осуществляет выборку фрагментов изображений, текстовых пассажей и строк таблиц совместно, используя общее семантическое многообразие. Благодаря этому система способна находить глубинные семантические связи между разнородными типами данных, создавая целостное доказательственное пространство для формирования ответа.

Второй компонент: Сеть кросс-модальной атрибуции (CMAN)

Второй критически важный элемент — это Сеть кросс-модальной атрибуции (CrossModal Attribution Network, CMAN). Эта нейросетевая архитектура вычисляет тонко детализированные оценки атрибуции на уровне токенов непосредственно в процессе генерации. CMAN сопоставляет каждый сгенерированный токен с поддерживающими доказательствами из всех трех модальностей. Обучение CMAN осуществляется с использованием новых функций потерь — кросс-модальной атрибуции и модальной когерентности — на основе токенных золотых аннотаций.

Третий компонент: Стратегия кодирования с учетом галлюцинаций и ограничениями (HACD)

Третий элемент — это Стратегия кодирования с учетом галлюцинаций и ограничениями (HallucinationAware Constrained Decoding, HACD). Эта инновационная стратегия штрафует шаги генерации, у которых энтропия атрибуции превышает откалиброванный порог. Таким образом, HACD подавляет неподдерживаемые фактические токены непосредственно во время вывода (инференса). В отличие от CMAN, HACD не требует дополнительного обучения и калибруется для каждого набора данных на основе валидационной выборки.

Набор данных MMTabQA и бенчмарки для оценки

Для проверки эффективности предложенной архитектуры исследователи представили новый бенчмарк для тримодального визуального вопросно-ответного анализа — MMTabQA (Multimodal Table Question Answering). Этот набор данных был получен на основе существующих ресурсов WikiTableQuestions и MSCOCO и содержит 12 847 экземпляров с токенными метками атрибуции, что делает его уникальным стандартом для оценки объяснимости ИИ.

Оценка архитектуры MXRAG проводилась на четырех основных бенчмарках: MMTabQA, WebSRC, ChartQA и MIMIC-CXR-VQA. Результаты экспериментов продемонстрировали революционное улучшение характеристик системы по сравнению с лучшими существующими моделями мультимодальной генерации с дополненной выборкой:

  • Точность по критерию точного совпадения (Exact Match accuracy) увеличилась на +21,4 процентных пункта (p.p.).
  • Относительное сокращение уровня галлюцинаций составило −38,6% (или −12,1 абсолютных процентных пункта).
  • Оценка модальной когерентности (Modality coherence score) достигла отметки в 89,4%.

Вклад отдельных компонентов

Проведенные абляционные эксперименты подтвердили значительный вклад каждого из трех элементов архитектуры. Наибольший прирост точности (+14,2%) обеспечила сеть кросс-модальной атрибуции (CMAN), в то время как стратегия кодирования с ограничениями (HACD) обеспечила наибольшее сокращение галлюцинаций (−23,1%).

Человеческая оценка и достоверность метрик

Помимо автоматических тестов, исследователи провели дополнительную гуманитарную экспертизу на 200 экземплярах. Целью было проверить, насколько хорошо алгоритмическая метрика на основе энтропии отслеживает суждения человеческих экспертов. Результаты показали высокую корреляцию: уровень галлюцинаций, оцененный людьми (human-judged HR), составил 21,3%, тогда как метрический уровень (metric HR) — 19,1%. Это свидетельствует о том, что математические модели успешно имитируют человеческое восприятие недостоверной информации.

Значение для развития объяснимого искусственного интеллекта

Предложенная рамка MXRAG представляет собой важнейший шаг вперед в развитии надежного, интерпретируемого и основанного на доказательствах мультимодального искусственного интеллекта. Возможность отслеживать, на каком именно фрагменте изображения, тексте или ячейке таблицы базируется каждое слово модели, кардинально меняет подход к верификации данных.

В контексте когнитивных наук и психики человека, где критически важно понимать механизмы формирования ложных воспоминаний и убеждений (галлюцинаций), создание систем, способных самоочищаться от дезинформации, имеет глубокое значение. Обеспивая прозрачность процессов принятия решений, MXRAG не только повышает технические характеристики нейросетей, но и приближает их к человеческим стандартам логики и правды. Модели, которые могут объяснить свой вывод, вызывают большее доверие и снижают психологическое напряжение, связанное с использованием черных ящиков (black box) в повседневной жизни.

Таким образом, интеграция тримодального извлечения данных, тонкой атрибуции и ограниченного декодирования открывает новую эру для генерации с дополненной выборкой. Эти технологии лежат в основе будущего безопасного взаимодействия человека и машины, где каждый факт подкреплен неопровержимым доказательством.

Короткие версии статей можно найти в телеграм-канале.

Посмотреть канал
Кликните еще раз для перехода

Акридерм ГК крем 30 г — противовоспалительный и антимикробны...

Акридерм ГК крем — комбинированное средство для наружного применения с противовоспалительным, антиба...

Акридерм ГК крем 30 г — противовоспалительный и антимикробный

Эфирное масло имбиря Стикс 10 мл - тоник и афродизиак

Эфирное масло имбиря Стикс 10 мл из Шри-Ланки. Натуральный тонизирующий афродизиак с противовоспалит...

Эфирное масло имбиря Стикс 10 мл - тоник и афродизиак

Доппельгерц Актив Коэнзим Q10 — поддержка энергии и сердца, ...

Доппельгерц Актив Коэнзим Q10 в капсулах №30 способствует поддержанию здоровья сердца и энергетическ...

Доппельгерц Актив Коэнзим Q10 — поддержка энергии и сердца, 30 капсул

Компрессионные гольфы Relaxsan BASIC 140 den 1 класс

Компрессионные гольфы Relaxsan BASIC 140 den с давлением 18-22 мм рт. ст. (1 класс компрессии) реком...

Компрессионные гольфы Relaxsan BASIC 140 den 1 класс

Canpol Babies Одноразовые трусики L/XL №5 для мам

Одноразовые трусики Canpol Babies для мам размер L/XL обеспечивают комфорт и гигиену в послеродовой ...

Canpol Babies Одноразовые трусики L/XL №5 для мам

Веледа Цитрус Дезодорант шариковый 24ч 50 мл – свежесть на в...

Веледа Цитрус Дезодорант шариковый 24ч 50 мл эффективно освежает кожу, дарит ощущение чистоты и лёгк...

Веледа Цитрус Дезодорант шариковый 24ч 50 мл – свежесть на весь день