MXRAG: Инновационная рамка для устранения галлюцинаций в мультимодальном искусственном интеллекте

В статье представлена инновационная архитектура MXRAG, предназначенная для устранения галлюцинаций при одновременной обработке изображений, текста и таблиц. Рассматрив...

Материал носит информационный характер и не заменяет консультацию психолога или врача.

MXRAG: Инновационная рамка для устранения галлюцинаций в мультимодальном искусственном интеллекте

По теме

Психологическая сила затмения: как солнечные затмения влияют...

В этой статье рассматривается глубокое психологическое воздействие солнечных затмений на человеческу...

Осознанность и творческая самоэффективность в принятии решен...

Исследование на выборке из 549 британских специалистов изучает, как черты осознанности, творческая с...

Послеродовой психоз и уголовная ответственность: Правовые ас...

Подробный анализ дела Линдси Клэнси и его правовых последствий в контексте послеродового психоза. Ст...

Ментальное здоровье после пандемии COVID-19: итоги Global Mi...

Аналитический обзор отчёта Global Mind Project 2023: как пандемия COVID-19 повлияла на глобальное пс...

Как слишком подробная обратная связь от роботов перегружает ...

Новое исследование показывает, что слишком подробная и персонализированная обратная связь от роботов...

4 неожиданные угрозы искусственного интеллекта для человечес...

Новые исследования показывают, что даже простые чат-боты на основе искусственного интеллекта способн...

Оригинал исследования на сайте автора

Введение в мультимодальный искусственный интеллект и проблема галлюцинаций

Искусственный интеллект стремительно развивается, и на переднем крае этой революции находятся много модальные большие языковые модели (MLLMs). Эти сложные системы способны обрабатывать и анализировать различные типы данных одновременно, включая естественные изображения, свободный текст и структурированные таблицы. Однако, несмотря на впечатляющие результаты в задачах визуального вопросно-ответного анализа (VQA) и мультимодальных рассуждений, существует упорно не решаемая проблема: галлюцинации.

Галлюцинации в нейросетях возникают тогда, когда модель генерирует контент, который не имеет отношения к предоставленным входным данным или прямо противоречит им. Особенно опасны тримодальные галлюцинации, которые происходят, когда ответ требует одновременного синтеза доказательств из изображений, текста и таблиц. В таких случаях современные модели часто выдают информацию, не атрибутированную ни к одной из модальностей, что подрывает доверие к искусственному интеллекту.

Существующие подходы и их ограничения

Предыдущие методы борьбы с галлюцинациями в основном фокусировались на парах «изображение-текст». Кроме того, существующие системы генерации с дополненной выборкой (RAG) для мультимодальных сред не всегда включают поддерживающие доказательства и часто лишены атрибутируемой объяснимости. Это означает, что пользователь не может проследить, на каком именно фрагменте изображения или строке таблицы основан ответ нейросети.

Достоверность и интерпретируемость являются фундаментальными требованиями для внедрения искусственного интеллекта в критически важные области, такие как медицина и научные исследования.

Архитектура MXRAG: трехкомпонентное решение тримодальной проблемы

Для решения этой проблемы исследователи представили архитектуру MXRAG (Multimodal CrossModal Explainable Retrieval-Augmented Generation). Это новая парадигма работы с тримодальными данными, объединяющая три ключевых инновации, которые работают в тандеме для обеспечения максимальной точности и надежности.

Первый компонент: Извлекатель тримодальных доказательств (TER)

Первые́й инновационный элемент — это Извлекатель тримодальных доказательств (Trimodal Evidence Retriever, TER). Этот модуль осуществляет выборку фрагментов изображений, текстовых пассажей и строк таблиц совместно, используя общее семантическое многообразие. Благодаря этому система способна находить глубинные семантические связи между разнородными типами данных, создавая целостное доказательственное пространство для формирования ответа.

Второй компонент: Сеть кросс-модальной атрибуции (CMAN)

Второй критически важный элемент — это Сеть кросс-модальной атрибуции (CrossModal Attribution Network, CMAN). Эта нейросетевая архитектура вычисляет тонко детализированные оценки атрибуции на уровне токенов непосредственно в процессе генерации. CMAN сопоставляет каждый сгенерированный токен с поддерживающими доказательствами из всех трех модальностей. Обучение CMAN осуществляется с использованием новых функций потерь — кросс-модальной атрибуции и модальной когерентности — на основе токенных золотых аннотаций.

Третий компонент: Стратегия кодирования с учетом галлюцинаций и ограничениями (HACD)

Третий элемент — это Стратегия кодирования с учетом галлюцинаций и ограничениями (HallucinationAware Constrained Decoding, HACD). Эта инновационная стратегия штрафует шаги генерации, у которых энтропия атрибуции превышает откалиброванный порог. Таким образом, HACD подавляет неподдерживаемые фактические токены непосредственно во время вывода (инференса). В отличие от CMAN, HACD не требует дополнительного обучения и калибруется для каждого набора данных на основе валидационной выборки.

Набор данных MMTabQA и бенчмарки для оценки

Для проверки эффективности предложенной архитектуры исследователи представили новый бенчмарк для тримодального визуального вопросно-ответного анализа — MMTabQA (Multimodal Table Question Answering). Этот набор данных был получен на основе существующих ресурсов WikiTableQuestions и MSCOCO и содержит 12 847 экземпляров с токенными метками атрибуции, что делает его уникальным стандартом для оценки объяснимости ИИ.

Оценка архитектуры MXRAG проводилась на четырех основных бенчмарках: MMTabQA, WebSRC, ChartQA и MIMIC-CXR-VQA. Результаты экспериментов продемонстрировали революционное улучшение характеристик системы по сравнению с лучшими существующими моделями мультимодальной генерации с дополненной выборкой:

  • Точность по критерию точного совпадения (Exact Match accuracy) увеличилась на +21,4 процентных пункта (p.p.).
  • Относительное сокращение уровня галлюцинаций составило −38,6% (или −12,1 абсолютных процентных пункта).
  • Оценка модальной когерентности (Modality coherence score) достигла отметки в 89,4%.

Вклад отдельных компонентов

Проведенные абляционные эксперименты подтвердили значительный вклад каждого из трех элементов архитектуры. Наибольший прирост точности (+14,2%) обеспечила сеть кросс-модальной атрибуции (CMAN), в то время как стратегия кодирования с ограничениями (HACD) обеспечила наибольшее сокращение галлюцинаций (−23,1%).

Человеческая оценка и достоверность метрик

Помимо автоматических тестов, исследователи провели дополнительную гуманитарную экспертизу на 200 экземплярах. Целью было проверить, насколько хорошо алгоритмическая метрика на основе энтропии отслеживает суждения человеческих экспертов. Результаты показали высокую корреляцию: уровень галлюцинаций, оцененный людьми (human-judged HR), составил 21,3%, тогда как метрический уровень (metric HR) — 19,1%. Это свидетельствует о том, что математические модели успешно имитируют человеческое восприятие недостоверной информации.

Значение для развития объяснимого искусственного интеллекта

Предложенная рамка MXRAG представляет собой важнейший шаг вперед в развитии надежного, интерпретируемого и основанного на доказательствах мультимодального искусственного интеллекта. Возможность отслеживать, на каком именно фрагменте изображения, тексте или ячейке таблицы базируется каждое слово модели, кардинально меняет подход к верификации данных.

В контексте когнитивных наук и психики человека, где критически важно понимать механизмы формирования ложных воспоминаний и убеждений (галлюцинаций), создание систем, способных самоочищаться от дезинформации, имеет глубокое значение. Обеспивая прозрачность процессов принятия решений, MXRAG не только повышает технические характеристики нейросетей, но и приближает их к человеческим стандартам логики и правды. Модели, которые могут объяснить свой вывод, вызывают большее доверие и снижают психологическое напряжение, связанное с использованием черных ящиков (black box) в повседневной жизни.

Таким образом, интеграция тримодального извлечения данных, тонкой атрибуции и ограниченного декодирования открывает новую эру для генерации с дополненной выборкой. Эти технологии лежат в основе будущего безопасного взаимодействия человека и машины, где каждый факт подкреплен неопровержимым доказательством.

Короткие версии статей можно найти в телеграм-канале.

Посмотреть канал
Кликните еще раз для перехода

Брал таблетки 500 мг №20 — обезболивающее и спазмолитик

Брал — комбинированный препарат для снятия боли и спазмов. Содержит метамизол натрия (обезболивающее...

Брал таблетки 500 мг №20 — обезболивающее и спазмолитик

Табекс 1,5 мг №100 – эффективная помощь при отказе от курени...

Табекс 1,5 мг №100 – средство для поэтапного отказа от курения. Активный компонент цитизин мягко бло...

Табекс 1,5 мг №100 – эффективная помощь при отказе от курения

Очищающий пенящийся крем Урьяж Беби для новорожденных 500 мл

Урьяж Беби Первый Крем Очищающий Пенящийся для детей с первых дней жизни. Бережно очищает кожу новор...

Очищающий пенящийся крем Урьяж Беби для новорожденных 500 мл

Офтальмоферон глазные капли 10 мл – защита и восстановление ...

Офтальмоферон глазные капли 10 мл применяются при вирусных и бактериальных поражениях глаз — конъюнк...

Офтальмоферон глазные капли 10 мл – защита и восстановление глаз

Гилан Ультра Комфорт капли глазные 0,3% 10 шт - увлажнение п...

Глазные капли Гилан Ультра Комфорт 0,3% — современное средство для борьбы с синдромом сухого глаза. ...

Гилан Ультра Комфорт капли глазные 0,3% 10 шт - увлажнение при сухости

Салицинк Лосьон Сера-Цинк 100 мл для очищения кожи

Салицинк лосьон для всех типов кожи — эффективное средство с серой и цинком для очищения и ухода. Сп...

Салицинк Лосьон Сера-Цинк 100 мл для очищения кожи