«Последний экзамен человечества»: как новый тест оценивает интеллект ИИ

Узнайте о революционном инструменте Humanity's Last Exam, который помогает экспертам измерять возможности современных нейросетей, превосходящих старые стандарты тестир...

Материал носит информационный характер и не заменяет консультацию психолога или врача.

«Последний экзамен человечества»: как новый тест оценивает интеллект ИИ

По теме

Пять нейробиологических подтипов депрессии: как МЭГ революци...

Исследователи из Хельсинкского университета с помощью магнитоэнцефалографии (МЭГ) выявили пять нейро...

Как ранний стресс изменяет мозг: эпигенетические механизмы в...

Ученые выяснили, как ранний стресс оставляет физический след в мозге, меняя структуру ДНК и повышая ...

Компульсивное сексуальное поведение: признаки, причины и пси...

Подробный разбор компульсивного сексуального поведения: чем оно отличается от высокой половой активн...

Экотревожность и климатический стресс: методы оценки и эффек...

Комплексное научное исследование и приоритизация факторов экологической тревожности и стратегий их п...

Финансовая грамотность и риски, связанные с азартными играми...

Научное исследование изучает связь между уровнем финансовой грамотности и рисками, связанными с азар...

Качество жизни при сахарном диабете 2 типа: ключевые факторы...

Исследование показало, что у пациентов с Т2ДМ качество жизни положительно связано с принятием и восп...

TheDigitalArtist/Pixabay
TheDigitalArtist/Pixabay
Thumbnail 1
Оригинал исследования на сайте автора

Революция в оценке возможностей искусственного интеллекта

Искусственный интеллект (ИИ) развивается со стремительной скоростью, зачастую обгоняя традиционные методы оценки его способностей. Согласно новому рецензируемому исследованию, опубликованному в журнале Nature, ученые создали инновационный инструмент для тестирования — «Последний экзамен человечества» (от англ. Humanity’s Last Exam, сокращенно HLE). Этот комплексный междисциплинарный бенчмарк (тест для сравнения производительности) включает в себя 2500 академических вопросов экспертного уровня, охватывающих самые разные научные дисциплины.

Международная группа экспертов, состоящая из специалистов из 50 стран и представляющая более 500 институтов, объединилась, чтобы создать этот инструмент, способный адекватно измерить интеллект современных LLM (Large Language Models — больших языковых моделей, систем машинного обучения, обученных на огромных массивах текстовых данных).

Кто стоит за созданием проекта?

Исследование было поддержано двумя крупными организациями из Сан-Франциско: Center for AI Safety (Центр безопасности ИИ) и Scale AI. Center for AI Safety (CAIS) — это некоммерческая организация, основанная в 2022 году. Ее миссия заключается в снижении рисков, связанных с ИИ, через развитие исследований в области его безопасности и адвокацию ответственного подхода к технологиям. Scale AI — компания, специализирующаяся на инфраструктуре ИИ и маркировке данных, основанная в 2016 году Александром Вангом и Люси Го.

«Бенчмарки — это важнейшие инструменты для отслеживания быстрого прогресса в возможностях больших языковых моделей», — отмечают соавторы исследования Дэн Хендрикс и Лонг Фан.

Почему старые тесты больше не работают?

Авторы подчеркивают серьезную проблему: существующие тесты катастрофически устаревают. Современные LLM теперь показывают точность более 90% в популярных бенчмарках, таких как MMLU (Measuring Massive Multitask Language Understanding — измерение понимания языка через масштабные многозадачные тесты). Это лишает исследователей возможности объективно оценивать самые мощные современные системы, так как те «знают ответы наизусть».

Безопасность ИИ сегодня является первоочередной задачей. Согласно опросу Gallup 2025 года, 80% взрослых американцев поддерживают государственное регулирование ИИ, даже если это замедлит темпы инноваций.

Структура и сложность «Последнего экзамена»

Экзамен охватывает более 100 предметов. Распределение категорий выглядит следующим образом:

  • Математика: 41%
  • Биология и медицина: 11%
  • Компьютерные науки и ИИ: 10%
  • Физика: 9%
  • Гуманитарные и социальные науки: 9%
  • Химия: 7%
  • Инженерное дело: 4%
  • Другие дисциплины: 9%

Вопросы теста предполагают как выбор ответа, так и краткий комментарий. Каждое решение четко верифицируемо, однако его невозможно найти, просто воспользовавшись поисковой системой Google. Около 14% вопросов являются мультимодальными, требующими анализа изображений наряду с текстовой информацией.

Процесс фильтрации: от 70 000 до 2 500 вопросов

Чтобы создать по-настоящему сложный тест, команда проделала огромную работу. Изначально было отобрано 70 000 потенциальных вопросов. Затем они прошли через «сито» из передовых нейросетей. Если модель отвечала правильно слишком часто или, наоборот, демонстрировала случайный набор символов, вопрос отправлялся на доработку. Далее эксперты-люди со степенями магистра и выше в своих областях провели два раунда рецензирования, сократив базу до 6 000 вопросов, из которых 2 500 вошли в итоговый публичный набор данных.

Научное значение проекта

«Предоставляя четкую метрику прогресса ИИ, Humanity's Last Exam создает общую точку отсчета для ученых и политиков», — заключают исследователи. Это поможет человечеству не только следить за мощью «цифрового разума», но и вовремя выявлять риски, сохраняя контроль над технологиями, которые меняют наш мир.

Данный тест является важным этапом в понимании того, как далеко зашли технологии и где проходят границы между машинной логикой и человеческим экспертным знанием.

Короткие версии статей можно найти в телеграм-канале.

Посмотреть канал
Кликните еще раз для перехода

Валидол 60 мг №20 — успокаивающее при сердечном дискомфорте

Валидол 60 мг — седативное средство при функциональной кардиалгии и неврозах. Эффективно снимает дис...

Валидол 60 мг №20 — успокаивающее при сердечном дискомфорте

Йод-Актив Таб N200 – добавка с йодом для щитовидной железы

Йод-Актив Таб N200 – биологически активная добавка для восполнения дефицита йода в организме. Подход...

Йод-Актив Таб N200 – добавка с йодом для щитовидной железы

Прокладки Белла Перфекта Ультра Макси Блю Экстра Софт N8 – з...

Прокладки Белла Перфекта Ультра Макси Блю Экстра Софт обеспечивают надежную защиту и комфорт даже в ...

Прокладки Белла Перфекта Ультра Макси Блю Экстра Софт N8 – защита и комфорт

Pl Бальзам для губ Фруктовый Микс – защита и питание

Бальзам для губ Pl Фруктовый Микс 3,8 г мягко ухаживает за кожей губ, защищая их от сухости и трещин...

Pl Бальзам для губ Фруктовый Микс – защита и питание

Топикрем Шампунь мягкий pH5 для чувствительной кожи головы, ...

Топикрем Шампунь мягкий pH5 — гипоаллергенное средство для ежедневного ухода за волосами и чувствите...

Топикрем Шампунь мягкий pH5 для чувствительной кожи головы, 500 мл

Карнитон таблетки №20 — нормализация обмена веществ

Карнитон — витамин группы В, производное аминокислоты, незаменимый кофактор метаболизма жирных кисло...

Карнитон таблетки №20 — нормализация обмена веществ