«Последний экзамен человечества»: как новый тест оценивает интеллект ИИ

«Последний экзамен человечества»: как новый тест оценивает интеллект ИИ
TheDigitalArtist/Pixabay
TheDigitalArtist/Pixabay
Thumbnail 1
Оригинал исследования на сайте автора

Революция в оценке возможностей искусственного интеллекта

Искусственный интеллект (ИИ) развивается со стремительной скоростью, зачастую обгоняя традиционные методы оценки его способностей. Согласно новому рецензируемому исследованию, опубликованному в журнале Nature, ученые создали инновационный инструмент для тестирования — «Последний экзамен человечества» (от англ. Humanity’s Last Exam, сокращенно HLE). Этот комплексный междисциплинарный бенчмарк (тест для сравнения производительности) включает в себя 2500 академических вопросов экспертного уровня, охватывающих самые разные научные дисциплины.

Международная группа экспертов, состоящая из специалистов из 50 стран и представляющая более 500 институтов, объединилась, чтобы создать этот инструмент, способный адекватно измерить интеллект современных LLM (Large Language Models — больших языковых моделей, систем машинного обучения, обученных на огромных массивах текстовых данных).

Кто стоит за созданием проекта?

Исследование было поддержано двумя крупными организациями из Сан-Франциско: Center for AI Safety (Центр безопасности ИИ) и Scale AI. Center for AI Safety (CAIS) — это некоммерческая организация, основанная в 2022 году. Ее миссия заключается в снижении рисков, связанных с ИИ, через развитие исследований в области его безопасности и адвокацию ответственного подхода к технологиям. Scale AI — компания, специализирующаяся на инфраструктуре ИИ и маркировке данных, основанная в 2016 году Александром Вангом и Люси Го.

«Бенчмарки — это важнейшие инструменты для отслеживания быстрого прогресса в возможностях больших языковых моделей», — отмечают соавторы исследования Дэн Хендрикс и Лонг Фан.

Почему старые тесты больше не работают?

Авторы подчеркивают серьезную проблему: существующие тесты катастрофически устаревают. Современные LLM теперь показывают точность более 90% в популярных бенчмарках, таких как MMLU (Measuring Massive Multitask Language Understanding — измерение понимания языка через масштабные многозадачные тесты). Это лишает исследователей возможности объективно оценивать самые мощные современные системы, так как те «знают ответы наизусть».

Безопасность ИИ сегодня является первоочередной задачей. Согласно опросу Gallup 2025 года, 80% взрослых американцев поддерживают государственное регулирование ИИ, даже если это замедлит темпы инноваций.

Структура и сложность «Последнего экзамена»

Экзамен охватывает более 100 предметов. Распределение категорий выглядит следующим образом:

  • Математика: 41%
  • Биология и медицина: 11%
  • Компьютерные науки и ИИ: 10%
  • Физика: 9%
  • Гуманитарные и социальные науки: 9%
  • Химия: 7%
  • Инженерное дело: 4%
  • Другие дисциплины: 9%

Вопросы теста предполагают как выбор ответа, так и краткий комментарий. Каждое решение четко верифицируемо, однако его невозможно найти, просто воспользовавшись поисковой системой Google. Около 14% вопросов являются мультимодальными, требующими анализа изображений наряду с текстовой информацией.

Процесс фильтрации: от 70 000 до 2 500 вопросов

Чтобы создать по-настоящему сложный тест, команда проделала огромную работу. Изначально было отобрано 70 000 потенциальных вопросов. Затем они прошли через «сито» из передовых нейросетей. Если модель отвечала правильно слишком часто или, наоборот, демонстрировала случайный набор символов, вопрос отправлялся на доработку. Далее эксперты-люди со степенями магистра и выше в своих областях провели два раунда рецензирования, сократив базу до 6 000 вопросов, из которых 2 500 вошли в итоговый публичный набор данных.

Научное значение проекта

«Предоставляя четкую метрику прогресса ИИ, Humanity's Last Exam создает общую точку отсчета для ученых и политиков», — заключают исследователи. Это поможет человечеству не только следить за мощью «цифрового разума», но и вовремя выявлять риски, сохраняя контроль над технологиями, которые меняют наш мир.

Данный тест является важным этапом в понимании того, как далеко зашли технологии и где проходят границы между машинной логикой и человеческим экспертным знанием.

Короткие версии статей можно найти в телеграм-канале.

Посмотреть канал
Кликните еще раз для перехода

Формидрон раствор 50 мл — дезодорант и антисептик для кожи

Формидрон спиртовой раствор 50 мл — эффективное средство для наружного применения с дезодорирующим и...

Формидрон раствор 50 мл — дезодорант и антисептик для кожи

Аскорбиновая кислота с сахаром 25 мг 10 таблеток — вкусная п...

Аскорбиновая кислота с сахаром в таблетках 25 мг №10 — удобный способ поддержать иммунитет и восполн...

Аскорбиновая кислота с сахаром 25 мг 10 таблеток — вкусная поддержка иммунитета

Бинт Марлевый Медицинский Стерильный 7Мх14см

...

Бинт Марлевый Медицинский Стерильный 7Мх14см

Contex Lights №3 — ультратонкие презервативы для высокой чув...

Презервативы Contex Lights №3 — ультратонкие, гладкие, изготовлены из натурального латекса для макси...

Contex Lights №3 — ультратонкие презервативы для высокой чувствительности

Иглы NovoFine 31G 0,25x6 мм №100 для шприц-ручек

Иглы NovoFine 31G 0,25x6 мм №100 — тонкие и комфортные иглы для инсулиновых шприц-ручек, обеспечиваю...

Иглы NovoFine 31G 0,25x6 мм №100 для шприц-ручек

Фанни Банни Пеленка Впитывающая Детская 60х60 см №5

Фанни Банни впитывающие пеленки 60х60 см для новорожденных и детей. Мягкий гидрофильный материал сох...

Фанни Банни Пеленка Впитывающая Детская 60х60 см №5