Бенчмарки сгорели: почему тесты ИИ перестали измерять реальные способности моделей
Когда OpenAI, Google или Anthropic выпускают новую модель, пресс-релиз обязательно украшен цифрами: 92% на одном тесте, 89% на другом. Ещё три года назад эти цифры что-то значили. Сегодня — почти ничего. Классические экзамены для искусственного интеллекта «сгорели»: одни пройдены почти до предела, другие оказались вызубрены моделями ещё на этапе обучения, третьи стали объектом тихой оптимизации маркетинговых отделов. Индустрия переживает кризис измерения — и пытается придумать, как отличать реальный прогресс от красивой упаковки.
Экзамен, который все сдали на «отлично»
В 2020 году исследователи представили MMLU — тест из вопросов по 57 предметам, от права до астрофизики. Он задумывался как по-настоящему сложный: модели того времени едва превосходили случайное угадывание. Пять лет спустя фронтирные модели набирают на нём 88–92%. Казалось бы, победа? Не совсем. Когда исследователи — в том числе из самой OpenAI — разобрали оставшиеся ошибки, выяснилось, что заметная их часть приходится на дефектные вопросы: двусмысленные формулировки, неправильные «правильные» ответы, устаревшие факты. Позже появились исправленные версии — MMLU-Pro и MMLU-Redux, — но и они быстро догоняются до потолка.
Та же история повторилась повсюду. GSM8K — задачки по математике уровня начальной школы — решён практически полностью. HumanEval, стандартный тест генерации кода, тоже; при этом OpenAI признала, что часть его задач встречалась в обучающих данных GPT-4. Тест, который все сдают на максимум, перестаёт быть тестом: он не различает сильную модель от очень сильной, а разница между 90% и 93% не говорит ничего о реальном разрыве в способностях. Это явление назвали насыщением — и за 2023–2025 годы оно настигло почти весь классический набор метрик.
Модель, которая знала ответы заранее
Вторая болезнь коварнее. Бенчмарки публикуются в интернете — в статьях, репозиториях, на форумах, в решебниках. А интернет — это обучающий корпус больших языковых моделей. Вопросы теста вместе с ответами попадают в данные, и модель не решает задачу, а вспоминает её. Это называется загрязнением данных, и оно измеримо.
Самые показательные эксперименты выглядят так: берут модель и проверяют её на задачах, опубликованных до и после даты среза обучающих данных. На старых задачах — скажем, соревнования по программированию Codeforces или математические олимпиады — результаты отличные. На свежих вариантах тех же по структуре задач точность падает на 10–20 и более процентных пунктов. Разрыв между «знакомым» и «новым» — это и есть след зубрёжки. Точный масштаб проблемы в закрытых моделях неизвестен: лаборатории не раскрывают состав обучающих данных, и все оценки остаются косвенными.
Закон Гудхарта в действии
Есть и третий удар — по самой культуре измерений. «Когда метрика становится целью, она перестаёт быть хорошей метрикой», — формулировка, известная как закон Гудхарта, в индустрии ИИ работает безотказно. Публичные рейтинги — это маркетинг, поэтому модели оптимизируют под них.
Весной 2025 года это привело к громкому скандалу: на популярную площадку сравнения моделей LMArena компания Meta отправила для тестирования Llama 4 специально настроенную версию, отличную от той, что получили пользователи. Рейтинг вырос, доверие — упало. Примерно тогда же группа исследователей (включая авторов из Cohere) выпустила работу The Leaderboard Illusion, показавшую структурные проблемы арен: крупные лаборатории могут приватно тестировать множество вариантов моделей и публиковать только лучший, получая систематическое преимущество. Даже «честные» живые сравнения, оказалось, можно обыграть.
Чем измеряют теперь: четыре новые линейки
Индустрия отвечает на кризис переходом сразу на несколько новых способов оценки. Ни один не идеален, но вместе они дают более честную картину.
Живые предпочтения людей. Chatbot Arena (ныне LMArena) устраивает слепые дуэли: пользователь задаёт вопрос двум анонимным моделям и выбирает лучший ответ. Из миллионов голосов складывается Elo-рейтинг, как в шахматах. Метод живой и устойчивый к зубрёжке, но измеряет он не корректность, а предпочтение — модель, которая отвечает развёрнуто, вежливо и с уверенным тоном, может обыграть более точную, но сухую. Насколько рейтинг арены коррелирует с реальной пользой в работе — открытый вопрос.
Экзамены «последнего рубежа». Humanity's Last Exam — около трёх тысяч вопросов, составленных специалистами уровня PhD, от математики до редких языков. FrontierMath — задачи исследовательской сложности, на создание которых у математиков уходили часы и дни; долгое время модели решали меньше 2%. GPQA — вопросы, «защищённые от гугления»: даже с доступом к интернету не-специалист на них не ответит. Проблема в том, что и эти тесты насыщаются с пугающей скоростью: лучшие результаты на HLE за год выросли с единиц процентов до 25–37% у моделей с доступом к инструментам. Фронтирные системы растут быстрее, чем человечество успевает сочинять экзамены.
Работа вместо экзамена. Агентные бенчмарки проверяют не ответ на вопрос, а выполнение дела: SWE-bench Verified — реальные баги из проектов на GitHub, которые нужно починить; MLE-bench — соревнования по машинному обучению на Kaggle; OSWorld и WebArena — задачи в живой операционной системе и браузере. Это ближе к реальной пользе, но такие тесты дорогие, шумные и плохо стандартизированные: разные лаборатории дают моделям разные бюджеты, скрипты и инструменты, и сравнивать результаты между собой часто некорректно.
Линейка автономности. Пожалуй, самая интересная альтернатива пришла от организации METR. Вместо «насколько модель умна» она измеряет «как долго она может работать сама»: берутся задачи, на которые у человека уходит от минут до многих часов, и определяется длительность задач, которые модель выполняет автономно с надёжностью 50%. Эта «длина задачи» удваивается примерно каждые семь месяцев с 2019 года. Если в 2019-м модель справлялась с секундными задачами, то сейчас — с теми, что занимают у человека часы. Сохранится ли темп при переходе к задачам на недели и месяцы — одна из главных неизвестных отрасли.
Наконец, есть гигиеническое решение: свежие тесты с регулярной ротацией вопросов, вроде LiveBench и LiveCodeBench, где задачи добавляются после среза обучающих данных и утечка принципиально невозможна.
Что это значит для читателя пресс-релизов
Из всей этой истории можно вынести несколько практических правил. Во-первых, цифра на старом бенчмарке — MMLU, GSM8K, HumanEval — сегодня почти не несёт информации: там давно потолок. Во-вторых, одиночный рекорд на любом новом тесте стоит проверять на предмет условий: с какими инструментами, каким бюджетом вычислений, какой версией модели он получен. В-третьих, рейтинг арены — это мерило «приятности», а не истины. Наконец, самые содержательные сигналы сейчас дают метрики автономной работы и свежие, защищённые от утечек тесты — там модели пока не могут вызубрить ответы.
Нерешённые вопросы
Честности ради: новая система измерений тоже полна дыр. Мы не знаем реальный масштаб загрязнения в закрытых моделях — лаборатории молчат о своих данных. Мы не знаем, предсказывают ли арены продуктивность. Мы не знаем, продержится ли семимесячный ритм удвоения автономности. Нет и договорённости о единых условиях агентных тестов, без которой сравнения лабораторий остаются соревнованием в разных дисциплинах.
Более того, сама постановка задачи начинает меняться. Пока тесты измеряли знания, всё было просто: экзамен, балл, рейтинг. Но по мере того как модели превращаются из «ответчиков» в исполнителей, вопрос «насколько она умна» уступает месту вопросу «что она может сделать и насколько ей можно доверить делать это одной». Это сложнее уложить в одну цифру — и, вероятно, хорошо: одна цифра и привела нас к тому, что старые экзамены сгорели. Следующие несколько лет индустрии придётся жить без единого табло — и учиться читать прогресс по нескольким линейкам сразу, не принимая ни одну из них на веру.

