Hugging Face · 2 сентября 2026 г. · 1Cifer
Исследователи выяснили, что на самом деле измеряют бенчмарки ИИ: выбирать модель по рейтингу — плохая идея
Исследователи Allen Institute представили BenchMIRT — методику, которая разбирает, что на самом деле измеряют популярные бенчмарки языковых моделей. Вывод отрезвляет: большинство тестов оценивают смесь разных способностей сразу, поэтому итоговый балл — это «средняя температура», за которой могут скрываться и сильные, и провальные стороны модели.
Для рынка, где новые модели выходят каждую неделю и каждая «обгоняет конкурентов в бенчмарках», это важная прививка от маркетинга. Модель, блестяще решающая олимпиадные задачи, может путаться в извлечении данных из накладной — и наоборот.
Практический вывод для компании, выбирающей ИИ-инструменты: соберите собственный мини-бенчмарк из двух десятков реальных примеров вашей работы — типичные письма, документы, вопросы клиентов — и прогоняйте через него каждого кандидата. Полчаса такой проверки скажут о пригодности модели больше, чем любая таблица лидеров. А смена модели под инструментом не должна ломать процессы — это критерий зрелости самого инструмента.


