Новости IT-индустрии

Ярмарка бенчмарков ИИ: можно ли им доверять?

6 августа 2026 г.Diego Herrera2 мин

Бенчмарки для генеративного искусственного интеллекта широко используются компаниями, но всегда ли они информативны? Да, но только при условии, что известны все детали и условия тестирования, которые редко раскрываются. Поэтому к ним стоит относиться с осторожностью.

Модели генеративного ИИ появляются с поразительной скоростью, и каждая новая версия сопровождается множеством цифр и бенчмарков, призванных продемонстрировать ее превосходство над предшественниками и конкурентами. Но насколько надежны эти данные?

Чтобы ответить на этот вопрос, мы изучили более десятка пресс-релизов и публикаций в блогах от OpenAI и Anthropic – двух ведущих коммерческих LLM разработчиков (ChatGPT и Claude). Мы также проанализировали анонсы Moonshot IA (Kimi K3) и Qwen (3.8-Max), а также результаты тестов от Artificial Analysis, независимой компании, специализирующейся на бенчмарках генеративного ИИ.

Мы уже рассказывали о том, как данные могут существенно влиять на результаты, но это не единственная проблема. Даже при использовании одних и тех же бенчмарков и данных (иногда «скрытых») оценки могут сильно различаться в зависимости от того, кто и как проводит измерения.

  • Рассуждения генеративного ИИ: бенчмарки вводят нас в заблуждение

SWE-bench Pro: Внимание к наборам данных

Начнем с широко используемого бенчмарка SWE-bench Pro. Разработанный Scale AI, он, по заявлению компании, «обеспечивает строгую и реалистичную оценку агентов ИИ для разработки программного обеспечения». Является ли SWE-bench Pro просто «профессиональной» версией SWE-bench? И да, и нет; на самом деле это не одно и то же.

SWE-bench был запущен в 2023 году исследователями из Принстона и Стэнфорда. SWE-bench Pro появился в 2025 году благодаря компании Scale AI. Важно не путать эти две версии, даже если «Pro» позиционируется как преемник: «SWE-Bench Pro продолжает там, где остановился SWE-Bench Verified, предлагая более разнообразные задачи, повышенную сложность и код, который модели еще не видели».

В SWE-bench Pro существует несколько различных типов тестов, отличающихся используемыми данными. Таким образом, говорить просто «SWE-bench Pro» не имеет смысла, хотя именно так его часто используют в качестве эталона.

  • Public Set: 731 задача и 11 репозиториев
  • Held-out Set: 858 задач и 12 репозиториев
  • Commercial или Private Set: 276 задач и 18 репозиториев

Наиболее часто используются Public и Private наборы. Первый имеет как преимущество, так и недостаток в своей публичности: любой может его использовать, данные свободно доступны, что позволяет проводить оптимизацию моделей (как намеренно, так и случайно).

С Private набором модели сталкиваются с ранее невиданными данными (теоретически). Тесты на Public Set можно сравнить с архивными заданиями, в то время как итоговый экзамен — это Private Set. Held-Out, в свою очередь, похож на внезапный антидопинговый контроль, проводимый Scale AI.

SWE-bench Pro: Значительные расхождения в зависимости от условий и параметров