
Тесты нейросетей простыми словами, что означают все эти цифры в рейтингах
Каждый анонс новой нейросети завален непонятными названиями тестов и процентами, из которых сложно понять, подойдёт-ли модель именно тебе. Разбираем простыми словами, что проверяет каждый популярный тест и кто лидирует по ним в 2026 году.
Зачем вообще нужны бенчмарки нейросетей
Открываешь анонс новой модели, а там сплошные аббревиатуры и проценты. SWE-Bench 78,2, GPQA Diamond 94,1, ARC-AGI-2 92,5. Понять из этого, будет ли модель полезна лично тебе, почти невозможно, и это нормально, потому что каждый тест проверяет что-то своё.
Бенчмарк, это просто набор задач с заранее известными правильными ответами. Модели дают эти задачи, считают, сколько она решила верно, и переводят результат в процент или в баллы. Смысл в том, чтобы сравнивать разные модели по одинаковым правилам, а не по ощущениям.
Проблема в том, что тестов стало слишком много, и каждая компания в своём анонсе показывает лишь те, где её модель выглядит лучше. Поэтому разберём главные из них по группам, чтобы ты сам понимал, на что смотреть.
Тесты на программирование, SWE-Bench, FrontierSWE и Terminal-Bench
Начнём с программирования, потому что именно этих тестов больше всего в анонсах.
SWE-Bench Verified, это набор из 500 реальных задач, взятых из открытых проектов на GitHub. Модель получает описание ошибки и должна сама её исправить так, чтобы прошли проверочные тесты. Задачи проверены людьми, поэтому результату можно доверять. Правда, тест почти исчерпал себя, за один год результаты выросли примерно с 60 процентов почти до 100, поэтому топовые модели там уже почти не отличаются друг от друга.
FrontierSWE появился как раз потому, что старые тесты стали слишком лёгкими. Задачи здесь отражают крайне сложные и открытые технические проблемы, требующие новых идей и большого объёма планирования, такие, что бросят вызов лучшим инженерам мира. В первом выпуске 17 задач по трём направлениям, реализация, оптимизация производительности и исследования в машинном обучении. Модели дают до 20 часов на задачу и пять попыток. Вместо простого процента здесь считают показатель доминирования, то есть насколько часто модель обходит случайного соперника. Сейчас впереди Claude Fable 5 с результатом 86,6, за ним идёт Kimi K3 с 81,2.
Источник: Wikipedia Contracollective

Terminal-Bench проверяет работу в командной строке, то есть умение модели управлять компьютером текстовыми командами. В версии 2.1 это 89 отобранных задач по разработке, системному администрированию, обработке данных, обучению моделей и безопасности. Лидеры здесь идут очень плотно, в районе 88 процентов, на одном из публичных рейтингов первое место занимает Claude Mythos 5 с 88 процентами, а по данным Moonshot AI близкие результаты показывают GPT-5.6 Sol и Kimi K3.
Источник: Artificial Analysis,BenchLM
Простой вывод для выбора модели, смотри на тот тест, который ближе к твоей работе. Правишь баги в готовом проекте, смотри SWE-Bench. Нужны долгие сложные задачи, смотри FrontierSWE. Работаешь через терминал, смотри Terminal-Bench.
Тесты на знания и мышление, GPQA Diamond, HLE и ARC-AGI
Вторая большая группа проверяет, насколько модель умна сама по себе, без привязки к коду.
GPQA Diamond, это 198 вопросов уровня аспирантуры по биологии, химии и физике, составленных экспертами. Вопросы специально сделаны «защищёнными от поиска», то есть человек без профильного образования, но с интернетом, отвечает верно примерно в 34 процентах случаев, а специалисты с научной степенью в районе 65-70 процентов. Сейчас тест почти исчерпан, лидеры показывают 94,1 процента, среди них Gemini 3.1 Pro и GPT-5.6 Sol.
Источник: Digital Applied Team Wikipedia
Humanity's Last Exam, дословно «Последний экзамен человечества», это 2500 вопросов по самым разным дисциплинам, созданных совместно Center for AI Safety и Scale AI. Вопросы обычно требуют экспертных знаний уровня аспирантуры или касаются крайне узких тем. Тест намеренно очень тяжёлый, поэтому результаты низкие, и именно поэтому он хорошо разделяет топовые модели. По состоянию на 8 августа 2026 года впереди Claude Fable 5 с 55,5 процента, следом Claude Opus 5 с 54,9 и GPT-5.6 Sol с 49,5.
Источник LLM Leaderboard AIToolTier
ARC-AGI-2 устроен иначе. Это визуальные головоломки из клеток, где модель должна сама вывести скрытое правило по паре примеров и применить его к новому заданию. Тест считается самым сложным публичным тестом на рассуждение, средний человек решает около 66 процентов. Смысл в том, что готовый ответ нельзя вспомнить из обучающих данных, его надо вывести. На начало августа 2026 года лидирует GPT-5.6 Sol с 92,5 процента, за ним Claude Opus 5 с 90,4.
Источник: Local AI MasterLocal AI Master

Если коротко, GPQA показывает багаж знаний, HLE проверяет глубину экспертизы на пределе, а ARC-AGI, способность соображать в незнакомой ситуации. Это три разные вещи, и модель может быть сильна в одном и слаба в другом.
Тесты на ИИ-агентов, GDPval, BrowseComp, OSWorld и MCP Atlas
Третья группа стала самой важной в 2026 году, потому что нейросети всё чаще работают не в чате, а самостоятельно, обращаясь к другим программам.
GDPval-AA v2 проверяет реальную профессиональную работу. Модели дают задачи из 44 профессий и 9 крупных отраслей, доступ к командной строке и интернету, а оценку выводят через слепое парное сравнение по рейтингу Эло, то есть как в шахматах, где очки набираются за победы над сильными соперниками. Лидеры сейчас, Claude Fable 5 с 1760 очками и GPT-5.6 Sol с 1748.
Источник: Artificial Analysis

BrowseComp измеряет умение искать и сопоставлять информацию в интернете. Лучший публичный результат у GPT-5.6 Sol, 92,2 процента.
OSWorld проверяет управление обычным компьютером, окнами, меню, файлами и браузером. Тут есть важная тонкость, под этим названием сейчас живут два несравнимых теста, OSWorld-Verified с 369 задачами и OSWorld 2.0 со 108 более длинными задачами, поэтому проценты из разных анонсов часто нельзя ставить рядом.
MCP Atlas проверяет, насколько надёжно модель вызывает внешние инструменты в многошаговых сценариях. Именно этот тест показывает, будет ли ИИ-агент стабильно работать в связке с твоими сервисами, а не ломаться на третьем шаге.
Вот тут кроется главный практический совет. Если ты собираешься использовать нейросеть как помощника, который сам ходит по сервисам и выполняет цепочки задач, смотри именно на эту группу тестов, а не на красивые проценты по знаниям.
Сводные рейтинги, Artificial Analysis Index и Arena
Отдельно стоит сказать про два рейтинга, которые объединяют всё сразу.
Artificial Analysis Intelligence Index, это сводная оценка, которая считается как взвешенное среднее из нескольких тестов по шкале от 0 до 100. Четыре категории дают по 25 процентов каждая, агентная работа, программирование, общие способности и научные рассуждения. В набор входят GDPval-AA v2, Terminal-Bench 2.1, SciCode, Humanity's Last Exam, GPQA Diamond и другие. Сейчас первое место занимает Claude Opus 5 с результатом 63.
Arena, бывшая LMArena и Chatbot Arena, устроена принципиально иначе. Здесь рейтинг строится на голосах живых людей, которые вслепую сравнивают ответы двух моделей и выбирают лучший. Это субъективная оценка, зато она показывает то, что не видно в цифрах, насколько приятно моделью пользоваться. В августе 2026 года на первом месте Claude Fable 5 с рейтингом около 1525 очков.
Обе оценки полезны, но по-разному. Artificial Analysis даёт воспроизводимые технические измерения, а Arena отражает реальный пользовательский опыт.
Как читать бенчмарки и не обмануться
Несколько правил, которые стоит держать в голове, когда смотришь на любой анонс.
Один и тот же тест бывает в разных версиях, и проценты из них нельзя сравнивать напрямую
Результат зависит не только от модели, но и от того, через какой инструмент её запускали, одна и та же модель может показать разный балл
Компании публикуют собственные замеры, а независимые рейтинги часто дают другие цифры, стоит смотреть оба источника
Многие старые тесты уже исчерпаны, если все лидеры набирают 90 с лишним процентов, тест перестал различать модели
Рейтинг ничего не говорит о цене, модель может быть на первом месте и при этом стоить в три раза дороже
И главное правило, ни один тест не проверяет именно твою задачу. Бенчмарк подскажет, в какую сторону смотреть, но окончательный выбор всегда делается на своём реальном рабочем примере, а не по таблице с процентами.
Цифры против реальной задачи
Бенчмарки, это полезный ориентир, но не приговор. Они показывают, где у модели сильная сторона, где слабая, и как быстро развивается рынок. При этом лидер одного теста может оказаться на пятом месте в другом, а разница в пару баллов между топовыми моделями на практике часто вообще не чувствуется.
Гораздо важнее другое, как модель ведёт себя именно на твоих задачах. Один и тот же запрос на разных нейросетях может дать совершенно разный по качеству результат, и никакая таблица этого за тебя не проверит.
Проблема в том, что для честного сравнения нужно оформить подписку сразу на несколько сервисов, разобраться с оплатой каждого и постоянно переключаться между сайтами. Ради одной проверки это слишком долго и дорого.
Именно для этого работает unitool.ai. Оформи одну подписку и получи доступ ко всем актуальным нейросетям сразу, чтобы прогнать свою реальную задачу через несколько моделей и выбрать ту, что справилась лучше. Никаких иностранных карт и отдельной регистрации на каждой платформе, просто сравнение на практике вместо чужих таблиц с процентами.