Grok 4 и Grok 4.20 — бенчмарки, цены и честное сравнение моделей
Разбираем, чем сильны новые модели Grok 4 и Grok 4.20 от xAI, как они выглядят в бенчмарках. Покажем честное сравнение с GPT-5 и Claude, чтобы вы поняли, когда стоит выбирать именно Grok.
Обзор семейства моделей Grok от xAI

Grok 4 (базовая) — это проприетарная мультимодальная модель от xAI, вышедшая в июле 2025 года. Она поддерживает ввод текста и изображений, выдаёт текст и работает с контекстным окном на 256 тысяч токенов. Для самых сложных задач используется многоагентный режим «Heavy», где несколько копий Grok обсуждают и объединяют ответ.
Grok 4 Heavy — это конфигурация из нескольких агентов, в ранних отчётах их пять и больше, и она создана для глубоких исследований и долгих рассуждений. Доступна она как SuperGrok Heavy по корпоративной цене, около 300 долларов в месяц или 3000 долларов в год на некоторых тарифах.
Grok 4.20 (флагман 2026 года) заявлена как передовая модель xAI в 2026 году с контекстом на 2 миллиона токенов, улучшенным программированием и лучшим соотношением цены и качества. Она нацелена на бенчмарки SWE-bench, MMLU и кодинг, оставаясь при этом дешевле топовых моделей GPT-5.x.
Бенчмарки и интеллект Grok 4 и Grok 4.20
По данным агрегаторов, базовая Grok 4 показывает средний балл около 60–62% в некоторых подсчётах. Модель сильна на MMLU-Pro и полном MMLU, то есть в продвинутых знаниях и рассуждениях, а также на математических и сложных логических тестах вроде ARC-AGI и задач в стиле AIME, где она часто оказывается в числе лидеров.
Один из агрегаторов приводит для Grok 4 высокие баллы — около 95% на HELM IFEval за следование инструкциям, около 94% на Fiction. LiveBench за творческие и нарративные задачи и 85% с лишним на HELM MMLU-Pro. Отдельный сводный показатель Artificial Analysis Intelligence Index даёт Grok 4 оценку 33, что выше среднего среди сопоставимых моделей по рассуждению, знаниям, математике и кодингу.
Обзор бенчмарков от Tokenmix за 2026 год сообщает, что Grok 4.20 набирает 78% на SWE-bench, 91,2% на полном MMLU и 1385 Elo на кодинг-арене, что ставит её в передовой ряд по программированию. Контекстное окно у модели достигает 2 миллионов токенов, это примерно вдвое больше, чем у некоторых конкурентов. При этом Tokenmix отмечает, что Grok 4.20 идёт третьей после GPT-5.4 по чистой точности, но опережает по объёму контекста и примерно на 60% дешевле по стоимости вывода.


Источник: Бенчмарк Tokenmix
Цены и экономичность моделей Grok

Разные источники называют разные цены в зависимости от плана и версии, но видно несколько чётких закономерностей. По ранним отчётам стоимость API для Grok 4 оценивали до примерно 5,50 доллара за 1 миллион входных токенов и 27,50 доллара за 1 миллион выходных, что заметно дороже текущих публичных тарифов около 3 долларов за 1 миллион входных и 15 долларов за 1 миллион выходных токенов. Контекстное окно при этом составляет порядка 256 тысяч токенов.
По подписке тариф SuperGrok с Grok 4 в ряде обзоров указывается примерно за 300 долларов в год или 30 долларов в месяц. Тариф SuperGrok Heavy с Grok 4 Heavy в обсуждениях сообщества оценивается в 300 долларов в месяц или 3000 долларов в год и рассчитан на продвинутых пользователей и компании.
Отдельно стоит сравнение Grok 4.20 и GPT‑5.4. По данным агрегаторов, API для Grok 4.20 стоит около 2 долларов за 1 миллион входных токенов и 6 долларов за 1 миллион выходных при контексте до 2 миллионов токенов. В аналитических обзорах отмечается, что стоимость вывода у Grok 4.20 примерно на 60% ниже, чем у сопоставимых моделей вроде GPT‑5.4, при близкой точности и большем контексте. Это делает Grok 4.20 одной из самых экономичных передовых моделей 2026 года при сопоставимом качестве.
Сильные и слабые стороны Grok по задачам

Grok 4 — это модель, которая особенно хорошо чувствует себя там, где нужна строгая логика. По отзывам и обзорам, её сильная сторона это задачи с чёткой структурой. Например аналитика, сложные вопросы «почему так устроено», разбор документов, работа с актуальными данными из интернета и меж дисциплинарные запросы, где нужно соединить несколько областей знаний. Модель изначально обучали не только «запоминать тексты», но и пользоваться инструментами — поиском, кодом, калькулятором, — поэтому Grok чаще ведёт себя как исследователь и проверяет факты, обращается к внешним источникам и лучше держит длинный контекст, чем многие классические LLM. Это делает её удобной для глубоких разборов, бизнес‑аналитики и ситуации, когда важны не красивые формулировки, а обоснованный вывод.
Вторая сильная зона Grok — задачки на мышление и математику. В бенчмарках вроде ARC‑AGI модель показывала результаты, которые в обзорах описывают как «первый публичный ИИ, перешагнувший порог условного живого мышления», где она не просто угадывала ответы, а искала закономерности и решала новые типы задач. В демонстрациях и реальных тестах Grok уверенно справляется с логическими цепочками, сложными вопросами «на понимание смысла», помогает разбирать технические темы и умеет подстраивать стиль ответа под запрос — от сухой аналитики до более живого объяснения. Для тех, кто работает с текстами и данными, это ощущается как «умный собеседник‑аналитик», а не просто генератор фраз.
Но при этом у Grok есть и свои слабые места. По сравнению с ведущими конкурентами, модель выглядит менее сильной в чисто творческих задачах. Например её тексты могут быть полезными и структурными, но не всегда такими яркими и «литературными», как у моделей, заточенных под креатив. В мультимодальных сценариях и генерации изображений Grok тоже часто проигрывает флагманам вроде GPT и Gemini, где ему сложнее точно следовать визуальным промптам, выдерживать мелкие детали и аккуратно располагать объекты на картинке. Отдельные обзоры отмечают и политическую предвзятость базовой версии, где на чувствительные темы модель заметно опирается на позицию Илона Маска и связанные источники, что не всем подходит для нейтральной аналитики.
Ещё один нюанс — специализация и баланс по задачам. Grok 4 задумывался как инструмент для сложных исследований, программирования и анализа, отсюда упор на логику, актуальные данные и работу с большими объёмами информации. Это делает его сильным выбором для экспериментов, бизнес‑кейсов и глубоких разборов, но не всегда лучшим вариантом, если нужен быстрый креатив, сложная мультимодальность или максимально нейтральный тон по чувствительным темам. В итоге Grok чаще всего выбирают как «мозг для серьёзных задач», а не как универсального рассказчика на все случаи жизни.
Хотите попробовать Grok сами
Как видите, Grok 4 и Grok 4.20 — это серьёзные модели для математики, науки, сложных рассуждений и работы с большим контекстом, а версия 4.20 ещё и заметно экономичнее многих конкурентов. Выбор между ними и моделями GPT или Claude зависит от вашей задачи и бюджета, и лучший способ понять разницу — это протестировать их на своих реальных запросах.
Именно для этого и существует Unitool.ai, где все ведущие нейросети доступны по одной подписке в одном месте. Вам не нужно оформлять отдельные тарифы xAI, OpenAI и других сервисов, достаточно открыть платформу и переключаться между моделями в пару кликов. Регистрируйтесь в Unitool.ai, выбирайте Grok и сравнивайте модели на своих задачах уже сегодня.