
Grok 4.6, новая модель SpaceXAI, которая догнала флагманы за 2 доллара
Компания SpaceXAI выпустила Grok 4.6, модель, которая догнала топовые решения по общему уровню интеллекта, но стоит в разы дешевле конкурентов. Разбираемся, где она реально сильнее всех и почему одна из её тестовых версий сама ускорила собственную работу.
Что такое Grok 4.6 и чем она отличается от Grok 4.5
12 августа 2026 года компания SpaceXAI выпустила Grok 4.6. Модель построена на базе предыдущей версии Grok 4.5, но с упором на две вещи, долгие самостоятельные задачи и более амбициозную визуальную работу. Проще говоря, она умеет держаться за сложную задачу на протяжении множества шагов, будь то изучение темы, разбор информации, работа с большим проектом кода или превращение идеи в готовое приложение.
Главная цифра из анонса такая. По сводному рейтингу Artificial Analysis Intelligence Index, который объединяет результаты девяти разных тестов в одну оценку, Grok 4.6 набирает 61 балл и сравнялась с GPT-5.6 Sol. Впереди только Claude Fable 5 с 62 баллами, а предыдущая версия Grok 4.5 набирала 56.

Показатели конкурентов взяты из опубликованных карточек моделей соответствующих разработчиков или из открытых рейтингов
Модель относится к семейству SpaceXAI масштабом 1,5 триллиона параметров и разработана в сотрудничестве с командой Cursor, известного редактора кода. Дата отсечки обучающих данных, январь 2026 года.
Как Grok 4.6 справляется с программированием
Программирование, это фундамент всей модели, потому что агент, который умеет читать, писать и запускать код, может управлять практически любым цифровым инструментом или файлом. Поэтому и остальные способности модели, офисная работа, инженерия и проектирование, опираются именно на эту базу.
Вот как выглядят результаты Grok 4.6 на основных тестах по коду,
APEX-SWE, где проверяют работу над интеграциями и поиск причин сбоев по данным систем мониторинга, 56,4 процента, третье место после Opus 5 с 63,7 и Fable 5 с 58,8
FrontierCode v1.1, который проверяет, приняли бы правки модели живые сопровождающие открытых проектов, 61,3 процента, третье место
DeepSWE v1.1, где нужно закрыть реальную задачу в проекте от начала до конца, 65,9 процента при 74 у лидера Opus 5
Terminal-Bench 3.0, работа в командной строке, 26 процентов при 43,5 у Opus 5

Как видишь, по чистому качеству кода Grok 4.6 не первая, а обычно третья-четвёртая. Но здесь важно смотреть не только на процент, потому что вторая половина картины, это цена и расход токенов.

CursorBench 3.2 оценивает работу ИИ-агентов на реалистичных задачах из рабочих процессов Cursor, правки в нескольких файлах, вызов инструментов и последовательное исправление ошибок
Именно на этом графике видно самое интересное. Grok 4.6 показывает около 70 процентов, находясь рядом с Opus 5, но при этом тратит заметно меньше токенов и стоит на задачу в разы дешевле. Модель добирается до результата за меньшее число шагов, а это и есть та экономия, за которую в реальной работе платят живыми деньгами.
Где Grok 4.6 обходит все остальные модели
Есть несколько направлений, где Grok 4.6 занимает первое место, и они довольно неожиданные.
Первое, это инженерия реального мира. Модель проверяли на задачах, где нужно рассуждать не о коде, а о геометрии, материалах и настоящих устройствах. На тесте 3DCodeBench, где ИИ создаёт трёхмерные модели через код, Grok 4.6 берёт первое место с 54 процентами, обходя Opus 5 с его 49,9. На тесте CadGenBench, где по описанию нужно построить чертёж детали, тоже первое место, 40,9 процента.

Второе направление, офисные и юридические задачи. На тесте OfficeQA Pro, где модель отвечает на рабочие вопросы по реальным документам компании, Grok 4.6 лидирует с 63,2 процента. А на юридическом тесте от Harvey результат вообще выделяется, 22 процента против 14,2 у Fable 5 и 11,7 у Opus 5.

Третье направление, помощь в разработке самих нейросетей. На внутреннем тесте SpaceXAI по задачам создания моделей Grok 4.6 набирает 61,1 процента, обходя и Opus 5, и GPT-5.6 Sol. На тесте InferenceEval, где нужно внести рабочие изменения в код, обслуживающий живых пользователей, тоже первое место с 46,9 процента. Получается любопытная картина, модель может уступать в классическом программировании, но выигрывать там, где задача ближе к инженерии и рутинной профессиональной работе.
Как ранняя версия Grok 4.6 ускорила саму себя
Самый показательный эксперимент из отчёта компании выглядит так. Одной из ранних версий Grok 4.6 поручили ускорить работу собственного чата. Модели разрешили свободно экспериментировать, но потребовали проверять реальный прирост скорости перед тем, как предлагать изменение.
За пять часов работы модель перебрала 297 вариантов оптимизации по разным направлениям, отбросила те, что не давали измеримого выигрыша на практике, включая несколько таких, которые хорошо выглядели на промежуточных замерах, и в итоге предложила семь правок. Три из них сейчас реально обслуживают живой трафик чата Grok и дают суммарный прирост скорости около 1,5 процента при генерации ответа и 3,1 процента на этапе обработки запроса.
Это хороший пример того, о чём говорилось выше. Проценты в тестах показывают потенциал, а вот такие истории показывают, что модель умеет доводить длинную самостоятельную работу до конкретного результата и при этом сама отсеивать ложные улучшения.
Что с точностью, поиском и безопасностью
По части фактической точности картина смешанная. Модель врёт, то есть выдаёт непроверенные утверждения, в 1,7 процента случаев, что хуже, чем у предыдущей версии Grok 4.5 с её 0,98 процента, но заметно лучше, чем у Opus 4.8 с 3,4 процента. Зато на тесте DeepSearchQA, где нужно найти ответ через многошаговый поиск и свести данные вместе, Grok 4.6 набирает 81,6 процента против 38,4 у предыдущей версии, это очень крупный скачок.

В кибербезопасности модель усилилась умеренно. Компания отдельно подчёркивает, что эти способности полезнее защитникам, то есть для поиска и закрытия уязвимостей, а не для проведения атак. Развёрнутая версия модели отказывает в подавляющем большинстве явно вредоносных запросов.
Что касается защиты от обхода ограничений, тут прогресс заметный, доля успешных попыток обмануть модель стандартными приёмами упала с 0,73 до 0,04 процента. Точность отказов по темам оружия массового поражения выросла до 100 процентов, а по детской безопасности показатель остался на нуле, то есть модель не идёт на такие запросы вовсе. При этом честно отметим и обратное, по внутреннему тесту на склонность отступать от правды под давлением пользователя показатель ухудшился с 0,67 до 3,8 процента.
Сколько стоит Grok 4.6 и где её попробовать
Вот здесь и кроется главный аргумент модели. Цена начинается от 2 долларов за миллион входящих токенов и 6 долларов за миллион исходящих. Есть ещё быстрый вариант, который работает вдвое дороже.
Для сравнения, флагманы конкурентов стоят заметно выше при разнице в качестве всего в несколько баллов. Именно поэтому на графиках соотношения цены и результата Grok 4.6 оказывается в очень выгодной зоне.
Попробовать модель можно в редакторе кода Cursor и в собственном инструменте Grok Build, где на первую неделю компания дала двойной объём включённого использования. Также модель доступна через API компании и через сторонние площадки, среди которых OpenRouter, Vercel и Cloudflare. В обычных приложениях Grok для веба, телефона и на платформе X модель планируют добавить позже.
Дешевле, быстрее, практичнее
Grok 4.6 хорошо показывает, куда движется весь рынок нейросетей. Гонка за первое место по баллам постепенно уступает место другому вопросу, кто даст сопоставимый результат заметно дешевле и за меньшее число шагов. Модель редко берёт первое место в чистом программировании, зато лидирует в инженерных, офисных и юридических задачах, а по цене находится в совершенно другой весовой категории.
Отсюда простой вывод. Выбирать модель по общему рейтингу почти бессмысленно, потому что лидер сводной таблицы может проиграть на твоей конкретной задаче более дешёвой модели. Разница в один-два балла между флагманами на практике часто вообще не чувствуется, а разница в цене в три раза чувствуется сразу.
Проблема в том, что честно сравнить Grok, Claude, GPT и остальные модели напрямую означает оформить доступ к каждой ии отдельно, разобраться с оплатой и постоянно переключаться между сервисами. Ради одной проверки это слишком долго.
Именно для этого работает unitool.ai. Оформи одну подписку и получи доступ ко всем актуальным нейросетям сразу, чтобы прогнать свою реальную задачу через несколько моделей и выбрать ту, что справилась лучше. Без иностранных карт и отдельной регистрации на каждой платформе, только сравнение на практике вместо чужих таблиц с процентами.