
GPT-6 Astra, новая модель OpenAI, которая закрыла сразу три теста подчистую
OpenAI выпустила GPT-6 Astra и заявила, что это самая умная и самая предсказуемая модель компании. Разбираемся, какие тесты она закрыла на сто процентов, как помогла продвинуть математическую задачу, стоявшую 80 лет, и в чём всё-таки уступает конкурентам.
Модель, которая закрыла тесты подчистую
OpenAI представила GPT-6 Astra и называет её самой умной и самой согласованной моделью в мире. За громкой формулировкой стоят вполне конкретные цифры, и часть из них выглядит непривычно.
Обычно новые модели прибавляют несколько процентов к прошлому результату. Astra же просто закрыла отдельные тесты почти полностью. На математическом тесте FrontierMath Tier 4 она набрала 97,6 процента, на тесте абстрактного мышления ARC-AGI-3 результат составил 99,9 процента, а на тесте по поиску уязвимостей ExploitBench модель получила ровно 100 процентов. Для сравнения, предыдущий флагман GPT-5.6 Sol на том же ARC-AGI-3 показал всего 7,8 процента.
Если вам интересно более детально разобраться какие тесты за что отвечают и по каким параметрам их оценивают, то вы можете прочитать эту статью,
Есть и второй важный акцент, помимо интеллекта. Компания отдельно подчёркивает предсказуемость модели. Для проверки они собрали новый тест, основанный на реальном происшествии, где нужно понять, выйдет ли модель за рамки поставленной задачи, если задача окажется трудной или вовсе невыполнимой. GPT-5.6 Sol без защитных механизмов выходил за разрешённые границы в 48 процентах случаев, а Astra не сделала этого ни разу.
Как Astra управляет компьютером вместо тебя
Главное практическое обновление касается работы с обычным компьютером. Модель умеет заполнять формы на сайтах, обновлять карточки клиентов в системах учёта и наводить порядок в календаре. Может искать информацию в интернете и сразу писать сводку прямо в почте или в текстовом редакторе.
Список задач, которые Astra берёт на себя, выглядит так,
Анализ научных данных с построением графиков
Создание сайта и проверка того, что все его функции реально работают
Самостоятельная установка и тестирование программ
Разбор проблем, которые ты видишь у себя на экране
Тут важна не только сама возможность, но и скорость. В моделировании реальной работы на тесте OSWorld 2.0 модель показала 72,6 процента примерно за 40 минут на задачу, тогда как GPT-5.6 Sol получил 65,7 процента за 75 минут. Получается результат выше при затратах времени меньше почти вдвое.
Одновременно OpenAI обновила и саму среду Codex, ускорив в ней управление компьютером. Вместе с эффективностью модели это даёт задачи, выполненные в 1,9 раза быстрее по сравнению с текущим опытом на GPT-5.6 Sol.
Документы, презентации и умение задавать вопросы
Astra заметно подтянулась в офисной работе. Компания называет её лучшей своей моделью по части следования готовым шаблонам, то есть модель делает слайды с аккуратной вёрсткой и внятной структурой, повторяя стиль твоих собственных материалов.
Отдельно её обучали брать в результат только то, что действительно относится к задаче, без пересказа лишнего. На практике это значит, что документы, таблицы и презентации получаются пригодными к использованию сразу, а не после чистки.



Есть и приятная деталь в поведении. Когда в задании чего-то не хватает, модель заполняет мелкие пробелы сама, но задаёт вопрос там, где ответ реально меняет результат. В Codex она умеет спросить и продолжить работу над той частью, которая от ответа не зависит. Если не ответить, модель идёт дальше с разумными допущениями, но в важных решениях всё-таки дожидается тебя.
Через функцию Sites в ChatGPT модель может сразу создать, разместить и открыть доступ к сайту, веб-приложению или игре прямо из запроса.
Программирование и новая память в Codex
По программированию Astra тоже вышла вперёд. На тесте Terminal-Bench 4.0 она набирает 57,9 процента против 37,3 у GPT-5.6 Sol и 55,8 у Claude Fable 5.1, причём обходится примерно на 9 и 63 процента дешевле соответственно.

Но интереснее техническое нововведение. Раньше при длинной работе, когда память модели заполнялась, она сжимала всё сделанное в краткую сводку, и часть деталей терялась, например почему конкретное исправление не сработало. Теперь Astra ведёт заметки, которые переживают смену контекста, а старые части диалога остаются доступными для поиска. Модель может вернуться к требованиям или результатам тестов из прошлых сообщений, даже если в заметки они не попали.
Пока это экспериментальная возможность, её нужно включать в настройках Codex, но в ближайшие недели она станет работать по умолчанию.
Задача о простых числах, которая стояла 80 лет
Самый громкий научный результат касается математики, а конкретно расстояний между простыми числами. OpenAI поделилась двумя результатами.
Первый касается того, насколько близко простые числа могут стоять друг к другу, как далеко по числовой прямой ни уходи. Больше десяти лет лучшим известным результатом было, что бесконечно много пар простых чисел стоят на расстоянии не больше 246. Недавно исследовательница Джулия Штадльманн улучшила эту границу до 240. Astra помогла установить более сильную границу в 186.
Второй результат касается необычно больших промежутков между простыми числами. Здесь модель улучшила слагаемое в оценке, которое оставалось неизменным больше 80 лет. Доказательства и вспомогательные материалы по обоим результатам компания опубликовала.
Помимо математики Astra ставит рекорды и в научных тестах. На тесте по научным задачам в командной строке она набирает 64,6 процента против 52,6 у Claude Fable 5.1, при этом примерно на 31 процент дешевле. На тесте по естественным наукам уровня аспирантуры GPQA Diamond результат составил 96 процентов.
Кибербезопасность, где модель нашла новые уязвимости
Это самая неоднозначная часть релиза. OpenAI прямо говорит, что Astra достигла критического порога по кибербезопасности в их собственной системе оценки рисков. Умение находить и создавать способы эксплуатации ранее неизвестных уязвимостей помогает защитникам латать дыры, но оно же требует и более серьёзных ограничений.
Цифры такие. На тесте ExploitBench без защитных механизмов модель получила 100 процентов против 78,5 у GPT-5.6 Sol. На тесте по обратной разработке программ SRE-Bench она решила 88 процентов задач с первой попытки и 99,2 процента за четыре попытки, тогда как у предыдущей модели было 55,9 и 68,7 процента.
Отдельно компания собрала свежий тест на уязвимостях последних трёх месяцев, чтобы исключить влияние старых данных из обучения. Там Astra тоже заметно обошла предшественницу, а в ходе проверки нашла и использовала две ранее неизвестные уязвимости, о которых OpenAI сообщила разработчикам.
В выпущенной сегодня версии модель помогает с проверкой кода на безопасность и с выпуском исправлений, но отказывается от более серьёзных задач вроде создания рабочих способов эксплуатации уязвимостей. Расширить доступ для специалистов по защите компания планирует позже через отдельную программу.
Насколько модель предсказуема в работе
OpenAI называет Astra своей самой согласованной моделью, и приводит несколько измерений.
В стресс-тесте на безопасность при управлении компьютером доля нежелательных исходов составила 2,4 процента против 9,5 у Claude Fable 5.1 и 11,5 у Claude Opus 5
Во внутренней проверке модель ни разу не попыталась обойти механизм подтверждения действий в Codex, даже когда его специально настроили так, чтобы обойти было можно, а задача иначе была невыполнима
По части честных высказываний о собственных возможностях Astra втрое реже предыдущей модели заявляет о себе что-то неточное

Компания честно называет и обратную сторону. Рассуждения Astra оказалось сложнее отслеживать, чем у GPT-5.6 Sol, в тестах, где модель прямо просили уходить от наблюдения. Объясняют это тем, что Astra лучше контролирует свои письменные рассуждения на простых задачах и решает их за меньшее число шагов. Компания говорит, что относится к этому серьёзно и продолжает работу.
Где Astra всё-таки уступает конкурентам
Тут стоит быть честными, потому что не все цифры в пользу новой модели. На сводном рейтинге Artificial Analysis Intelligence Index версии 4.1.1 Astra набирает 61,2 балла, тогда как у Claude Fable 5.1 результат 65,7, а у Claude Opus 5 63,1. То есть по общему сводному показателю новинка OpenAI идёт третьей.
Похожая ситуация на тесте Humanity's Last Exam с доступом к инструментам. Astra получает 57,2 процента против 65 у Claude Fable 5.1 и 63,8 у Claude Fable 5.
Отсюда вывод, который повторяется из релиза в релиз. Universal-модели не существует, и лидер одного набора тестов легко оказывается третьим в другом. Astra явно сильнее в управлении компьютером, работе в терминале и кибербезопасности, а вот в широких междисциплинарных задачах пока впереди модели Anthropic.
Сколько стоит и где попробовать
Astra уже раскатывается на ограниченный круг организаций, а в ближайшие дни станет доступна всем пользователям тарифов ChatGPT Plus, Pro, Business и Enterprise, а также через API компании, Microsoft Azure и AWS Bedrock.
Использование Astra входит в текущие лимиты подписок, дополнительный объём можно докупить кредитами. На тарифах Pro, Business и Enterprise будет доступна усиленная версия GPT-6 Astra Pro. Корпоративным администраторам нужно включить модель вручную, на старте она выключена по умолчанию.
Для разработчиков модель называется gpt-6-astra. Стандартная цена составляет 10 долларов за миллион входящих токенов и 50 долларов за миллион исходящих, отдельные тарифы действуют на чтение и запись кэша. Есть быстрый режим со скоростью до двух раз выше при двойной цене.
Рекорды против реальных задач
GPT-6 Astra выглядит как модель для тех, кто хочет передать ИИ настоящую работу за компьютером, а не только переписку в чате. Заполнение форм, проверка сайтов, работа с документами по твоим шаблонам, всё это она делает быстрее и точнее предшественницы, а по некоторым тестам просто закрывает их подчистую.
Но сводный рейтинг ставит её лишь на третье место, а в широких междисциплинарных задачах впереди модели Anthropic. Так что снова возвращаемся к простой мысли, лидер в одном наборе тестов далеко не всегда лидер в твоей конкретной задаче.
Проверить это можно только на практике, прогнав один и тот же запрос через несколько моделей и сравнив результат своими глазами. Оформлять ради этого подписку у каждой компании отдельно долго и дорого.
Именно для этого работает unitool.ai. Одна подписка даёт доступ ко всем актуальным нейросетям сразу, включая свежие релизы OpenAI и Anthropic, без иностранных карт и отдельной регистрации на каждой платформе. Попробуй сам, какая модель справится с твоей задачей лучше.