GPT‑5.5 против Claude и Gemini простое сравнение по бенчмаркам
Мы собрали главные бенчмарки GPT‑5.5 и сравнили её с Claude Opus 4.7 и Gemini 3.1 Pro в знаниях, работе с компьютером, программировании и логике. По цифрам показываем, где GPT‑5.5 действительно сильнее, где примерно на одном уровне с конкурентами, а где цена может быть неоправданной.
GPT‑5.5 новая главная модель ChatGPT, которая метит в лидеры рынка

OpenAI представила GPT‑5.5 как новую главную модель для ChatGPT и API. Она сделана не только для ответов на вопросы, а для реальной работы: общения, программирования, исследований и агентных задач.
У GPT‑5.5 есть обычная версия для повседневного использования и более мощная GPT‑5.5 Pro. Pro-версия дороже, но лучше подходит для сложных задач, где нужны глубокие рассуждения, работа с инструментами и многошаговые действия.
Анонс OpenAI делает акцент на трёх вещах — работе с информацией в разных профессиях, самостоятельном выполнении задач на компьютере и программировании через длинные многошаговые цепочки.
Базовые бенчмарки OpenAI для GPT‑5.5

В своей технической заметке OpenAI сообщает, что GPT‑5.5 достигает state‑of‑the‑art на нескольких новых агентных бенчмарках. На GDPval, охватывающем 44 профессии и проверяющем, насколько хорошо агент выполняет чётко поставленную знаниевую работу — от консалтинга и юриспруденции до инженерии, — модель показывает 84,9%. На OSWorld‑Verified, который измеряет способность автономно работать в реальной операционной системе с приложениями, окнами и файлами, результат составляет 78,7%. А на Tau2‑bench Telecom, где моделируются сложные многоходовые сценарии клиентского сервиса без подгонки промптов, GPT‑5.5 достигает 98,0%.
OpenAI приводит и дополнительные профессиональные метрики. Сведём их в таблицу для наглядности.

Эти цифры подтверждают главный тезис OpenAI — GPT‑5.5 создана для реальной бизнес‑работы и управления инструментами, а не только для искусственных тестов.
Независимые бенчмарки, математика, код, рассуждения
В академическом тесте MMLU‑Pro лидирует Claude Opus 4.7 — 92.8%, за ним идут GPT‑5.5 Pro (92.1%), Claude Sonnet 4.6 (91.5%) и Gemini 3.1 Pro (91.0%) — разрыв в топе минимальный. На абстрактном рассуждении ARC‑AGI‑2 Claude Opus 4.7 снова первый с 81.5%,опережая GPT‑5.5 Pro (78.4%) и Gemini 3.1 Pro (77.1%). А вот в математике AIME 2025 вперёд выходит GPT‑5.5 Pro с 96.7% — лучший результат по этомуметрику, тогда как Claude Opus 4.7 показывает 95.2%, а Gemini 3.1 Pro — 93.5%. Среди более лёгких моделей по совокупности reasoning‑метрик заметноотстают Claude Haiku 4.5 (ARC‑AGI‑2 33.4%, AIME 64.8%) и устаревший GPT‑4.5 (ARC‑AGI‑2 23.5%, AIME 58.4%).

Источник: Бенчмарк Local AI Master
По итогам бенчмарков видно, что в верхнем сегменте нет абсолютного доминирования одной модели. Claude Opus 4.7 выглядит самым стабильным лидером по академическим и абстрактным reasoning‑задачам, особенно в MMLU‑Pro и ARC‑AGI‑2, тогда как GPT‑5.5 Pro сильнее всего проявляет себя в математике и соревновательных задачах AIME 2025. Gemini 3.1 Pro держится близко к лидерам и остаётся конкурентным вариантом, особенно с учётом большого контекста.
Практический выбор зависит не только от максимального процента в таблице, но и от сценария использования. Для сложного рассуждения и универсальной надёжности логичнее смотреть на Claude Opus 4.7 или GPT‑5.5 Pro, для математических задач — на GPT‑5.5 Pro, а для баланса цены, качества и длинного контекста заметно выделяются Claude Sonnet 4.6 и Gemini 3.1 Pro. Более лёгкие и старые модели остаются полезными для простых задач и экономии, но по reasoning‑метрикам уже заметно уступают новому флагманскому уровню.
Программирование и агентная работа в терминале

В программировании и DevOps GPT‑5.5 показывает сильные результаты, особенно в задачах, где нужно выполнять многошаговые действия в терминале. На Terminal‑Bench 2.0 модель набирает 82,7%, и это лучший результат среди моделей в таблице. Для сравнения, GPT‑5.4 получает 75,1%, Claude Opus 4.7 — 69,4%, а Gemini 3.1 Pro — 68,5%.
На SWE‑Bench Pro картина менее однозначная. GPT‑5.5 показывает 58,6% и немного обходит GPT‑5.4 с результатом 57,7%, а также Gemini 3.1 Pro с 54,2%. Однако Claude Opus 4.7 здесь впереди с результатом 64,3%, поэтому называть GPT‑5.5 лидером этого теста нельзя. Внутренний тест Expert‑SWE показывает более заметный прирост, где GPT‑5.5 набирает 73,1% против 68,5% у GPT‑5.4.
Если суммировать этот блок, GPT‑5.5 выглядит особенно сильной в терминальных и многошаговых DevOps‑задачах, где она уверенно обходит GPT‑5.4, Claude Opus 4.7 и Gemini 3.1 Pro. В задачах уровня SWE‑Bench Pro модель тоже прибавляет относительно GPT‑5.4 и Gemini, но уступает Claude Opus 4.7, поэтому корректнее говорить не о полном доминировании, а о сильной позиции в верхней группе кодинговых моделей.
Источник: Оценки OpenAi
Лицом к лицу, GPT‑5.5 против Claude Opus 4.7 и Gemini 3.1

Несколько сравнительных материалов показывают, что GPT‑5.5 действительно усилила позиции OpenAI, но картина не сводится к полному доминированию во всех категориях. В агентных задачах и работе с инструментами она чаще выходит вперёд, на Terminal‑Bench 2.0 GPT‑5.5 набирает 82,7% против 69,4% у Claude Opus 4.7 и 68,5% у Gemini 3.1 Pro. На OSWorld‑Verified разрыв почти исчезает, 78,7% у GPT‑5.5 против 78,0% у Claude Opus 4.7. В веб‑навигации BrowseComp лучший результат показывает GPT‑5.5 Pro, 90,1%, тогда как у Claude Opus 4.7 — 79,3%, а у Gemini 3.1 Pro — 85,9%.
В программировании ситуация более неоднозначная. GPT‑5.5 уверенно лидирует на Terminal‑Bench 2.0 и внутреннем Expert‑SWE, где получает 73,1% против 68,5% у GPT‑5.4. Однако на SWE‑Bench Pro Public впереди уже Claude Opus 4.7 с 64,3%, тогда как GPT‑5.5 показывает 58,6%, а Gemini 3.1 Pro — 54,2%. Поэтому корректнее говорить не о безусловном преимуществе GPT‑5.5 в кодинге, а о сильном лидерстве в терминальных и инженерных задачах при сохранении преимущества Claude в части SWE‑сценариев.
В математике и академических тестах GPT‑5.5 и GPT‑5.5 Pro выглядят особенно сильно. На FrontierMath Tier 1–3 GPT‑5.5 Pro показывает 52,4%, GPT‑5.5 — 51,7%, Claude Opus 4.7 — 43,8%, Gemini 3.1 Pro — 36,9%. На более сложном FrontierMath Tier 4 преимущество GPT‑5.5 Pro ещё заметнее, 39,6% против 22,9% у Claude Opus 4.7 и 16,7% у Gemini 3.1 Pro. При этом в GPQA Diamond лидирует не GPT‑5.5, а GPT‑5.4 Pro с 94,4%, почти на одном уровне с Gemini 3.1 Pro, 94,3%, Claude Opus 4.7, 94,2%, и GPT‑5.5, 93,6%.
В задачах на абстрактное мышление GPT‑5.5 также занимает сильную позицию, но не везде первая. На ARC‑AGI‑2 Verified она показывает 85,0%, опережая GPT‑5.4 Pro с 83,3%, Gemini 3.1 Pro с 77,1% и Claude Opus 4.7 с 75,8%. Однако на ARC‑AGI‑1 Verified лидирует уже Gemini 3.1 Pro с 98,0%, тогда как GPT‑5.5 получает 95,0%, GPT‑5.4 Pro — 94,5%, а Claude Opus 4.7 — 93,5%. Это показывает, что преимущество GPT‑5.5 сильнее проявляется на более новом и сложном ARC‑AGI‑2, а не на всех reasoning‑тестах подряд.
В длинном контексте результаты смешанные. На Graphwalks Claude Opus 4.7 лучше справляется с частью задач, например BFS 256k f1, 76,9% против 73,7% у GPT‑5.5, а также parents 256k f1, 93,6% против 90,1%. При этом GPT‑5.5 заметно сильнее на OpenAI MRCR v2 при больших окнах, например 87,5% на 128K–256K против 59,2% у Claude Opus 4.7 и 74,0% на 512K–1M против 32,2% у Claude Opus 4.7. Поэтому здесь нельзя выделить одного универсального победителя, GPT‑5.5 сильнее в MRCR‑подобных тестах, Claude — в части графовых задач.
В профессиональных и прикладных задачах распределение лидерства тоже неоднородное. На GDPval GPT‑5.5 получает 84,9%, выше GPT‑5.5 Pro, 82,3%, Claude Opus 4.7, 80,3%, и Gemini 3.1 Pro, 67,3%. В OfficeQA Pro GPT‑5.5 также впереди с 54,1% против 43,6% у Claude и 18,1% у Gemini. Но в FinanceAgent v1.1 лучшая оценка у Claude Opus 4.7, 64,4%, тогда как GPT‑5.5 показывает 60,0%, а Gemini 3.1 Pro — 59,7%. В кибербезопасности GPT‑5.5 выглядит сильнее Claude на CyberGym, 81,8% против 73,1%, и опережает GPT‑5.4 на внутренних CTF‑задачах, 88,1% против 83,7%.
Отдельно стоит Artificial Analysis Intelligence Index. На графике GPT‑5.5 выходит на первое место с результатом около 60 баллов, опережая Claude Opus 4.7 и Gemini 3.1 Pro Preview, которые находятся примерно на уровне 57 баллов. Это подтверждает общий тренд, GPT‑5.5 сильнее масштабируется при большем объёме вычислений и токенов рассуждения, но преимущество над ближайшими конкурентами остаётся не разгромным, а умеренным.

Обобщая, GPT‑5.5 и GPT‑5.5 Pro чаще всего выигрывают в агентных, терминальных, веб‑задачах, математике и части профессиональных сценариев. Их сильные стороны особенно заметны на Terminal‑Bench 2.0, BrowseComp, FrontierMath, ARC‑AGI‑2, GDPval и OfficeQA Pro. При этом Claude Opus 4.7 сохраняет важные преимущества в SWE‑Bench Pro, отдельных задачах длинного контекста, FinanceAgent и MCP Atlas, где он набирает 79,1% против 75,3% у GPT‑5.5 и 78,2% у Gemini 3.1 Pro.
Gemini 3.1 Pro выглядит не как явный лидер большинства сравнений, но остаётся конкурентоспособным в отдельных направлениях. Он показывает лучший результат на ARC‑AGI‑1 Verified, 98,0%, близок к лидерам в GPQA Diamond и хорошо держится в BrowseComp с 85,9%. Поэтому итоговый вывод должен быть аккуратным, GPT‑5.5 задаёт новый верхний уровень для многих практических и reasoning‑сценариев, Claude Opus 4.7 остаётся сильным конкурентом в коде, финансах и длинном контексте, а Gemini 3.1 Pro сохраняет ценность как мощная универсальная модель с отдельными пиковыми результатами.
Gemini 3.5 Flash оказался в десятки раз дешевле GPT 5.5 и Claude Opus 4.7 по стоимости токенов
Новая сравнительная таблица стоимости показывает, что цена работы с ИИ-моделями при больших объёмах запросов может отличаться не на проценты, а в десятки и даже сотни раз. Согласно данным на изображении, Gemini 3.5 Flash стоит примерно 0,10–0,10–0,15 за 1 млн входных токенов и 0,40–0,40–0,60 за 1 млн выходных токенов. Для сравнения, GPT 5.5 оценивается в 10–10–15 за вход и 30–30–50 за выход, а Claude Opus 4.7, в 15–15–18 и 75–75–90 соответственно.

Главный разрыв виден именно в стоимости выходных токенов, которые часто формируют основную часть расходов в реальных ИИ-сценариях, генерации текстов, работе агентов, анализе документов и автоматизации клиентской поддержки. Разница между Gemini 3.5 Flash и Claude Opus 4.7 по выходным токенам достигает примерно 100–150 раз. При этом все три модели поддерживают кэширование, что помогает снижать затраты при повторяющихся запросах.
Для компаний с высоконагруженными ИИ-процессами выбор модели становится не только вопросом качества, но и экономики. Если рабочий процесс генерирует 10 млн. выходных токенов в месяц, Gemini 3.5 Flash обойдётся примерно в 5, тогда как Claude Opus 4.7 может стоить 5, а Claude Opus 4.7 может стоить 750–$900. Такой разрыв делает более дешёвые модели особенно привлекательными для массовых задач, где скорость и стоимость важнее максимальной глубины рассуждений.
Как пользоваться GPT‑5.5 удобнее — через unitool.ai
Сильная модель — это половина дела, вторая половина в том, чтобы не привязываться к одному вендору и не переплачивать. Наш сервис unitool.ai — единое окно к топовым нейросетям, где GPT‑5.5 соседствует с Claude Opus 4.7, Gemini 3.1 Pro и другими моделями из этой статьи. Вы запускаете один и тот же запрос на разных моделях, сравниваете ответы и стоимость бок о бок и выбираете лучшую под конкретную задачу — кодинг, исследование или агентный многошаговый сценарий — не плодя десяток подписок.