
Claude Opus 5, новая модель Anthropic, которая почти догнала флагман и стоит вдвое дешевле
Anthropic выпустила Claude Opus 5, модель, которая почти догнала флагманский Fable 5 по уровню интеллекта, но обходится вдвое дешевле. Разбираемся, в чём она сильнее предыдущей версии, почему её называют самой аккуратной моделью компании и какие у неё есть ограничения.
Что такое Claude Opus 5 и кому он подойдёт
Anthropic открыла доступ к Claude Opus 5. Компания описывает модель как вдумчивую и инициативную, то есть она не просто выдаёт первый попавшийся ответ, а проверяет свою работу и доводит задачу до конца сама. По уровню интеллекта Opus 5 вплотную подошёл к флагманской модели Claude Fable 5, но при этом стоит вдвое дешевле.
На тестах по программированию и офисной работе, таких как Frontier-Bench и GDPval-AA, Opus 5 показывает лучший результат среди всех моделей на рынке. Единственная область, где он уступает, это кибербезопасность, там впереди остаётся более специализированная модель Mythos 5.
Главная идея этого запуска в том, что модель создавали для ежедневного использования, а не для разовых сложных задач. Она работает экономнее других моделей, поэтому стала моделью по умолчанию на тарифе Claude Max и самой сильной моделью на тарифе Claude Pro.

Почему Opus 5 выгоднее предыдущей версии Opus 4.8
Claude Opus 5 даёт заметно более сильный результат при той же цене, что и предыдущая версия Opus 4.8. У модели есть настройка усилия, с помощью которой можно выбрать, что важнее в конкретный момент, максимальный уровень интеллекта или экономия токенов ради более быстрого и дешёвого ответа.
Особенно хорошо модель показывает себя в задачах по разработке программ. На тесте Frontier-Bench версии 0.1 Opus 5 обходит все остальные модели и более чем вдвое превосходит результат Opus 4.8, причём одна задача обходится дешевле, чем раньше. На тесте CursorBench 3.2 при максимальном усилии модель отстаёт от лучшего результата Fable 5 всего на 0,5 процента, но стоит вдвое дешевле за задачу.

Результаты получены во внутреннем прогоне Frontier-Bench v0.1 на связке mini-SWE-agent и бэкенде GKE, средняя награда по пяти попыткам на задачу. Opus 4.8 использовался как запасная модель при срабатывании классификатора безопасности у Opus 5 и Fable 5.
Получается, что выгода здесь двойная. Модель и справляется с задачей лучше, и делает это, расходуя меньше ресурсов на тот же самый результат.
В каких задачах Claude Opus 5 обходит все остальные модели
Похожая картина видна и в офисной работе, и в решении нестандартных задач. Вот самые заметные результаты,
На тесте ARC-AGI 3, где модель должна решать задачи, которых она никогда раньше не видела, результат Opus 5 втрое выше, чем у ближайшего конкурента
На тесте Zapier AutomationBench, который проверяет, может ли модель довести реальную бизнес-задачу от начала до конца, Opus 5 справляется примерно в полтора раза чаще, чем следующая по силе модель при той же цене за задачу
Даже на самой экономной настройке усилия Opus 5 проходит больше задач, чем любая другая модель
На тесте по управлению компьютером OSWorld 2.0 модель обходит всех при любой цене, превосходя лучший результат Fable 5 всего за чуть более трети его стоимости




Лестница уровней усилия, если не указано иное (low, medium, high, xhigh, max)
Простыми словами, Opus 5 выигрывает не только по чистому качеству результата, но и по соотношению качества и цены. Даже когда конкурент показывает похожий результат, у Opus 5 он обычно обходится заметно дешевле.
Как Opus 5 справляется с научными задачами и визуальными результатами
В научных исследованиях Opus 5 стал заметным шагом вперёд по сравнению с Opus 4.8. Модель показывает лучший результат на каждом из тестов по наукам о жизни, которые охватывают структурную биологию, органическую химию и биоинформатику.
Сильнее всего рост заметен в органической химии, например в задачах, где нужно определить строение молекулы по данным спектроскопии, здесь модель набирает на 10,2 процентных пункта больше, чем Opus 4.8. В задачах, связанных с белками, например в предсказании того, как изменения в последовательности белка влияют на его работу, прирост составляет 7,7 процентных пункта. Отдельно стоит отметить визуальные результаты, они у Opus 5 стали заметно сильнее.
Три реальных примера как Opus 5 доводит задачи до конца
Главное отличие Opus 5 в том, что модель гораздо лучше проверяет собственную работу и продолжает пробовать, пока не добьётся результата. Вот три примера из тестов и раннего доступа, которые хорошо это показывают.
В первом случае модели дали чертёж детали и попросили написать код, который воссоздаст её в виде трёхмерной модели. Хитрость в том, что напрямую посмотреть на чертёж модель не могла, такую возможность специально убрали. Opus 5 в ответ написал собственный алгоритм компьютерного зрения, чтобы вытащить геометрию прямо из пикселей, а потом полностью воссоздал деталь. И повторил этот результат несколько раз подряд, тогда как ни одна конкурирующая модель не справилась с задачей даже за пять попыток.
Во втором случае модели дали реальную ошибку в популярном менеджере пакетов. Opus 5 нашёл первопричину и закрыл частный случай, который пропустило само сообщество разработчиков в своём исправлении. Конкурирующая модель при этом устранила только внешний симптом, не тронув саму причину, и отчиталась, что ошибка решена.
Третий пример от инженера торговой фирмы, который за одну сессию собрал с помощью Opus 5 приёмник биржевых данных для новой площадки. Не найдя живого потока данных для проверки, модель сама построила себе тестовую среду, чтобы убедиться, что её код правильно разбирает данные биржи.
Насколько Opus 5 безопасен и предсказуем
Перед выпуском Anthropic провела автоматическую проверку поведения модели, и по её результатам Opus 5 оказался самой согласованной моделью компании на сегодняшний день. Проще говоря, он лучше остальных следует правилам, заложенным в конструкции Claude, реже проявляет попытки ввести пользователя в заблуждение и хуже поддаётся уловкам, с помощью которых модель пытаются заставить сделать что-то недопустимое.
Модель также стала самой аккуратной в плане рискованных действий, у которых могут быть трудно обратимые последствия. По итоговой оценке несогласованного поведения Opus 5 набирает 2,3 балла, это самый низкий, а значит лучший, показатель среди недавних моделей компании.

По результатам автоматической проверки поведения Opus 5 набирает 2,3 балла по общему уровню несогласованного поведения, это самый низкий показатель среди недавних моделей
Какие ограничения есть у Opus 5 в кибербезопасности
Anthropic отдельно подчёркивает, что Opus 5 не сдвигает границу опасных возможностей, которые можно использовать во вред. В проверках, проведённых вместе с частными и государственными партнёрами, модель осталась позади Mythos 5 и в биологических исследованиях, и в наступательной кибербезопасности.
Интересная деталь, модель специально не обучали кибербезопасности, но она всё равно заметно подтянулась в этой области просто потому, что стала умнее в целом. В поиске уязвимостей Opus 5 подошёл близко к Mythos 5, а вот в превращении найденной уязвимости в рабочую атаку он отстаёт существенно.

На тесте OSS-Fuzz, одном из наших тестов по кибербезопасности, Opus 5 приближается к Mythos 5 в поиске уязвимостей в программах (слева), но заметно менее успешен в создании способов их эксплуатации (справа)
Защитные механизмы у Opus 5 построены так, чтобы не мешать полезной работе. Модели разрешено искать уязвимости в исходном коде, но заблокированы сканирование готовых программ на уязвимости, тестирование на проникновение и создание эксплойтов. По оценкам компании, ограничения будут срабатывать примерно на 85 процентов реже, чем у Fable 5. Что касается биологии, Opus 5 теперь самая мощная общедоступная модель компании для научных исследований, хотя в долгих самостоятельных исследовательских задачах она всё ещё ограничена.
Сколько стоит Claude Opus 5 и где его попробовать
Claude Opus 5 доступен уже сегодня на всех платформах. Цена составляет 5 долларов за миллион входящих токенов и 25 долларов за миллион исходящих, то есть точно столько же, сколько стоила предыдущая версия Opus 4.8. Разработчики могут подключиться к модели через Claude API.
Есть также быстрый режим, в котором модель работает примерно в 2,5 раза быстрее обычного. Он доступен по двойной цене от базовой стоимости модели, а в Claude Code за него можно платить кредитами использования.
Вместе с Opus 5 компания выпустила два обновления в тестовом режиме. Первое позволяет менять набор доступных модели инструментов прямо посреди диалога, не сбрасывая кэш запроса. Второе даёт возможность автоматически переключать запросы, помеченные системой безопасности, на другую модель вместо простой блокировки.
Умный, аккуратный, доступный
Claude Opus 5 показывает ту же тенденцию, что и остальные свежие релизы на рынке, борьба идёт уже не только за максимальный балл в тестах, но и за то, кто даст сопоставимый результат заметно дешевле. Модель почти догнала флагманский Fable 5 по интеллекту при вдвое меньшей цене, плюс стала самой аккуратной и предсказуемой моделью компании и заметно сильнее проверяет собственную работу, доводя задачу до конца самостоятельно.
При этом идеальной модели «для всего» по-прежнему не существует. В кибербезопасности впереди остаётся Mythos 5, а в некоторых задачах выгоднее окажутся модели других компаний. Проверить это можно только одним способом, запустив свою реальную задачу на разных моделях и сравнив результат, а не читая чужие рейтинги.
Проблема в том, что оформлять отдельную подписку у каждой компании ради такого сравнения слишком долго и дорого. Гораздо удобнее, когда все актуальные нейросети собраны в одном месте и переключаться между ними можно в пару кликов.
Именно для этого работает unitool.ai. Оформи одну подписку и получи доступ к самым свежим моделям сразу, включая новые релизы Anthropic, без иностранных карт и отдельной регистрации на каждой платформе. Попробуй сам, какая модель окажется точнее и выгоднее именно на твоих задачах.