Обзор Claude Opus 5
Opus 5 оправдывает цену в сложных и долгих агентных задачах, а Sonnet 5 остается выгоднее для повседневной работы.
Anthropic выпустила Claude Opus 5 24 июля 2026 года с громким обещанием: интеллект, близкий к Claude Fable 5, за половину его API-цены. Для пользователя важнее не первое место на стартовом графике, а способность модели завершать больше полезной работы за доллар по сравнению с Opus 4.8 и Sonnet 5.
Наш вывод: для сложных и долгих задач переход оправдан. Opus 5 логично заменяет Opus 4.8, потому что стандартная цена токена не изменилась, а публичные тесты программирования и профессиональной работы показывают большой прирост. Для коротких правок, извлечения данных, классификации и массового чата Sonnet 5 дешевле и обычно достаточно быстр.
О доказательствах, проверено 26 июля 2026 года. Это обзор открытых данных, а не заявление о том, что OmniaKey самостоятельно повторила каждый бенчмарк. Мы сопоставили релиз и техническую документацию Anthropic с публичной таблицей Frontier-Bench и независимыми результатами GDPval-AA v2 от Artificial Analysis. Тесты самого производителя отмечены отдельно.
Обзор Claude Opus 5: короткий ответ
| Ваша нагрузка | С чего начать | Почему |
|---|---|---|
| Функции в нескольких файлах, сложная отладка, долгие запуски агента | Opus 5 с effort high | Лучший баланс качества и расходов; переходить на xhigh стоит только по результатам своих тестов |
| Обычный код, поддержка, извлечение данных, большой объем | Sonnet 5 | Ниже цена токена и меньше сравнительная задержка |
| Действующая интеграция Opus 4.8 | Протестировать и перейти на Opus 5 | Та же стандартная цена и более сильные публичные результаты; изменения поведения требуют регрессии |
| Максимальная способность при вторичной роли цены | Сравнить Opus 5 и Fable 5 | У Fable выше заявленный потолок, но Opus вдвое дешевле и близок к нему или лучше на ряде открытых задач |
Главное улучшение не в одноразовой генерации кода. Оно в способности не терять цель в длинной задаче: искать первопричину вместо маскировки симптома, пользоваться инструментами до проверки результата и завершать работу без заглушек.
Что изменилось после Opus 4.8
| Характеристика | Claude Opus 5 |
|---|---|
| ID модели API | claude-opus-5 |
| Контекст | 1 миллион токенов, значение по умолчанию и максимум |
| Максимальный синхронный вывод | 128 000 токенов |
| Надежная граница знаний | Май 2026 года |
| Стандартная цена API | $5 / миллион входных токенов; $25 / миллион выходных |
| Prompt cache | $6,25 / миллион за запись на 5 минут; $10 на 1 час; $0,50 за hit |
| Thinking | Adaptive thinking включен по умолчанию |
| Уровни effort | low, medium, high, xhigh, max; по умолчанию high |
Основные лимиты совпадают с Opus 4.8, но рабочее поведение изменилось. Opus 5 по умолчанию включает thinking, надежнее превращает увеличение effort в качество и снижает минимальную длину кэшируемого промпта с 1024 до 512 токенов. Бета-функция изменения инструментов в середине диалога позволяет добавлять и убирать их без сброса prompt cache.
Fast mode доступен как research preview только в Claude API. По данным Anthropic, он работает примерно в 2,5 раза быстрее обычного режима, но удваивает цену до $10 за вход и $50 за выход на миллион токенов. Это покупка меньшей задержки, а не скидка.
Бенчмарки: сильные цифры и важные оговорки
Frontier-Bench дает Opus 5 большой отрыв
В публичной таблице Frontier-Bench v0.1 связка Opus 5 и mini-SWE-agent получила 43,53% +/- 1,65% решенных задач. Там же Fable 5 показывает 33,78%, а Opus 4.8 — 21,08%. Опубликованный результат Opus 5 примерно вдвое выше Opus 4.8 и почти на десять пунктов выше Fable 5.
Это важный сигнал, но не полностью нейтральный лабораторный тест. В сноске Anthropic указано, что запуск проводился внутри компании на GKE и использовал среднее пяти попыток на задачу. При отказе классификатора безопасности для Opus 5 или Fable 5 применялся fallback на Opus 4.8. Результат подтверждает заметный прогресс в сложной агентной работе, но не обещает одинаковый прирост в любом репозитории.
GDPval-AA дает самый убедительный независимый сигнал
GDPval-AA v2 от Artificial Analysis включает 220 реальных рабочих заданий из 44 профессий. Модели работают в агентном цикле с shell и веб-доступом, создают документы, таблицы, презентации и диаграммы, после чего слепые попарные сравнения формируют рейтинг Elo.
| Модель и effort | Elo GDPval-AA v2 | Интервал в таблице |
|---|---|---|
Opus 5, max | 1861 | -25 / +25 |
Opus 5, xhigh | 1827 | -24 / +24 |
Fable 5, max | 1747 | -17 / +17 |
Opus 5, high | 1741 | -23 / +23 |
GPT-5.6 Sol, max | 1735 | -17 / +17 |
Opus 5, medium | 1632 | -22 / +22 |
Sonnet 5, max | 1603 | -17 / +17 |
Opus 4.8, max | 1593 | -16 / +16 |
Opus 5, low | 1454 | -20 / +20 |
Важны два вывода. Во-первых, Opus 5 на max и xhigh уверенно возглавляет этот независимый рейтинг. Во-вторых, effort заметно влияет на результат: между low и max — 407 пунктов Elo. На стандартном high интервалы Opus 5, Fable 5 и GPT-5.6 Sol пересекаются, поэтому разницу в шесть пунктов нельзя называть убедительной победой.
Anthropic также сообщает, что на CursorBench Opus 5 с max отстает от пика Fable 5 менее чем на 0,5% при вдвое меньшей стоимости задачи, втрое опережает следующую модель на ARC-AGI 3 и превосходит лучший результат Fable 5 на OSWorld 2.0 чуть более чем за треть стоимости. Это полезные ориентиры, но они взяты из релизных материалов, поэтому мы придаем им меньше веса, чем GDPval-AA.
Где улучшение выглядит реальным
Длительное программирование. В руководстве Anthropic выделены функции в нескольких файлах, большие рефакторинги и задачи полного цикла. Frontier-Bench соответствует этому позиционированию. Практический выигрыш — меньше незавершенных заглушек и реже требуется вмешательство человека посреди работы.
Отладка и code review. Первые пользователи отмечают более точный поиск первопричины и меньше поверхностных исправлений. Anthropic утверждает, что качество ревью сохраняется и при меньшем effort. Команде все равно нужно измерять ложные срабатывания и пропуски на своих pull request: отзывы запуска не заменяют локальную оценку.
Визуальные и офисные задачи. Opus 5 сильнее в графиках, диаграммах, воспроизведении интерфейсов, сложных таблицах и презентациях. Преимущество должно быть больше, когда агент может открыть результат и итеративно исправить его, а не просто один раз вывести код.
Самопроверка. Модель чаще проверяет работу без отдельной просьбы. Это полезно в открытых задачах, но старые указания вроде «перепроверь все» могут привести к повторным проверкам, лишним токенам и чрезмерному делегированию.
Для точной правки одного файла с ясным критерием приемки разница меньше. Дешевая модель может закончить задачу раньше, чем глубокое рассуждение Opus 5 успеет окупиться.
Цена Claude Opus 5 в реальной задаче
Для задачи со 100 000 некэшированных входных и 10 000 выходных токенов расчет по стандартному прайсу выглядит так:
| Модель | Стандартная цена вход / выход | Цена примера |
|---|---|---|
| Claude Fable 5 | $10 / $50 за миллион | $1,50 |
| Claude Opus 5 | $5 / $25 за миллион | $0,75 |
| Claude Opus 4.8 | $5 / $25 за миллион | $0,75 |
| Claude Sonnet 5 | $3 / $15 за миллион | $0,45 по стандартной цене |
До 31 августа 2026 года для Sonnet 5 действует стартовый тариф $2 / $10, поэтому в период акции пример стоит $0,30. Таблица не включает стоимость инструментов и цены посредников.
Контекст в миллион токенов не является бесплатной емкостью. Первичное заполнение окна стоит $5 только за вход, а чтение того же миллиона из кэша — $0,50. Поэтому prompt caching радикально меняет экономику повторного чтения репозитория или базы знаний. Запись на 5 минут стоит $6,25 за миллион, на 1 час — $10.
Цена токена не равна цене завершенной задачи. Больший effort может добавить thinking и вызовы инструментов, но сильная модель способна закончить за меньшее число шагов. Сравнивайте стоимость успешного результата. На странице Claude Opus 5 текущая цена OmniaKey показана отдельно от стандартной цены Anthropic.
Кому стоит переходить
Пользователям Opus 4.8: переходите после целевой регрессии. Цена и контекст не изменились, поэтому экономического смысла оставаться мало, если Opus 5 улучшает вашу долю завершенных задач. Проверьте длину ответа, thinking, вызовы инструментов и задержку.
Пользователям Sonnet 5: не переносите все запросы. Оставьте Sonnet для обычных шагов, а неоднозначные ошибки, архитектуру, большие рефакторинги и дорогие сбои отправляйте в Opus 5. Маршрутизация по типу задачи обычно выгоднее одной модели для всего.
Пользователям Fable 5: сначала испытайте Opus 5 в чувствительной к цене нагрузке. Fable остается самой мощной общедоступной моделью по позиционированию Anthropic, но открытые данные уже показывают сценарии, где Opus близок, равен или лучше при половине цены. Платите премию только там, где собственные тесты подтверждают разницу.
Командам безопасности: не переносите общий рейтинг на offensive security. Anthropic намеренно не обучала Opus 5 как наступательную кибермодель; в разработке эксплойтов она уступает Mythos 5. Поиск уязвимости и создание рабочего эксплойта — разные задачи.
Риски миграции
- Точно замените ID
claude-opus-4-8наclaude-opus-5. ID Claude 5 без даты тоже является закрепленным snapshot, а не меняющимся alias. - Пересмотрите
max_tokens: thinking включен по умолчанию, и лимит охватывает рассуждение вместе с видимым ответом. - Не сочетайте
thinking: {"type": "disabled"}сxhighилиmax: API вернет HTTP 400. Для экономии оставьте thinking и снизьте effort. - Меньший effort не гарантирует короткий видимый ответ. Отдельно попросите модель отвечать кратко.
- Уберите старые инструкции, принуждающие к проверке или запуску субагентов. Opus 5 и так чаще делает и то, и другое.
- Заново проверьте все уровни effort на своих задачах. Anthropic советует начать с
high, подняться доxhighдля сложных агентов и применятьlowилиmedium, если качество сохраняется.
Разумный rollout сравнивает фиксированный набор задач на medium, high и xhigh; фиксирует успех, время ручной правки, задержку, вход, кэш, выход и стоимость инструментов; затем маршрутизирует по классу задачи. Один эффектный диалог — не оценка.
Итог
Claude Opus 5 — лучший стандартный выбор Anthropic для разработчиков, чьи дорогие задачи длинны, неоднозначны и требуют многих инструментов. Пользователи Opus 4.8 получают существенный опубликованный прирост при той же стандартной цене, а результаты уровня Fable становятся доступнее.
Но это не универсальная модель. Sonnet 5 экономичнее в рутине, max может потратить выгоду на дополнительные токены, а значительная часть ранних доказательств принадлежит Anthropic. Начинайте с high, измеряйте стоимость завершенной задачи и повышайте уровень выборочно.
Частые вопросы
Claude Opus 5 лучше Opus 4.8?
По доступным открытым данным — да. Frontier-Bench показывает 43,53% против 21,08%, а GDPval-AA — 1861 против 1593 Elo на max. Стандартная цена одинакова, но промпты и агентный harness нужно протестировать.
Claude Opus 5 или Sonnet 5?
Opus 5 лучше для сложных рассуждений и долгих агентов; Sonnet 5 дешевле и быстрее в рутинной работе. Маршрутизируйте по задачам вместо оплаты Opus для каждого запроса.
Сколько стоит Claude Opus 5?
Стандартная цена Anthropic — $5 за миллион входных и $25 за миллион выходных токенов. Cache hit стоит $0,50. Fast mode стоит $10 и $50 соответственно.
У Claude Opus 5 есть контекст 1M?
Да. Миллион токенов — значение по умолчанию и максимум, синхронный вывод достигает 128 000 токенов. Клиент или gateway может иметь более низкий лимит.
Какой effort выбрать?
Начните с high. Используйте medium, если свои тесты сохраняют качество, xhigh для сложного программирования и долгих агентов, а max — только при измеримой пользе от неограниченного расхода.