Компания Anthropic представила Claude Opus 5 — новую флагманскую модель искусственного интеллекта. Разработчики заявляют, что она демонстрирует передовые результаты в программировании и задачах, связанных с интеллектуальной работой, при той же стоимости использования, что и её предшественник.

Новая модель уже доступна на всех платформах Anthropic по цене 5 долларов за миллион входных токенов и 25 долларов за миллион выходных токенов. Пользователи могут выбрать ускоренный режим, работающий примерно в 2,5 раза быстрее стандартного, хотя его использование обходится в два раза дороже.

Главные мысли за 1 минуту

  • Anthropic выпустила Claude Opus 5 — флагманскую модель с акцентом на программирование и интеллектуальную работу.
  • Стоимость осталась прежней: 5 долларов за миллион входных токенов и 25 долларов за миллион выходных.
  • В тесте Frontier-Bench v0.1 модель превзошла другие проверенные системы и улучшила результат Opus 4.8 более чем в два раза при меньшей стоимости задачи.
  • В тесте ARC-AGI 3, оценивающем решение новых задач, результат модели в три раза выше, чем у ближайшего конкурента.
  • Opus 5 стала моделью по умолчанию для пользователей Claude Max и самой мощной для подписчиков Claude Pro.

Программирование: быстрее, дешевле, точнее

Anthropic разработала Opus 5 для выполнения сложных задач программной инженерии, автоматизации бизнес-процессов, научных исследований и взаимодействия с компьютером. Компания позиционирует модель как инструмент для ежедневного использования, а не систему, которую следует применять только для самых сложных задач.

искусственный интеллект
Фото: Pixabay / искусственный интеллект. Иллюстративное фото

В тесте Frontier-Bench v0.1, предназначенном для оценки возможностей в программной инженерии, Opus 5, согласно данным Anthropic, превзошла другие проверенные модели и более чем в два раза улучшила результат по сравнению с Opus 4.8 при меньшей стоимости выполнения одной задачи.

В тесте CursorBench 3.2 при максимальном уровне усилий новая модель отстала менее чем на 0,5% от максимального результата Claude Fable 5. При этом стоимость выполнения одной задачи оказалась в два раза ниже.

Наука и автоматизация: не только код

Преимущества Claude Opus 5, по данным Anthropic, распространяются и на другие области. В тесте ARC-AGI 3, оценивающем способность искусственного интеллекта решать новые и ранее неизвестные задачи, модель показала результат в три раза выше, чем ближайшая система-конкурент.

В тесте Zapier AutomationBench, который проверяет способность моделей выполнять бизнес-задачи от начала до конца, Opus 5 достигла примерно в 1,5 раза более высокой доли успешных решений по сравнению со следующей лучшей моделью при одинаковой стоимости одной задачи.

Модель также превзошла другие системы в тесте OSWorld 2.0, предназначенном для оценки возможностей взаимодействия с компьютером. По данным Anthropic, Opus 5 показала результат выше лучшего результата Fable 5 при стоимости выполнения задачи чуть более чем в три раза ниже.

Anthropic также сообщила об улучшении возможностей модели в научных исследованиях, особенно в области наук о жизни. Во внутреннем тесте по органической химии, включавшем определение молекулярных структур на основе данных спектроскопии, Opus 5 набрала на 10,2 процентного пункта больше, чем Opus 4.8. На задачах, связанных с влиянием изменений последовательности белков на их функции, улучшение составило 7,7 процентного пункта.

Самопроверка и креативность: модель учится на ошибках

Компания заявляет, что новая модель стала лучше проверять собственные результаты и предпринимать повторные попытки, если первоначальный подход оказывается неудачным.

В одном из тестов Opus 5 получила изображение детали механизма, но не имела прямого способа просмотреть его и должна была воссоздать деталь в виде трёхмерной модели FreeCAD. Вместо того чтобы остановиться на невозможности напрямую изучить изображение, модель, согласно Anthropic, самостоятельно создала компьютерное зрение для извлечения геометрии из исходных пикселей изображения, а затем использовала полученные данные для восстановления детали. Opus 5 неоднократно успешно справлялась с этой задачей, тогда как конкурирующие модели не смогли добиться успеха после пяти попыток в аналогичных условиях.

Безопасность: строже, но не везде

Одновременно с ростом возможностей Claude Opus 5 Anthropic представила дополнительные меры безопасности. Компания заявляет, что новая модель стала наиболее соответствующей требованиям безопасности среди всех её систем на основе автоматизированного поведенческого тестирования и демонстрирует более низкую склонность к обманному поведению по сравнению с недавними моделями.

При этом Opus 5 уступает модели Mythos 5 в возможностях наступательной кибербезопасности. В тестировании Anthropic OSS-Fuzz обе системы показали сопоставимые результаты при обнаружении уязвимостей в программном обеспечении, однако Opus 5 значительно хуже справлялась с разработкой эксплойтов.

Anthropic также ввела более строгие ограничения для некоторых видов кибербезопасных задач, включая поиск уязвимостей на основе анализа бинарных файлов, тестирование на проникновение и создание эксплойтов. Запросы, которые системы безопасности сочтут потенциально опасными, могут автоматически перенаправляться на модель Opus 4.8.

Новые функции для разработчиков

Вместе с запуском Claude Opus 5 Anthropic представила бета-функции для разработчиков. Они позволяют менять доступные инструменты прямо во время диалога без сброса кэша промптов, а также автоматически перенаправлять отмеченные системой безопасности запросы API на другую модель.

Claude Opus 5 стала моделью по умолчанию для пользователей Claude Max и наиболее мощной моделью, доступной подписчикам Claude Pro.