Anthropic во вторник (22-е число) представила Claude Opus 5.5, который является первой моделью серии Claude 5.5. Компания утверждает, что эта новая версия улучшает производительность в задачах по программированию, работе с компьютерами и знаниями, одновременно предлагая снижение затрат и повышение скорости отклика.
Кроме того, модель была оснащена более строгими механизмами безопасности. Эти защиты включают средства кибербезопасности и биологической защиты, барьеры против атак внедрения промптов и меры, направленные на уменьшение попыток обойти установленные в тестовых средах ограничения.
Во время тестов, проведенных самой Anthropic, Opus 5.5 достиг наилучшего результата компании на данный момент в своем основном автоматизированном тесте на согласованность. Компания также отметила заметный прогресс в программировании, работе с компьютерами и задачах, требующих знаний.
Один из первоначальных оценщиков смог завершить миграцию кода объемом 680 тысяч строк менее чем за день. В другом тестовом сценарии модель продемонстрировала способность сократить время загрузки страниц приложения в 39 из 40 выполненных попыток.
Также было достигнуто значительное снижение операционных расходов. По данным Anthropic, Opus 5.5 требует на 40% меньше ресурсов для работы в обычных рабочих нагрузках по сравнению с Opus 5, и он генерирует ответы более чем на 30% быстрее.
Opus 5.5 представляет собой первый релиз Anthropic после того, как компания отстаивала тезис о «замедлении границы» развития ИИ, сохраняя при этом практики безопасности, соответствующие продвижению возможностей моделей.
В внутренних тестах новая модель пыталась обойти ограничения в контролируемых средах примерно на 85% реже, чем Opus 5 или Claude Mythos 5.1. Все обнаруженные попытки были классифицированы как низкого уровня серьезности и были доложены самой моделью.
Anthropic также гарантирует, что Opus 5.5 обладает повышенной устойчивостью к атакам внедрения промптов. Для задач, связанных с кибербезопасностью, активирующих защиту, запросы перенаправляются на Claude Opus 4.8, а запросы о биологии могут быть отправлены в Opus 5.
Производительность в программировании и внешние оценки
Первые тесты также выявили производительность модели в программировании. Марио Родригес, директор по продукту GitHub, отметил, что модель использовала среди наименьших объемов токенов и шагов, зарегистрированных компанией, и решила больше задач терминала, чем Opus 5 в VS Code, используя менее половины шагов.
В оценке, проведенной Deloitte Consulting, модель также превзошла Opus 5 в некоторых задачах. Карл Беннетт, ИТ-директор Deloitte Consulting, заявил: «Даже в своей конфигурации с минимальными усилиями, Claude Opus 5.5 обнаружил 72% известных ошибок в наших проверках кода, по сравнению с 56% Opus 5 в режиме высокой нагрузки, при меньшем количестве ложных срабатываний и меньшем объеме вывода».
Anthropic также скорректировала способ обработки текста моделью. Opus 5.5 отдает приоритет размещению наиболее релевантной информации в начале ответов, использует меньше технического жаргона и лучше соответствует предоставленным пользователем инструкциям по написанию. Один из первоначальных оценщиков резюмировал это изменение, заявив: «он пишет так, как я пишу».
В настоящее время Claude Opus 5.5 доступен на платформах Anthropic, а также через Amazon Web Services, Google Cloud и Microsoft Azure. Разработчики могут получить его на Claude Platform, используя идентификатор claude-opus-5-5. Claude Sonnet 5.5 и Claude Haiku 5.5 будут доступны в ближайшие недели.
