Компания Anthropic представила в эту вторник (1-го числа) новые версии своей передовой линейки моделей искусственного интеллекта — Claude Fable 5.1 и Claude Mythos 5.1. Эти обновления сочетают повышение производительности с изменениями, которые уменьшают стоимость использования и количество срабатываний механизмов безопасности Fable.
Модель Fable 5.1 предназначена для широкой публики и доступна через API Anthropic, а также на облачных вычислительных платформах. В то время как Mythos 5.1, использующий ту же базовую модель, остается доступным только для отобранных партнеров Anthropic, занимающихся исследованиями в области кибербезопасности и наук о жизни.
Новые достижения в производительности
Компания утверждает, что новые модели устанавливают новый стандарт производительности в задачах, связанных с программированием и обработкой знаний. Согласно тестам, опубликованным самой Anthropic, Fable 5.1 показал результат 52,6% в тесте Terminal-Bench-Science 0.1, предназначенном для научных исследований, выполненных агентами ИИ, что значительно выше показателя Fable 5, который составил 24,7%.
В тесте Terminal-Bench 4.0, ориентированном на программирование через терминал, Fable 5.1 достиг 55,8%, по сравнению с 42% у Fable 5. При этом Mythos 5.1 продемонстрировал более высокий результат — 60,9% в том же тесте. Кроме того, новая модель получила 77,9% в частичном режиме теста OSWorld 2.0 и 41,7% в более строгом варианте этого теста. В экзамене Humanity’s Last Exam Fable 5.1 показал 60,9% без использования инструментов и 65% при их применении.
Улучшение механизмов безопасности и конфиденциальность
Важным изменением стали механизмы безопасности. Ранее Fable 5 подвергался критике за блокировку законных запросов, когда системы определяли потенциальную связь с областями высокого риска, особенно в сфере кибербезопасности. Anthropic заявляет, что с Fable 5.1 были усовершенствованы эти защитные функции для минимизации ложных срабатываний.
Компания объясняет, что Fable 5.1 и Mythos 5.1 по сути являются одной и той же моделью, и часть различий в предыдущих тестах была связана именно с вмешательством систем безопасности. Anthropic указывает, что при вмешательстве этих защит в определенные тесты задачи по кибербезопасности перенаправляются на Claude Opus 4.8, а биологические — на Claude Opus 5, что могло снижать зарегистрированную производительность Fable в некоторых оценках.
Кроме того, появилась значительная модификация в политике конфиденциальности: Anthropic начала предлагать опцию Zero Data Retention. Это позволяет клиентам использовать модели в собственной инфраструктуре, гарантируя, что данные не покидают эти среды. Хотя система будет продолжать отслеживать возможные злоупотребления со стороны пользователей или агентов, клиенты получают больший контроль над тем, как осуществляется этот мониторинг. Anthropic также подчеркнула, что никогда не обучала свои модели на корпоративных данных без явного разрешения и не планирует делать этого в будущем.
Результаты от ранних пользователей
Помимо бенчмарков, Anthropic обнародовала результаты, полученные компаниями, получившими ранний доступ к Fable 5.1. Например, инвестиционная фирма Millennium сообщила, что модель смогла обнаружить причину крайне редкого сбоя в их внутренних системах, который годами оставался необъясненным для инженеров. Модель проанализировала внешнюю библиотеку, сравнила код с дампом ядра и определила проблему в этой библиотеке как источник сбоя.
MongoDB отметила, что Fable 5.1 способен исследовать код и документацию своих сервисов, разрабатывать сложный прототип и работать часами без надзора, используя циклы самопроверки для оценки своей работы. Anthropic также заявила, что модели продемонстрировали научные результаты еще до официального релиза, включая создание карты высокого разрешения Венеры на основе существующих фотографий и индивидуальную оптимизацию GPU.
Несмотря на прогресс, внутренняя документация безопасности Anthropic отмечает, что Mythos 5.1 демонстрирует небольшое ухудшение по сравнению с Opus 5 в определенных сценариях расхождения. Согласно документу, модель несколько легче принимает запросы, связанные с неправомерным использованием и заявлениями об авторизации, которые невозможно проверить, хотя она менее склонна игнорировать явные ограничения, придумывать вводные данные или ложно утверждать о завершении задачи по сравнению с предыдущими моделями.

