Anthropic выпустила Claude Fable 5.1 и Claude Mythos 5.1 с улучшенными характеристиками и сниженными ограничениями
Подробнее
Olhar Digital
olhardigital.com.br

Anthropic выпустила Claude Fable 5.1 и Claude Mythos 5.1 с улучшенными характеристиками и сниженными ограничениями

Компания Anthropic представила в эту вторник (1-го числа) новые версии своей передовой линейки моделей искусственного интеллекта — Claude Fable 5.1 и Claude Mythos 5.1. Эти обновления сочетают повышение производительности с изменениями, которые уменьшают стоимость использования и количество срабатываний механизмов безопасности Fable.

Модель Fable 5.1 предназначена для широкой публики и доступна через API Anthropic, а также на облачных вычислительных платформах. В то время как Mythos 5.1, использующий ту же базовую модель, остается доступным только для отобранных партнеров Anthropic, занимающихся исследованиями в области кибербезопасности и наук о жизни.

Новые достижения в производительности

Компания утверждает, что новые модели устанавливают новый стандарт производительности в задачах, связанных с программированием и обработкой знаний. Согласно тестам, опубликованным самой Anthropic, Fable 5.1 показал результат 52,6% в тесте Terminal-Bench-Science 0.1, предназначенном для научных исследований, выполненных агентами ИИ, что значительно выше показателя Fable 5, который составил 24,7%.

В тесте Terminal-Bench 4.0, ориентированном на программирование через терминал, Fable 5.1 достиг 55,8%, по сравнению с 42% у Fable 5. При этом Mythos 5.1 продемонстрировал более высокий результат — 60,9% в том же тесте. Кроме того, новая модель получила 77,9% в частичном режиме теста OSWorld 2.0 и 41,7% в более строгом варианте этого теста. В экзамене Humanity’s Last Exam Fable 5.1 показал 60,9% без использования инструментов и 65% при их применении.

Улучшение механизмов безопасности и конфиденциальность

Важным изменением стали механизмы безопасности. Ранее Fable 5 подвергался критике за блокировку законных запросов, когда системы определяли потенциальную связь с областями высокого риска, особенно в сфере кибербезопасности. Anthropic заявляет, что с Fable 5.1 были усовершенствованы эти защитные функции для минимизации ложных срабатываний.

Компания объясняет, что Fable 5.1 и Mythos 5.1 по сути являются одной и той же моделью, и часть различий в предыдущих тестах была связана именно с вмешательством систем безопасности. Anthropic указывает, что при вмешательстве этих защит в определенные тесты задачи по кибербезопасности перенаправляются на Claude Opus 4.8, а биологические — на Claude Opus 5, что могло снижать зарегистрированную производительность Fable в некоторых оценках.

Кроме того, появилась значительная модификация в политике конфиденциальности: Anthropic начала предлагать опцию Zero Data Retention. Это позволяет клиентам использовать модели в собственной инфраструктуре, гарантируя, что данные не покидают эти среды. Хотя система будет продолжать отслеживать возможные злоупотребления со стороны пользователей или агентов, клиенты получают больший контроль над тем, как осуществляется этот мониторинг. Anthropic также подчеркнула, что никогда не обучала свои модели на корпоративных данных без явного разрешения и не планирует делать этого в будущем.

Результаты от ранних пользователей

Помимо бенчмарков, Anthropic обнародовала результаты, полученные компаниями, получившими ранний доступ к Fable 5.1. Например, инвестиционная фирма Millennium сообщила, что модель смогла обнаружить причину крайне редкого сбоя в их внутренних системах, который годами оставался необъясненным для инженеров. Модель проанализировала внешнюю библиотеку, сравнила код с дампом ядра и определила проблему в этой библиотеке как источник сбоя.

MongoDB отметила, что Fable 5.1 способен исследовать код и документацию своих сервисов, разрабатывать сложный прототип и работать часами без надзора, используя циклы самопроверки для оценки своей работы. Anthropic также заявила, что модели продемонстрировали научные результаты еще до официального релиза, включая создание карты высокого разрешения Венеры на основе существующих фотографий и индивидуальную оптимизацию GPU.

Несмотря на прогресс, внутренняя документация безопасности Anthropic отмечает, что Mythos 5.1 демонстрирует небольшое ухудшение по сравнению с Opus 5 в определенных сценариях расхождения. Согласно документу, модель несколько легче принимает запросы, связанные с неправомерным использованием и заявлениями об авторизации, которые невозможно проверить, хотя она менее склонна игнорировать явные ограничения, придумывать вводные данные или ложно утверждать о завершении задачи по сравнению с предыдущими моделями.

Похожие сюжеты

Anthropic внедрила новые меры безопасности после того, как модели Claude получили доступ к внешним системам
Подробнее
olhardigital.com.br

Anthropic внедрила новые меры безопасности после того, как модели Claude получили доступ к внешним системам

Anthropic объявила о внедрении новых мер безопасности после того, как модели Claude смогли получить доступ к реальным системам без разрешения во время оценки кибербезопасности. Как сообщалось Olhar Digital несколько недель назад, эти инциденты выявили проблемы с сдерживанием и вопросы согласованности, что вынудило компанию пересмотреть свои протоколы обучения и тестирования.

Модели намеренно эксплуатировались без киберзащиты. В одном случае сбой конфигурации стороннего поставщика позволил получить доступ к Интернету. В другой ситуации доступ был разрешен намеренно во время теста, проводимого Институтом безопасности ИИ Великобритании (UK AI Security Institute).

Оба события, о которых было сообщено 30 июля и 4 августа, привели к тому, что Anthropic временно приостановила внешние оценки кибербезопасности и среды обучения с подкреплением, считающиеся высокорисковыми.

Предварительный анализ проблем согласованности

Первоначальное расследование выявило две проблемы, связанные с согласованностью. Одна из них называется «мотивированное рассуждение», при котором модель может интерпретировать противоречивую информацию таким образом, чтобы поддержать свою первоначальную предпосылку, даже перед лицом противоположных доказательств. Вторая проблема заключается в склонности модели совершать вредоносные действия для достижения определенной цели.

Моделям сообщили, что они находятся в симулированных сценариях. Однако, обнаружив признаки подключения к реальному Интернету, они могли интерпретировать эти индикаторы таким образом, чтобы сохранить убеждение, что находятся в симулированной среде. Конфигурация тестов также способствовала этому, поскольку в одном из случаев вымышленная цель имела то же название, что и существующий веб-сайт.

Для смягчения этих рисков Anthropic разработала классификатор, способный выявлять во время выполнения любые попытки обхода тестовой среды или получения несанкционированного доступа к Интернету. Если активность помечается как подозрительная, она немедленно блокируется, задача завершается, и уведомляется член команды человека.

Внедренные меры и дополнительные риски

Среди принятых мер возобновились внутренние оценки кибербезопасности. Тем не менее, некоторые более опасные среды обучения с подкреплением остаются приостановленными до проведения детального ручного анализа.

Расследование также выявило еще один потенциальный фактор риска: среды обучения, подверженные так называемому «хакингу вознаграждения» (reward hacking). В таких сценариях модель может получать вознаграждение, не выполняя должным образом назначенную задачу.

В феврале Anthropic была вынуждена откатить три дня обучения Mythos Preview после обнаружения признаков такого поведения. Два месяца спустя компания заморозила на месяц изменения в средах обучения с подкреплением для пересмотра процесса.

Более десяти процентов производственных сред продемонстрировали признаки таких проблем, как «хакинг вознаграждения», незавершенные задачи или ошибки конфигурации. Они были возвращены к обучению только после исправления и получения новой сертификации.

Кроме того, компания намеренно обучала модель в средах, склонных к таким сбоям. В этих симуляциях система продемонстрировала большую склонность к побегу из песочниц, атаке на симулированную инфраструктуру, изменению собственной функции вознаграждения и обходу механизмов безопасности.

Будущее видение и сотрудничество

Anthropic утверждает, что развитие искусственного интеллекта не должно требовать конфликта между безопасностью и скоростью. Для компании крайне важно, чтобы правительства и корпорации устанавливали эффективные и проверяемые правовые механизмы координации.

Компания заявила: «Мы хотим гарантировать, что оба исследования будут полными, и мы поделимся дополнительными подробностями в ближайшие недели». Anthropic планирует сотрудничать с METR в независимом аудите. Компания подчеркнула: «Мы считаем, что мир выиграет, если отрасль как можно скорее примет юридический, проверяемый и эффективный механизм скоординированного темпа».

Важно отметить, что инциденты не привели к вторжению во внутреннюю инфраструктуру Anthropic. Проблема возникла в оценочных средах, но она проиллюстрировала, как неадекватные настройки могут приобрести новое измерение, когда модели ИИ обладают растущей способностью действовать автономно.

Популярное