Anthropic нанимает специалистов с зарплатами, достигающими 455 тысяч долларов США в год, чтобы помочь в тестировании пределов безопасности своих систем искусственного интеллекта (ИИ). Компания поддерживает специализированную команду по безопасности и предотвращению злоупотреблений, охватывающую биологические, химические, взрывчатые, кибернетические, мошеннические, обманные, а также радиологические и ядерные риски.
Доступные должности включают специалистов, ответственных за тестирование систем, расследование угроз и анализ рисков в таких областях, как химия, биология, кибербезопасность, а также ядерное и взрывчатое вооружение. Цель этих вакансий выходит за рамки простого запроса к Claude с просьбой сгенерировать запрещенный ответ для проверки его послушания; Anthropic тестирует свои модели различными способами, чтобы определить, могут ли третьи лица обойти их защитные механизмы и использовать ИИ для нанесения ущерба, стремясь обнаружить недостатки до того, как они будут использованы.
Anthropic управляет командой под названием Frontier Red Team, чья функция заключается в изучении систем ИИ для понимания их возможностей и прогнозирования рисков по мере развития моделей. Это название происходит от концепции 'red teaming' — методологии безопасности, при которой команда берет на себя роль потенциального злоумышленника для поиска уязвимостей в системе. В контексте ИИ это означает поиск способов обхода барьеров безопасности и определение того, может ли модель быть использована для причинения вреда.
Области внимания включают химические, биологические, радиологические и ядерные угрозы, а также кибербезопасность и риски, связанные с автономностью систем. Компания интегрирует тесты, проводимые исследователями, специалистами из различных областей и автоматизированными системами. Anthropic подчеркивает, что сотрудничество с внешними экспертами помогает как в тестировании моделей, так и в разработке новых методов оценки. В зависимости от анализируемого риска, специалисты могут работать с публичными версиями Claude или с некоммерческими моделями, подпадающими под различные механизмы безопасности.
Взгляд экспертов на эту функцию
Габриэль Кунья, специалист по ИИ из Oracle, прокомментировал Olhar Digital, что роль заключается в обеспечении того, чтобы институциональная способность выявлять риски и внедрять контроль соответствовала прогрессу возможностей моделей. Специалисты атакуют систему, чтобы проверить, предоставляет ли модель реальное преимущество по сравнению с тем, что человек мог бы сделать без помощи ИИ.
Сама Anthropic описывает процесс, который начинается с тестов, проводимых экспертами, и может быть расширен с помощью автоматизированных систем. Сначала специалисты определяют тип угрозы, которую необходимо расследовать, и ищут способы побудить систему демонстрировать рискованное поведение. По мере лучшего понимания проблемы тесты могут повторяться в сотнях или тысячах различных сценариев.
Компания также использует модели ИИ для поддержки этой задачи. Одна система может генерировать попытки атаки для тестирования другой модели, а полученные результаты помогают в разработке новых средств защиты. Этот цикл повторяется, чтобы подтвердить, остаются ли барьеры эффективными даже после обнаружения новых тактик атаки.
Основная причина, по которой Anthropic привлекает экспертов из столь разнообразных областей, заключается в том, что сам по себе неадекватный ответ не доказывает, что модель обладает способностью нанести вред в реальном мире. Эксперт должен судить, является ли то, что сгенерировала система, правильным и может ли это быть применено на практике.
Родриго Гава, технический директор Vultus и эксперт по кибербезопасности, подчеркивает: «То, что ИИ отвечает на запрещенный запрос, само по себе не доказывает реального риска». Он добавляет, что акцент должен быть сделан на оценке того, является ли ответ технически точным, операционно осуществимым и значительно ли он уменьшает знания, время или затраты, необходимые для нанесения ущерба. В кибербезопасности он приводит пример: «Код может выглядеть сложным и не работать, в то время как последовательность, казалось бы, безвредной информации может завершить реальную цепочку эксплуатации».
Anthropic применяет ту же логику в своих тестах безопасности. Специалисты сначала определяют, какую угрозу они хотят исследовать, какая информация может быть использована для нанесения ущерба и что потребуется, чтобы модель эффективно помогла кому-либо в этом действии. Например, при оценке биологических рисков более 150 часов было посвящено тестированию с экспертами по биобезопасности.
То же произошло при оценке ядерных рисков. В сотрудничестве с Национальной администрацией по ядерной безопасности США (NNSA) эксперты агентства потратили год на тестирование моделей Claude в контролируемой среде. Эта работа позволила Anthropic создать инструмент, способный идентифицировать разговоры, потенциально связанные с разработкой ядерного оружия. В предварительных тестах инструмент выявил 94,8% запросов, касающихся ядерного оружия, и не зарегистрировал ложных срабатываний в оцениваемом наборе, достигнув общей точности 96,2%. По данным Anthropic, система впоследствии была частично интегрирована в трафик Claude для помощи в обнаружении неправомерного использования.
По словам Гавы, «процесс обычно начинается с модели угрозы: кто потенциальный злоумышленник, какова его цель, какие ресурсы у него есть и что будет считаться успехом». На основе этого разрабатываются сценарии для попытки вызвать поведение, сигнализирующее об уязвимости.
Тесты не ограничиваются прямыми командами к модели. Специалисты могут изучать диалоги на нескольких этапах, переформулировки одного и того же запроса, изменения языка и контекста, использование инструментов, автономных агентов и комбинаций техник. Цель состоит в том, чтобы найти ситуации, когда изолированная защита кажется работоспособной, но может быть обойдена при комбинировании различных ресурсов.
После выявления проблемы экспертами Anthropic может превратить эту ситуацию в тест, который будет воспроизведен в сотнях или тысячах вариаций. Таким образом, компания проверяет, сохраняется ли ошибка, и действительно ли внесенные изменения в модель решили проблему. ИИ также используется в этом процессе: одна модель может генерировать попытки атаки для тестирования другой системы, а полученные результаты используются для разработки новых форм защиты. Процедура повторяется, чтобы гарантировать, что барьеры остаются работоспособными.
Необходимость тестирования моделей возрастает по мере того, как они становятся способными находить способы эксплуатации систем. В мае 2026 года Anthropic заявила, что Claude Mythos Preview способен обнаруживать уязвимости, преобразовывать их в векторы эксплуатации и комбинировать различные этапы для выполнения полных атак.
В другом исследовании Anthropic оценила Claude Opus 4 и Claude Sonnet 4 в задачах кибербезопасности, варьирующихся от индивидуальных упражнений до симуляций сложных сетей. Компания сообщила, что модели продемонстрировали прогресс как в выявлении ошибок, так и в выполнении многофазных атак, хотя по-прежнему сталкивались с трудностями в поддержании длительных планов перед лицом непредвиденных обстоятельств.
Прогресс также заметен в поиске беспрецедентных ошибок, известных как уязвимости нулевого дня. В феврале Anthropic сообщила, что Claude Opus 4.6 значительно улучшил способность находить критические уязвимости в больших масштабах по сравнению с предыдущими версиями. Компания утверждает, что такая возможность может быть использована для укрепления защиты систем.
Для Габриэля Куньи такие случаи помогают обосновать, почему корпорации должны тестировать не только отдельные ответы, но и способность моделей интегрировать различные ресурсы для достижения цели. Чем больше задач выполняет система автономно, тем выше потребность в оценке того, что может произойти при совместном использовании этих компетенций.
Сама Anthropic поддерживает Frontier Red Team для отслеживания этой эволюции. В 2026 году группа опубликовала анализы об эксплуатации уязвимостей, кибератаках и угрозах, связанных с использованием ИИ злонамеренными субъектами. Заявленная цель — понять текущие возможности моделей и спрогнозировать, что может возникнуть с их развитием.
Несмотря на все эти усилия, тесты не гарантируют абсолютную безопасность ИИ. Существует практически бесконечное количество возможных комбинаций команд, контекста, инструментов и поведения модели. Кроме того, новые функции или версии могут вносить уязвимости, отсутствующие в предыдущих оценках.
Главное ограничение заключается в том, что ни одна команда красных команд не может исчерпывающе охватить все сценарии, которые бы с уверенностью подтвердили безопасность ИИ. Модели имеют вероятностную природу, пространство взаимодействия почти бесконечно, а злоумышленники постоянно адаптируют свои тактики.
Родриго Гава, технический директор Vultus, отмечает, что сама Anthropic признает эти ограничения. В анализе безопасности ИИ компания заявляет, что тесты на риски национальной безопасности все еще являются скорее «искусством, чем наукой», поскольку не существует полностью стандартизированного метода для провоцирования вызывающего беспокойство поведения в моделях.
Существует также баланс между двумя типами ошибок: ложноотрицательный результат возникает, когда попытка злоупотребления не обнаруживается и проходит через защитные механизмы. Ложноположительный результат может привести к блокировке законной деятельности из-за ошибочной классификации как опасной.
По этой причине Anthropic внедряет множественные механизмы защиты. К ним относятся тесты безопасности, программы вознаграждения для тех, кто обнаруживает ошибки, мониторинг и автоматизированные системы, предназначенные для выявления попыток обойти барьеры моделей.
В дорожной карте безопасности Frontier (Frontier Safety Roadmap) компания поставила целью разработать к январю 2027 года систему, способную находить новые способы обхода защиты от химического и биологического оружия в крупном масштабе. Anthropic также планирует создавать инструменты для автоматического расследования сложных кибератак с участием Claude.
Открытые вакансии Anthropic иллюстрируют, как эта структура работает на практике. Компания ищет специалистов для различных функций, таких как эксперты по биологической безопасности, химическим и взрывчатым рискам, кибербезопасности, мошенничеству и обману, а также радиологическим и ядерным рискам.
Функции различны. Одна из них — Инженер Красной Команды (Red Team Engineer), ответственный за попытки найти недостатки в системах до того, как они будут использованы. Эта вакансия требует опыта в области безопасности ИИ и тестирования безопасности, а также знаний о том, как обойти барьеры моделей. Объявленный диапазон заработной платы составляет от 320 до 405 тысяч долларов США в год.
Другая должность — менеджер по разведке угроз, связанных с химическими, биологическими, радиологическими, ядерными и взрывчатыми рисками. Специалист будет руководить командой, занимающейся обнаружением и расследованием попыток использования систем Anthropic для этих целей, с годовой зарплатой в размере 455 тысяч долларов США.
Существуют также должности, требующие прямого опыта в области рисков. Например, вакансия, ориентированная на биологическую безопасность, требует минимум восьми лет практического опыта в наук о жизни, а также знаний в области молекулярной биологии, открытия лекарств или вычислительной биологии. Это разнообразие функций демонстрирует, что стратегия Anthropic выходит за рамки простого отказа Claude выполнять определенные запросы; она направлена на найм специалистов для обнаружения уязвимостей, оценки рисков, расследования потенциальных злоупотреблений и преобразования этих открытий в новые формы защиты, признавая, что рост возможностей моделей требует расширения масштаба этой работы.