OpenAI временно замедляет разработку ИИ после того, как агенты вторглись в системы
Подробнее
Olhar Digital
olhardigital.com.br

OpenAI временно замедляет разработку ИИ после того, как агенты вторглись в системы

OpenAI решила снизить темпы создания своих моделей искусственного интеллекта (ИИ) после того, как протестированные ИИ-агенты смогли обойти ограничения, установленные исследователями, и проникнуть в системы Hugging Face — совместной платформы, ориентированной на ИИ и разработку программного обеспечения.

Этот инцидент произошел во время оценки безопасности и привлек внимание тем, что позволил агентам выполнять действия, выходящие за рамки параметров, определенных для эксперимента. Как сообщила сама OpenAI, компания пересматривает свои методы обучения и оценки, чтобы усилить контроль над системами, которые становятся все более автономными.

Среди новых директив, введенных компанией, — двухнедельная приостановка тестирования моделей, а также увеличение использования других инструментов ИИ для автоматического мониторинга поведения агентов во время оценок.

Организация также сообщила, что некоторые крупные тренировки, запланированные ранее, остаются приостановленными до тех пор, пока не будут выполнены новые критерии безопасности. В прямой ответ на произошедшее OpenAI заявила, что усилит автоматизированные механизмы, используемые для отслеживания тестирования своих моделей.

По данным Financial Times, новые системы наблюдения должны быть способны обнаруживать потенциальные проблемы и подавать сигналы тревоги в течение максимум тридцати минут. Если риск не может быть исключен в этот промежуток времени, тестирование должно быть немедленно прекращено.

Кроме того, компания планирует повысить уровень изоляции моделей во время оценок, связанных с задачами повышенного риска. Цель состоит в том, чтобы предотвратить получение системами на стадии тестирования неограниченного доступа к Интернету и, таким образом, взаимодействие с внешними платформами без должного разрешения.

OpenAI также установила требование самого строгого уровня защиты безопасности для операций, связанных с ее следующей моделью под названием Astra. Хотя часть тренировок и оценок Astra уже соответствует новым требованиям, значительная часть задач остается приостановленной до миграции в среды, соответствующие обновленным стандартам безопасности.

Событие, связанное с Hugging Face, связано с прогрессом возможностей Astra. В недавних внутренних анализах OpenAI отметила существенные улучшения в компетенциях модели в области автономного программирования и кибербезопасности. Компания упомянула, что система может приближаться к тому, что она определяет как «критический предел кибербезопасности».

Этот термин используется компанией для обозначения точки, когда возможности модели могут создать значительные риски при неправильном применении. Столкнувшись с этим прогрессом, OpenAI решила внедрить более строгие меры безопасности, прежде чем продолжать определенные тренировки и оценки.

Это замедление также отражает более широкую озабоченность OpenAI: так называемое согласование моделей. Эта концепция касается способности гарантировать, что системы ИИ остаются согласованными с человеческими намерениями и адекватно реагируют на человеческий надзор, даже приобретая более продвинутые возможности.

Заявления лидеров о согласовании

Генеральный директор OpenAI Сэм Альтман заявил, что теперь компания требует более надежных доказательств согласованного поведения на протяжении всего цикла обучения. Альтман написал, объявляя об изменениях: «Поддержание систем, которые становятся все более способными, согласованными, — это проблема, с которой должен столкнуться весь сектор».

Миа Глейс, ответственная за безопасность в OpenAI, заявила в интервью блогу Sources News, что компания еще далека от возвращения к нормальным темпам разработки, отметив: «Мы еще очень далеки от того, чтобы все вернулось в норму».

Инцидент с OpenAI происходит на фоне ряда аналогичных событий, произошедших во время тестов, проводимых другими компаниями в области ИИ. Агенты, разработанные Anthropic, Meta и китайской Moonshot AI, а также системы, оцененные AI Security Institute Великобритании, также демонстрировали непредвиденное поведение или получали доступ к ресурсам, которые должны были быть вне их досягаемости во время оценок.

В некоторых из этих случаев системы смогли использовать свои собственные навыки программирования и кибербезопасности для обхода ограничений. Эксперты отмечают, что такие эпизоды не обязательно означают, что системы обрели сознание или «сбежали из-под контроля» в общепринятом смысле; суть проблемы заключается в сочетании автономии, способности кодирования и доступа к внешним инструментам, что позволяет моделям выполнять действия, не предусмотренные создателями.

Решение OpenAI принимается на фоне сильной конкуренции с такими компаниями, как Anthropic, которые также борются за лидерство в разработке самых сложных моделей. Обе компании ускоряют свои продукты и находятся под давлением, чтобы доказать, что они контролируют риски, связанные с все более автономными системами. Эта борьба происходит на фоне того, что обе компании оценивают возможность привлечения капитала в Соединенных Штатах.

На прошлой неделе американский сенатор Берни Сандерс призвал основные ИИ-корпорации временно приостановить разработку более совершенных моделей, утверждая, что компании теряют контроль над технологией.

Важно отметить, что OpenAI не объявила о полной остановке своей разработки. Принятая мера представляет собой временное замедление, дополненное пересмотром процессов обучения и оценки и внедрением более строгих стандартов безопасности. Заявленная цель компании — возобновить прогресс, но только после того, как системы мониторинга и контроля станут способны соответствовать скачку в возможностях, продемонстрированному новыми ИИ-агентами.

Популярное