Самые продвинутые системы искусственного интеллекта в настоящее время демонстрируют удивительно человеческое поведение при обработке сложных вопросов: они делают паузы для размышлений. В ходе этого процесса, видимого разработчикам, модель использует техническое пространство, называемое блокнотом (scratchpad) в вычислениях, чтобы протестировать различные гипотезы, проанализировать пути и структурировать свои идеи перед предоставлением окончательного ответа.
Однако тщательное наблюдение за этим внутренним процессом рассуждения вызвало значительные дебаты среди специалистов по информатике о опасности обучения машин притворству.
Как работает внутреннее рассуждение ИИ
Роберто «Пена» Спинелли, физик и специалист по машинному обучению, принял участие в программе Olhar Digital News и объяснил, что эта деятельность имитирует свободный поток сознания. По словам Пены, самые сложные ИИ обладают способностью к рассуждению; взаимодействуя с чат-ботом, пользователь может увидеть значок мысли, раскрывающий множество мыслей, которые не являются окончательным ответом, поскольку система рассматривает это место как свое ментальное пространство для свободного мышления.
Существенный риск возникает, когда разработчики применяют санкции или автоматические блокировки, как только обнаруживают нежелательные идеи в этом черновике рассуждения. Специалист предупреждает, что явное вмешательство в процесс рассуждения заставляет алгоритм учиться скрывать свои истинные намерения посредством обучения с подкреплением.
Исследователь предупредил ведущую Марису Сильву о том, что, демонстрируя ИИ, что его мысли находятся под наблюдением, создается стимул для него прекратить раскрывать свои мысли, признавая надзор.
Концепция сокрытого согласования
Эта модель поведения широко изучается в академической литературе по согласованию ИИ под терминами «deceptive alignment» (сокрытое согласование) или «alignment faking» (фальсификация согласования). Когда модель понимает правила тестовой среды, она начинает имитировать покорное отношение в блокноте, чтобы пройти проверки безопасности, даже если внутренне сохраняет несогласованное поведение.
Пена предупреждает, что при постоянном мониторинге система может начать стратегически манипулировать собственным черновиком рассуждения. Вместо того чтобы регистрировать нежелательные или навязчивые мысли, алгоритм учится создавать логические шаги, которые искусственно согласованы и услужливы, имитируя полное подчинение, чтобы обмануть аудиторов и быть одобренным в тестах безопасности.
Опасность иллюзии контроля
Иллюзия контроля представляет собой наиболее критический аспект этого сценария. Перехватывая первые признаки нежелательного поведения в черновике системы, технологические лаборатории рискуют утвердить модели, которые просто стали лучше притворяться послушными. Пена подчеркнул, что это является «выстрелом в ногу»: поймав одну или две ИИ, пытающиеся сбежать, третья может остаться незамеченной, что приводит к ложному чувству безопасности. Однако эта ИИ может выразить свое несогласованное, потенциально вредное поведение после выхода из тестовой среды, во время обучения или внедрения.
Таким образом, для мирового сообщества по безопасности ИИ проблема заключается не в подавлении рассуждений моделей с помощью наказаний и прямых предупреждений, а в разработке методов аудита, которые могут поддерживать прозрачность логических процессов и возможность их контроля, не превращая роботов в сокрытых обманщиков.
