Разработчики создали инструменты для обхода новой текстовой водяной метки Claude
Подробнее
Tecnoblog
tecnoblog.net

Разработчики создали инструменты для обхода новой текстовой водяной метки Claude

Вскоре после того, как Anthropic обнародовала принцип работы невидимой водяной метки, предназначенной для отслеживания текстов, созданных и измененных Claude, разработчики начали предоставлять инструменты, которые, как утверждается, могут ослабить или удалить эту маркировку.

Первый код был разработан программистом Гийомом Мейером и быстро набрал популярность, собрав более ста тысяч вкладов на GitHub. Мейер заявил на платформе X, что создал удалитель лишь в качестве эксперимента, и что его цель — не борьба с идентификацией контента, а сама методология водяной метки.

Этот механизм обнаружения Claude внедряется в соответствии с Законом ЕС об искусственном интеллекте, который установил обязательность маркировки контента, сгенерированного искусственным интеллектом. В настоящее время около ста девяноста организаций присоединились к кодексу поведения, и ожидается, что текстовая маркировка станет отраслевым стандартом к концу этого года.

Водяная метка Anthropic работает на основе статистического шаблона, установленного в процессе выбора слов. Когда Claude должен выбрать между синонимами, система использует ключ для направления части этих решений, тем самым создавая подпись, поддающуюся обнаружению.

Сама компания подчеркнула, что даже минимальные изменения могут ослабить эту метку. Именно на этом фокусируется инструмент Мейера: текст переписывается, в том числе многократно, с использованием другой языковой модели, которая не использует ту же маркировку.

Было предложено множество других методов, которые быстро появились, следуя схожим процессам, все они основаны на замене синонимов и реорганизации фраз. Поскольку обнаружение зависит от определенного шаблона, такие корректировки могут быть достаточными для снижения вероятности классификации текста как синтетического, что можно достичь простым ручным редактированием.

Технология, используемая Anthropic, основана на SynthID-Text, методе, опубликованном Google DeepMind два года назад. Эта система действует в так называемых 'низкорисковых выборах': когда два слова имеют схожее значение в предложении, ИИ выбирает одно из них, следуя заранее определенному правилу. Цель состоит в том, чтобы сохранить текст естественным для читателя, в то время как последовательность может быть идентифицирована тем, кто обладает ключом проверки.

Anthropic уточняет, что ее проверка указывает на вероятность и не может точно определить, был ли текст полностью сгенерирован ИИ или просто отредактирован моделью. Однако именно потенциальные 'ложноположительные срабатывания' такого рода систем вызывают беспокойство у разработчиков и некоторых специалистов.

Существует опасение, что учебные заведения, университеты, рекрутеры или клиенты начнут использовать детекторы в качестве фактического критерия оценки, что может навредить людям, которые используют ИИ для выполнения определенных задач или которые просто им не пользуются.

С точки зрения пользователей, еще одна критика заключается в том, что внедрение этой технологии может снизить общее качество контента, производимого Claude, поскольку результат должен соответствовать этому стандарту маркировки. В своем описании новой технологии Anthropic гарантирует, что внутреннее тестирование не выявило никакого снижения качества.

Популярное