Anthropic разъяснила принцип работы невидимой водяной метки, предназначенной для текстов, созданных Claude. Эта технология использует SynthID-Text, разработанный Google DeepMind, и будет интегрирована в процессе генерации ответов.
Основная цель этой инициативы — установить метод проверки контента, созданного самой платформой, что соответствует директивам Закона ЕС об искусственном интеллекте. Этот европейский регламент вступил в силу 2 августа, требуя, чтобы контент, созданный инструментами ИИ, был отслеживаемым, что предполагает внедрение аналогичных технологий в других моделях.
Хотя SynthID уже известен применением водяных знаков к таким медиа, как видео, изображения и аудио, вводя тонкие изменения, незаметные для человеческого глаза, SynthID-Text работает путем изменения шаблона выбранных моделью слов, не ухудшая при этом текстовое качество.
Как работает метка?
В официальном заявлении Anthropic описала, что идентификация строится последовательно на основе слов, сгенерированных помощником. Языковые модели строят текст, рассчитывая статистическую вероятность каждого слова с учетом предыдущего контекста, и именно в этот момент вступает в действие водяная метка.
Например, в фразе «Сегодня было холодно и...» ИИ оценит, что маловероятным продолжением будет «сладкий», но это может быть «пасмурный» или «серый». В моменты, когда существует несколько вариантов синонимов, модель принимает случайное решение о выборе слова. С внедрением водяной метки это выбор направляется криптографическим ключом.
Позже Claude проанализирует, соответствует ли найденный шаблон тексту, сгенерированному им самим. Компания подчеркивает, что это не означает, что Claude начнет вставлять неуместные термины в текст, поскольку внутренние тесты и исследования SynthID-Text, проведенные Google DeepMind, показали, что эта техника не влияет на конечный контент.
Где может произойти сбой обнаружения?
Учитывая способ применения метки в шаблоне письма, Anthropic указывает, что простые изменения в тексте могут нарушить анализ, а существенные изменения в структуре контента, как правило, устраняют маркировку.
Кроме того, существуют и другие обстоятельства, при которых обнаружение может дать сбой, например, когда фрагменты слишком короткие, когда ответ основан на точных фактических данных, в математических вычислениях, в кодах программирования или в текстах, написанных человеком, но впоследствии отредактированных помощником.
Наконец, Anthropic объявила, что в ближайшее время предоставит API для обнаружения, что позволит разработчикам, учреждениям и платформам проверять вероятное происхождение текста, сгенерированного Claude.

