Anthropic подробно рассказала, как Claude будет использовать невидимую водяную метку для идентификации текстов, сгенерированных ИИ
Подробнее
Tecnoblog
tecnoblog.net

Anthropic подробно рассказала, как Claude будет использовать невидимую водяную метку для идентификации текстов, сгенерированных ИИ

Anthropic разъяснила принцип работы невидимой водяной метки, предназначенной для текстов, созданных Claude. Эта технология использует SynthID-Text, разработанный Google DeepMind, и будет интегрирована в процессе генерации ответов.

Основная цель этой инициативы — установить метод проверки контента, созданного самой платформой, что соответствует директивам Закона ЕС об искусственном интеллекте. Этот европейский регламент вступил в силу 2 августа, требуя, чтобы контент, созданный инструментами ИИ, был отслеживаемым, что предполагает внедрение аналогичных технологий в других моделях.

Хотя SynthID уже известен применением водяных знаков к таким медиа, как видео, изображения и аудио, вводя тонкие изменения, незаметные для человеческого глаза, SynthID-Text работает путем изменения шаблона выбранных моделью слов, не ухудшая при этом текстовое качество.

Как работает метка?

В официальном заявлении Anthropic описала, что идентификация строится последовательно на основе слов, сгенерированных помощником. Языковые модели строят текст, рассчитывая статистическую вероятность каждого слова с учетом предыдущего контекста, и именно в этот момент вступает в действие водяная метка.

Например, в фразе «Сегодня было холодно и...» ИИ оценит, что маловероятным продолжением будет «сладкий», но это может быть «пасмурный» или «серый». В моменты, когда существует несколько вариантов синонимов, модель принимает случайное решение о выборе слова. С внедрением водяной метки это выбор направляется криптографическим ключом.

Позже Claude проанализирует, соответствует ли найденный шаблон тексту, сгенерированному им самим. Компания подчеркивает, что это не означает, что Claude начнет вставлять неуместные термины в текст, поскольку внутренние тесты и исследования SynthID-Text, проведенные Google DeepMind, показали, что эта техника не влияет на конечный контент.

Где может произойти сбой обнаружения?

Учитывая способ применения метки в шаблоне письма, Anthropic указывает, что простые изменения в тексте могут нарушить анализ, а существенные изменения в структуре контента, как правило, устраняют маркировку.

Кроме того, существуют и другие обстоятельства, при которых обнаружение может дать сбой, например, когда фрагменты слишком короткие, когда ответ основан на точных фактических данных, в математических вычислениях, в кодах программирования или в текстах, написанных человеком, но впоследствии отредактированных помощником.

Наконец, Anthropic объявила, что в ближайшее время предоставит API для обнаружения, что позволит разработчикам, учреждениям и платформам проверять вероятное происхождение текста, сгенерированного Claude.

Похожие сюжеты

Anthropic внедрит идентификацию контента, созданного Claude, с помощью водяных знаков и метаданных
Подробнее
tecnoblog.net

Anthropic внедрит идентификацию контента, созданного Claude, с помощью водяных знаков и метаданных

Anthropic начнет идентификацию материалов, созданных Claude, включая тексты, изображения и другие медиафайлы, используя цифровые водяные знаки и метаданные, незаметные для человеческого глаза.

Это изменение является прямым ответом на директивы о прозрачности, установленные Регламентом ЕС об искусственном интеллекте. Эти нормы вступили в силу 2 августа и требуют принятия четких механизмов для обозначения того, был ли контент создан искусственным интеллектом.

Несмотря на то что требование европейское, Anthropic планирует применять эту модификацию в глобальном масштабе, охватывая различные точки доступа к Claude, такие как API, коммерческие приложения и облачные взаимодействия с такими партнерами, как AWS, Google Cloud и Microsoft Foundry.

Компания определит два различных метода идентификации в зависимости от типа создаваемого материала. Для текстов Claude начнет включать водяной знак в структуру ответов, следуя модели, аналогичной SynthID, используемой Google в своих изображениях, сгенерированных через Gemini.

Эти метки не видны в конечном контенте, в отличие от логотипа Gemini на изображениях Google или текста «Meta AI» в редакторах системы компании Марка Цукерберга. Хотя Anthropic не назвала свой знак, он не должен изменять контент и должен оставаться связанным с текстом даже после копирования и передачи в другое программное обеспечение.

Что касается изображений и визуальных ресурсов, идентификация будет осуществляться посредством метаданных происхождения, подписанных цифровым способом, с использованием стандарта C2PA — открытого протокола, уже применяемого такими компаниями, как Adobe, OpenAI и Google.

Стоит отметить, что Anthropic пока не имеет нативных моделей для создания изображений, но может генерировать текстовые файлы в таких форматах, как PNG, JPG или SVG.

Применение этих мер начинается с моделей, выпущенных с даты активации европейских обязательств, то есть системы, доступные после 2 августа, должны иметь активную идентификацию.

Для моделей и продуктов, разработанных до этого срока, Anthropic заявила, что все еще работает над внедрением необходимой поддержки. По данным The Verge, европейское законодательство предоставляет четырехмесячный льготный период для такого рода корректировок.

Кроме того, компания объявила о своем намерении предоставить техническую документацию и собственные инструменты, позволяющие третьим лицам и онлайн-платформам в будущем проверять происхождение контента, созданного Claude.

Однако Anthropic предупреждает, что эти системы идентификации ИИ не являются безошибочными. Например, метаданные по стандарту C2PA могут быть потеряны при отправке в некоторые социальные сети или преобразовании в другие форматы. Сама Anthropic предупреждает о возможности потери водяного знака, если контент будет переписан, переведен или будет слишком кратким.

Еще один примечательный момент заключается в том, что большинство платформ еще не выделяют значительно использование ИИ; например, YouTube и Instagram размещают лишь небольшое указание на возможное использование в дискретных областях своих интерфейсов, и это относится только к изображениям и видео.

Популярное