Anthropic рассказывает, что такое водяной знак и как его можно победить

Anthropic рассказывает, что такое водяной знак и как его можно победить

<стр>Anthropic предоставляет более подробную информацию о текстовом водяном знаке и рассказывает, как его можно победить.

<п>Anthropic объявила, как работает ее водяной знак, подтвердив практически все ранее сообщенные подробности о аналогичном методе нанесения водяных знаков под названием MirrorMark. Подобно MirrorMark, водяной знак сам по себе представляет собой случайный шаблон, который отражает случайность LLM при генерации текста.

Как работает водяной знак

Вопреки тому, что говорят некоторые влиятельные лица ИИ, в тексте нет символов Юникода. Так что это не то, что можно скопировать и вставить в текстовый файл, чтобы удалить или идентифицировать.

Кроме того, речь идет не об использовании длинного тире и не о шаблонах, которые склонны использовать студенты LLM, например: «Это не то, это то». стиль письма. Он не ищет вероятность того, что что-то было написано ИИ.

<п>Он ищет определенный шаблон водяного знака.

<п>LLM генерируют следующий вероятный текст в последовательности, но со встроенной случайностью. Он не всегда выбирает наиболее вероятное следующее слово; В выбранном слове есть элемент случайности. SynthID использует эту случайность для установки шаблона, определяемого ключом водяного знака и контекстом предыдущих слов. Поскольку водяной знак в стиле SynthID слегка изменяет случайность выбора слова, сгенерированный текст неотличим от обычного сгенерированного текста. Пользователи не смогут идентифицировать водяной знак без ключа водяного знака.

Антропный объясняет:

“Этот шаблон незаметен для читателя, но его можно обнаружить любому, у кого есть ключ, который его кодирует. При использовании водяных знаков выбор по-прежнему осуществляется случайным образом, но источник случайности другой. Вместо использования генератора произвольных случайных чисел для выбора следующего слова, водяные знаки используют ключ и несколько слов, которые идут перед ним, чтобы определить, какое слово должна выбрать модель. То есть слова, которые выбирает Клод, по-прежнему случайны, но теперь можно проверить последовательность слов и посмотреть, соответствует ли она выбору, который сделал бы Клод, если бы он использовал ключ.”

Версия SynthID

В объявлении говорилось, что новый водяной знак представляет собой версию SynthID-Text, разработанную Google DeepMind в 2024 году. Это не SynthID, это его версия. За прошедшие два года уровень развития этого вида водяных знаков значительно улучшился.

В объявлении указано:

<блоковая цитата><п>Текстовый водяной знак «Клода» — это версия подхода SynthID-Text, опубликованная Google DeepMind в статье Nature в 2024 году. Он принадлежит к семейству подходов, восходящих к предложению Скотта Ааронсона в 2022 году, и все они имеют один и тот же принцип проектирования, который мы описали выше — водяной знак только меняет источник случайности, используемый для выбора между слова.”

Можно ли победить водяной знак Anthropic?

Да, его можно победить перефразируя. По мнению Anthropic, легкое редактирование, вероятно, не победит эту проблему.

Согласно антропному:

<блоковая цитата><п>“Неужели кто-то не может просто отредактировать текст, чтобы обойти водяные знаки?
В какой-то степени да. Легкое редактирование, вероятно, не приведет к полному удалению водяного знака; полная переписывание, где заменено каждое слово. В последнем случае, конечно, можно поспорить, можно ли дальше описывать текст как сгенерированный искусственным интеллектом.”

SynthID ищет образец слова водяного знака, который был вставлен во время создания текста. Поэтому, если вы перефразируете или отредактируете документ в достаточной степени, слова, являющиеся водяными знаками, будут стерты.

Это не SynthID

SynthID был разработан в 2024 году, и за последние два года его уровень изменился.

<п>Последняя версия SynthID, называемая MirrorMark, расширяет SynthID, распространяя водяной знак по сгенерированному тексту и используя окружающие слова в качестве контекста для определения места размещения каждой части, что делает его более устойчивым к редактированию.

SynthID — это нулевой водяной знак, что означает, что водяной знак обнаруживается или отсутствует. MirrorMark может кодировать несколько битов информации, по существу распределяя водяной знак по сгенерированному тексту.

Вот что может делать версия 2026 года, такая как MirrorMark:

<ул>

  • Добавляет многобитное кодирование.
  • <ли>Это отражает случайность генерации текста LLM.

  • Он использует CABS, сбалансированный планировщик с привязкой к контексту, который решает, где встраивать различные водяные знаки.
  • Он специально разработан, чтобы быть устойчивым к редактированию (например, Anthropic’s, который устойчив к легкому редактированию).
  • Я не говорю, что MirrorMark — это то, что использует Anthropic. Но я говорю, что прежде чем положить все яйца в корзину SynthID, которой уже два года, возможно, будет полезно посмотреть, на что способна версия SynthID 2026 года.

    Основные выводы из раскрытия водяных знаков Anthropic

    <стр>Вот основные выводы из того, что показал Anthropic: <ул>

  • Клод хочет, чтобы в будущем выводимые тексты сопровождались водяными знаками.
    Anthropic заявляет, что будущие модели Claude будут генерировать текст с водяными знаками в рамках соответствия Закону ЕС об искусственном интеллекте.
  • Водяной знак — это узор, созданный во время генерации текста.
    Это не Юникод, метаданные или скрытые символы. Водяной знак создается в процессе выбора слова.
  • Водяной знак Клода — это версия SynthID-Text.
    Anthropic утверждает, что ее метод основан на подходе SynthID-Text от Google DeepMind 2024 года.
  • Водяной знак меняет источник случайности, используемый для выбора слов.
    Клод по-прежнему делает случайный выбор среди вероятных слов, но для определения этой случайности используются ключ водяного знака и предыдущие слова.
  • Водяной знак создает заметный узор в выборе слов Клодом.
    Кто-то, у кого есть ключ, может проверить, соответствует ли последовательность слов выбору, который Клод сделал бы, используя этот ключ.
  • К тексту ничего не добавляется.
    Anthropic прямо заявляет, что здесь нет скрытых символов, дополнительных жетонов и видимых дополнений.
  • Текст с водяными знаками невозможно отличить от текста без водяных знаков.
    Anthropic утверждает, что водяной знак не влияет на качество или создаваемый контент.
  • Водяной знак не заставляет Клода делать необычный выбор слов.
    Anthropic утверждает, что не склоняет Клода к определенным словам.
  • Меньше слов — меньше заметно.
    Anthropic утверждает, что обнаружение водяных знаков плохо работает на небольших образцах. Чем больше слов, тем лучше.
  • На самом деле водяной знак слабее.
    Менее надежно, когда на выбор меньше слов из-за ограничений, основанных на фактическом типе контента.
  • Водяной знак становится слабее при использовании для редактирования текста корректуры.
    Anthropic утверждает, что если вы “попросите его редактировать только грамматику и пунктуацию и ничего больше, водяной знак сможет сохраниться только в нескольких исправлениях, которых может быть слишком мало для регистрации.”
  • Anthropic планирует выпустить API для обнаружения водяных знаков.
  • Нетекстовые файлы изображений, такие как JPG, PNG и SVG, будут использовать метаданные C2PA.
  • Нанесение водяных знаков незначительно влияет на скорость и не добавляет дополнительных токенов.
  • Back To Top