Логотип
Свобода радует не столь сильно как угнетает рабство (Геродиан).

Как Anthropic планирует использовать водяные знаки в тексте Claude, сгенерированном искусственным интеллектом

Вскоре может стать проще идентифицировать контент, созданный искусственным интеллектом, даже если это не обычный пост типа «Это не X*, это Y», с которым вы сталкиваетесь в LinkedIn и других социальных сетях.

Как вы, возможно, знаете, Евросоюз теперь требует, чтобы компании, работающие в сфере искусственного интеллекта и обслуживающие его рынок, маркировали контент, созданный ИИ, чтобы его было легче идентифицировать.

Anthropic и несколько других крупных поставщиков ИИ согласились соблюдать Кодекс практики ЕС, и Anthropic стала одной из первых компаний, поделившихся подробностями о том, как она будет внедрять водяные знаки в Claude.

Компания Anthropic также подтвердила, что обычный пользователь не сможет увидеть водяной знак.

По словам представителей компании, это никак не влияет на качество или содержание результатов работы Claude, в том числе на креативность и удобочитаемость.

Для тех, кто не в курсе: невидимые водяные знаки и системы отслеживания происхождения уже используются для некоторых изображений, созданных искусственным интеллектом, и теперь текстовый контент будет создаваться по той же концепции, хотя реализация будет отличаться.

Несмотря на то, что это изменение вносится в соответствии с Законом ЕС об искусственном интеллекте, в Anthropic заявляют, что водяной знак изначально будет применяться к текстам, сгенерированным Claude, по всему миру.

«Мы применяем водяные знаки глобально при запуске, потому что у нас пока нет надежного способа ограничить их использование по регионам», — объяснили в Anthropic в своем блоге.

В Anthropic говорят, что будущие модели Claude будут генерировать текст с водяными знаками. Модели, выпущенные до 2 августа 2026 года, подпадают под переходный период в ЕС. В Anthropic сообщили, что в ближайшие месяцы добавят водяные знаки на эти модели.

 

Водяной знак Claude не добавляет скрытых символов

В Anthropic говорят, что их реализация основана на подходе SynthID-Text от Google DeepMind, и объяснили, что она работает во время генерации, за некоторыми исключениями.

Как вы, возможно, знаете, модели искусственного интеллекта генерируют текст, многократно выбирая, какой токен может быть следующим. Вместо того чтобы добавлять символы или изменять готовый ответ, водяной знак Claude меняет источник случайности, используемый при принятии некоторых решений.

Читать  Apple подала в суд на OpenAI за кражу коммерческой тайны: "Лол, у меня есть доступ", сообщение инженера, спровоцировавшего скандал

«Водяные знаки используют такие варианты с низким риском, которые повторяются много раз в сгенерированном тексте, чтобы оставить след в ответах Claude. Этот след незаметен для читателя, но может быть обнаружен любым, у кого есть ключ, который его кодирует, — пояснил Антроп.

— При использовании водяных знаков выбор по-прежнему делается случайным образом, но источник случайности другой». Вместо того чтобы использовать произвольный генератор случайных чисел для выбора следующего слова, метод «водяных знаков» использует ключ и несколько предыдущих слов, чтобы определить, какое слово должна выбрать модель. »

» То есть слова, которые выбирает Claude, по-прежнему выбираются случайным образом, но теперь можно проверить последовательность слов и убедиться, что она соответствует выбору, который сделал бы Claude, если бы использовал ключ. Если это так, то можно определить вероятность того, что текст был сгенерирован Claude.»

Я также прочитал научно-исследовательскую работу на эту тему, и вот отрывок, в котором объясняется, как работает генеративный водяной знак:

Генеративный водяной знак работает за счет тщательной модификации процедуры выборки следующего токена, что позволяет вносить едва заметные контекстно-зависимые изменения в распределение сгенерированного текста. Такие изменения создают статистическую сигнатуру в сгенерированном тексте. На этапе обнаружения водяного знака сигнатура может быть измерена, чтобы определить, действительно ли текст был сгенерирован большой языковой моделью с водяным знаком. Ключевое преимущество этого подхода заключается в том, что процесс обнаружения не требует выполнения ресурсоемких операций или даже доступа к базовой большой языковой модели (которая часто является проприетарной).

 

Статья довольно подробная, в ней приводится больше примеров, но главное, что Anthropic не добавляет видимый маркер или скрытые символы к ответу Claude.

В научной статье Google объясняется, как работает водяное клеймо
Источник: Google DeepMind

 

Вместо этого, когда у Claude есть несколько разумных вариантов того, что сгенерировать дальше, система водяных знаков использует секретный ключ и некоторые из предыдущих слов в качестве части случайности, используемой для выбора.

Отдельные варианты должны выглядеть совершенно нормально для читателя, но в достаточно длинном фрагменте текста они образуют статистический паттерн.

Детектор с ключом Anthropic может проанализировать последовательность слов и определить, насколько она соответствует вариантам, которые выбрал бы Claude при использовании водяного знака. Это позволяет оценить вероятность того, что Claude участвовал в написании текста.

Читать  Мы не можем доверять ИИ, но мы становимся все более зависимыми от него

По данным Anthropic, внутреннее тестирование не выявило никакого влияния на креативность, удобочитаемость или содержание ответов Claude.

Компания также утверждает, что водяной знак не требует дополнительных токенов и оказывает незначительное влияние на скорость генерации.

«К тексту ничего не добавляется, скрытых символов нет», — отметили в Anthropic. «Водяные знаки не требуют дополнительных токенов и не удорожают процесс».

 

Код и фактические ответы могут содержать меньше водяных знаков

Как я уже упоминал, есть некоторые исключения из правила о водяных знаках, и на то есть веские причины.

По словам Anthropic, водяные знаки не влияют на выбор в случае фактических утверждений, где верен только один ответ.

Аналогичным образом тот же принцип применим к коду, где замена одного термина другим может привести к искажению результата.

«Там, где требуется точный результат — где нет выбора и что-то будет фактически неверным или часть кода не будет работать, если выбрать другой термин, — водяной знак не применяется».

«Например, после того как модель написала «2 + 2 =», выбор следующего токена становится очевидным (если модель вычисляет сумму, то нет ответа, который был бы так же хорош, как «4»; если речь идет о романе Джорджа Оруэлла «1984», то нет ответа, который был бы так же хорош, как «5»)», — отметили в компании.

«Подталкивание” водяного знака здесь применяться не будет. По той же причине код, который во многих случаях должен быть точным, обычно содержит меньше водяных знаков, чем некоторые другие формы текста «.

Anthropic отмечает, что водяные знаки все еще можно использовать в тех частях кода, где существует произвольный выбор, таких как комментарии, но говорит, что это должно оказывать незначительное влияние на фактический создаваемый код.

Это согласуется с документом Google SynthID-Text, в котором отмечается:

На эффективность функции оценки влияют два основных фактора. Первый — длина текста x*: чем длиннее текст, тем больше в нем признаков водяных знаков, а значит, у нас больше статистической уверенности при принятии решения. Второй — степень энтропии в распределении большой языковой модели при генерации текста с водяными знаками x*. Например, если распределение большой языковой модели имеет очень низкую энтропию, то есть она почти всегда выдает один и тот же ответ на заданный запрос, то турнирная выборка не сможет выбрать токены, которые получат более высокий балл по функциям g. Короче говоря, как и другие генеративные водяные знаки, турнирная выборка работает лучше, когда в распределении LLM больше энтропии, и менее эффективна, когда энтропия меньше.

 

Читать  Что происходит с Anthropic и почему о ней все говорят

Также стоит отметить, что при поверхностной вычитке текста, написанного человеком, может остаться слишком мало материала, созданного Claude, для надежного выявления подделки.

По словам Anthropic, водяной знак появляется только на тех словах, которые выбирает Claude, поэтому несколько изменений в грамматике или пунктуации могут не служить достаточным доказательством.

По словам Anthropic, перевод, созданный Claude, несет на себе водяной знак, поскольку Claude выбирает каждое слово в переведенном тексте.

 

Anthropic разрабатывает API для обнаружения водяных знаков Claude

Оказывается, есть более простой способ их обнаружить: Anthropic планирует предложить API для обнаружения водяных знаков.

API сможет оценить вероятность того, что Claude участвовал в написании текста, но в Anthropic подчеркивают, что это не то же самое, что доказательство авторства.

Водяной знак Claude также не может определить, был ли текст написан другой ИИ-моделью, поскольку другие провайдеры могут использовать другие методы нанесения водяных знаков и другие ключи.

«Водяной знак может лишь указать на то, что Claude, вероятно, участвовал в создании контента в какой-то момент». Он не может отличить «Клод написал это» от «Клод сильно отредактировал это».

«Легкое редактирование, скорее всего, не удалит водяной знак полностью, а вот полная переделка, при которой меняется каждое слово, — удалит».

Кроме того, при работе с небольшими выборками обнаружение становится менее надежным, поскольку детектору приходится анализировать меньшее количество вариантов слов.

Для сгенерированных файлов в форматах PNG, JPG и SVG Anthropic использует другой подход.

Claude будет прикреплять криптографически подписанные метаданные о происхождении C2PA, указывающие на то, что файл был создан или обработан с помощью Claude, а не изменять сам файл, встраивая в него водяной знак.

Если вы нашли ошибку, пожалуйста, выделите фрагмент текста и нажмите Ctrl+Enter.

Редактор: AndreyEx

Рейтинг: 5 (1 голос)
Если статья понравилась, то поделитесь ей в социальных сетях:

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

20 + 20 =

Это может быть вам интересно


Спасибо!

Теперь редакторы в курсе.

Прокрутить страницу до начала