Водяной знак Anthropic для Claude оказался не панацеей: почему ИИ-метки не спасут образование
Когда появились первые сообщения о том, что Anthropic начнет незаметно маркировать тексты, созданные Claude, для преподавателей это выглядело почти как решение одной из самых болезненных проблем современного образования. Если студент попросил нейросеть написать курсовую, эссе или отчет, а затем просто скопировал результат в Word, теоретически преподаватель получил бы возможность проверить происхождение текста.
Но реальность оказалась значительно сложнее. Водяной знак Anthropic действительно позволяет статистически оценить вероятность того, что Claude участвовал в создании текста. Однако это совсем не то же самое, что надежно установить факт списывания. Более того, сама Anthropic прямо предупреждает о существенных ограничениях технологии.
Ситуация особенно интересна потому, что маркировка появилась не только как эксперимент самой компании. Anthropic внедряет ее в рамках выполнения европейских требований к прозрачности контента, созданного искусственным интеллектом. Компания заявила о переходе на такую схему для будущих моделей и объяснила принцип работы технологии.
Почему преподаватели вообще заинтересовались водяными знаками
Распространение генеративного ИИ полностью изменило отношение университетов к письменным заданиям. Раньше преподаватель мог примерно понимать, насколько самостоятельно студент подготовил эссе или реферат. Теперь достаточно нескольких минут, чтобы получить от языковой модели связный текст на практически любую тему.
Масштаб проблемы уже нельзя назвать небольшим. По данным исследования, на которое ссылается Xataka, в Великобритании 95% студентов бакалавриата используют ИИ, а 94% применяют его непосредственно при подготовке оцениваемых работ. В Австралии исследование, проведенное Turnitin, указывало на использование инструментов ИИ более чем в половине университетских работ.
При этом обычные AI-детекторы не дают преподавателю надежного доказательства. Они анализируют особенности текста и пытаются определить, насколько его стиль похож на результат работы языковой модели. Такой подход неизбежно приводит к ошибкам: человеческий текст может быть принят за машинный, а тщательно отредактированный текст ИИ — наоборот, не распознан.
В результате преподаватель оказывается в неприятной ситуации. Подозрение может быть сильным, но объективного доказательства нет. Наказывать студента только за результат работы автоматического детектора рискованно, особенно если речь идет об экзамене, дипломной работе или дисциплинарном разбирательстве.
Как работает скрытая маркировка Claude
Водяной знак Anthropic устроен принципиально иначе, чем обычный детектор ИИ. Он не пытается угадать происхождение текста постфактум по стилю. Вместо этого сама модель во время генерации создает статистический сигнал.
Языковая модель постоянно выбирает следующий токен из нескольких подходящих вариантов. Если после определенной фразы одинаково хорошо подходят два или несколько слов, выбор между ними не всегда критичен для смысла предложения. Именно в таких местах Anthropic может слегка изменить источник случайности, который используется при выборе следующего слова.
В результате отдельное предложение не выглядит необычным. Читатель не увидит никаких специальных символов, дополнительных пробелов или скрытых последовательностей знаков. Но на длинном фрагменте текста появляется статистический паттерн, который можно сопоставить со специальным криптографическим ключом.
Anthropic описывает эту схему как способ определить вероятность участия Claude в создании текста. При этом компания подчеркивает несколько важных особенностей:
- в текст не добавляются скрытые символы;
- дополнительные токены для маркировки не генерируются;
- читатель не может визуально отличить маркированный текст от обычного;
- маркировка не должна заметно ухудшать качество или читаемость результата;
- водяной знак не содержит сведений о конкретном пользователе, организации или чате.
Таким образом, название «водяной знак» может вводить в заблуждение. Речь идет не о цифровом аналоге логотипа на фотографии и не о невидимом наборе символов. Это статистическая особенность распределения слов, которую можно обнаружить при наличии соответствующего метода проверки.
Главная проблема: водяной знак не доказывает, что текст написал студент с помощью ИИ
Именно здесь первоначальные ожидания преподавателей начинают сталкиваться с реальностью.
Если проверка обнаружила характерный сигнал Claude, она не может ответить на вопрос, кто именно написал текст и насколько активно использовался искусственный интеллект. Она лишь показывает, что Claude, вероятно, участвовал в создании или обработке определенной части материала.
Представим несколько совершенно разных ситуаций. В первом случае студент попросил Claude написать всю курсовую работу. Во втором — написал ее самостоятельно, а затем попросил исправить орфографические ошибки. В третьем — дал нейросети собственный текст и попросил сделать стиль более академическим. В четвертом — перевел собственную работу с одного языка на другой.
С точки зрения преподавателя эти сценарии имеют совершенно разное значение. Но водяной знак не способен автоматически провести между ними четкую границу.
Anthropic сама признает это ограничение: технология позволяет оценить вероятность того, что Claude участвовал в создании текста, но не устанавливает авторство и не определяет степень использования ИИ.
Короткие тексты и код — особенно сложный случай
Для статистической маркировки необходимо достаточное количество решений модели. Чем длиннее текст, тем больше потенциальных мест, в которых можно накопить характерный сигнал.
С коротким ответом ситуация совершенно другая. В нескольких предложениях просто может оказаться недостаточно подходящих вариантов слов, чтобы уверенно определить статистический паттерн.
Еще сложнее обстоит дело с техническими текстами и программным кодом. Если модель должна вывести точное название функции, число, формулу или синтаксически необходимую конструкцию, пространства для «безопасного» выбора практически нет.
Например, после выражения «2 + 2 =» правильным продолжением является «4». Подменять его другим словом ради статистической маркировки невозможно, поскольку результат станет ошибочным. Поэтому в коде и других строго структурированных материалах водяной знак выражен значительно слабее. Anthropic прямо указывает на это ограничение.
А если Claude только исправлял человеческий текст?
Это один из наиболее важных вопросов для образования.
Допустим, студент самостоятельно написал десять страниц текста, а затем попросил Claude исправить пунктуацию и несколько грамматических ошибок. В итоговом документе подавляющее большинство слов по-прежнему принадлежит человеку.
В таком случае маркировать практически нечего. Водяной знак появляется только там, где Claude самостоятельно выбирал слова или другие элементы текста. Если изменений мало, статистического сигнала может оказаться недостаточно.
Это принципиально отличается от ситуации, когда пользователь дает модели только тему и получает полностью готовую работу. Чем больше текста самостоятельно генерирует Claude, тем больше возможностей для формирования водяного знака.
Поэтому наличие или отсутствие сигнала нельзя напрямую переводить в бинарное решение «студент использовал ИИ» или «студент не использовал ИИ».
Перевод — отдельная история
С переводом ситуация заметно интереснее. Если человек предоставляет Claude собственный текст и просит полностью перевести его на другой язык, фактически каждое слово нового текста выбирается моделью.
Anthropic поэтому указывает, что перевод, выполненный Claude, также может получить водяной знак. Это создает важный юридический и академический нюанс: маркировка не означает, что исходные идеи принадлежат искусственному интеллекту.
Получается парадоксальная ситуация. Человек может быть автором содержания, аргументов и исследования, но использовать Claude исключительно как переводчика. В результате готовый текст может получить сигнал, указывающий на участие модели.
Почему «взлом» водяного знака не является главным сюрпризом
После появления информации о новой технологии довольно быстро начали распространяться инструменты, обещающие удалять маркировку из текстов разных ИИ-систем. Xataka отмечает, что уже примерно через сутки после объявления Anthropic появились проекты, заявлявшие о возможности удаления водяных знаков Claude, ChatGPT и Gemini.
Однако здесь важно не переоценивать сам факт появления таких инструментов. У любой системы маркировки текста существует фундаментальная проблема: текст можно переписать.
Если водяной знак основан на статистике выбора слов, то изменение этих слов неизбежно меняет статистический сигнал. Можно заменить формулировки, перестроить предложения, изменить порядок аргументов или полностью перефразировать материал.
Anthropic прямо признает: легкое редактирование может не уничтожить водяной знак полностью, тогда как полная переработка текста, при которой заменяется практически каждое слово, способна его устранить. При этом возникает логичный вопрос: можно ли после полного переписывания вообще считать получившийся материал тем же самым текстом, который создал ИИ?
Именно поэтому история с «взломом за один день» скорее показывает ограниченность самой идеи универсального детектора, чем какой-то уникальный провал Anthropic.
У Anthropic пока нет полноценного публичного детектора
Есть еще одна проблема. Компания подробно рассказала о принципе своей маркировки, но на момент публикации материала не предоставила обычным пользователям готовый публичный инструмент, куда преподаватель мог бы загрузить текст и получить результат проверки.
Anthropic заявляет, что планирует предоставить API для обнаружения водяных знаков. То есть технология обнаружения должна появиться отдельно от самой маркировки.
Это означает, что само наличие водяного знака пока не превращает любой текстовый редактор или университетскую систему проверки в надежный механизм определения авторства.
Почему европейское законодательство здесь играет ключевую роль
Внедрение маркировки нельзя рассматривать только как реакцию Anthropic на академическую проблему. Компания объясняет, что делает это прежде всего для выполнения требований европейского законодательства об искусственном интеллекте.
Anthropic указывает, что требования к маркировке AI-контента начали применяться с 2 августа 2026 года. Компания также сообщает, что подписала европейский кодекс практики по прозрачности AI-контента вместе с другими крупными разработчиками.
Интересно, что Anthropic решила применять маркировку глобально, а не только для пользователей из Европы. Причина практическая: компания пока не располагает достаточно надежным способом ограничить механизм конкретным регионом.
Для пользователей это означает появление нового класса цифровых меток, которые потенциально будут сопровождать результаты работы ИИ независимо от того, где они были созданы.
Водяной знак не является доказательством нарушения академической честности
Для университетов это, пожалуй, главный вывод.
Если система когда-нибудь сообщит преподавателю, что в студенческом эссе вероятно участвовал Claude, этого недостаточно для автоматического вывода о мошенничестве. Необходимо учитывать правила конкретного курса и то, какие формы использования ИИ разрешены.
В некоторых образовательных программах запрещено генерировать содержание работы, но разрешено проверять грамматику. В других использование ИИ допускается для поиска идей, составления плана или перевода. Поэтому один и тот же результат проверки может означать совершенно разные вещи.
Кроме того, отрицательный результат также не доказывает, что студент работал без ИИ. Водяной знак может быть недостаточно выражен из-за малого объема текста, большого количества фактических утверждений, особенностей редактирования или последующей переработки.
Что остается преподавателям
Вместо попытки построить систему образования вокруг одного универсального детектора ИИ гораздо перспективнее менять сам процесс оценки знаний.
Например, преподаватель может использовать несколько независимых элементов:
- короткие устные защиты письменных работ;
- пошаговую сдачу проекта с черновиками;
- проверку истории изменений документа;
- практические задания, связанные с содержанием курса;
- индивидуальные вопросы по аргументам и выводам студента;
- часть контрольных работ, выполняемых непосредственно в аудитории.
Такой подход позволяет проверять не столько происхождение текста, сколько наличие реальных знаний у человека.
Если студент способен объяснить собственное исследование, защитить сделанные выводы, показать промежуточные этапы работы и самостоятельно решить связанные с темой задачи, происхождение отдельных формулировок становится гораздо менее важным.
Проблема ИИ в образовании шире, чем вопрос «кто написал текст»
Главная опасность генеративного ИИ для образования заключается не в том, что нейросеть может написать красивое эссе. Проблема возникает тогда, когда выполнение задания полностью заменяет процесс обучения.
Студент может получить идеальный текст, но при этом не научиться анализировать источники, строить аргументацию, программировать, решать математические задачи или формулировать собственные выводы.
Поэтому надежда на технический детектор может оказаться опасной сама по себе. Она создает иллюзию, что университету достаточно установить специальную систему и проблема исчезнет. На практике любой метод обнаружения будет иметь ограничения, а способы обхода будут развиваться вместе с самими моделями.
Anthropic уже показывает другой подход к образованию: компания развивает Claude for Teachers, предоставляя проверенным преподавателям доступ к специализированным возможностям Claude и материалам для использования ИИ в образовательной работе. Это показательно: сами разработчики рассматривают ИИ не только как объект контроля, но и как инструмент для преподавателей.
Выводы
Скрытая маркировка текстов Claude — технологически интересный механизм, но ожидать от нее роли универсального детектора списывания не стоит. Она позволяет статистически определить вероятность участия Claude, однако не устанавливает автора текста, не определяет намерения пользователя и не показывает, насколько значительным было участие нейросети.
Особенно плохо технология подходит для коротких ответов, кода, фактических формулировок и ситуаций, когда Claude используется только для корректуры. При масштабном редактировании или полном переписывании исходный сигнал также может исчезнуть.
Поэтому водяной знак скорее является инструментом прозрачности происхождения AI-контента, чем цифровым «детектором лжи». Его значение будет возрастать по мере появления стандартизированных средств проверки, но использовать один такой сигнал в качестве единственного основания для обвинения студента было бы ошибкой.
Для образования гораздо важнее другой вопрос: не «смог ли студент скрыть использование ИИ?», а «может ли он продемонстрировать, что действительно освоил материал?». Именно переход от поиска следов нейросети к проверке реальных знаний, вероятно, станет наиболее устойчивым ответом образовательной системы на распространение генеративного ИИ.
Часто задаваемые вопросы
Что такое водяной знак Anthropic для Claude?
Это скрытый статистический сигнал в тексте, который формируется во время генерации за счет управляемого выбора между подходящими вариантами слов. Визуально такой текст ничем не отличается от обычного.
Можно ли по водяному знаку точно доказать, что текст написал Claude?
Нет. По данным Anthropic, технология позволяет определить вероятность участия Claude, но не доказывает, что модель написала весь текст и не устанавливает его автора.
Можно ли считать отсутствие водяного знака доказательством человеческого авторства?
Нет. Короткий текст, код, фактические формулировки и небольшое количество изменений могут содержать слишком слабый сигнал для надежного обнаружения.
Будет ли маркировка сохраняться после редактирования текста?
Легкое редактирование может оставить часть сигнала, но масштабная переработка способна его существенно ослабить или полностью удалить. Anthropic прямо указывает на это ограничение.
Получит ли водяной знак текст, который человек написал сам, а Claude только исправил?
Теоретически да, но сигнал может быть слишком слабым для обнаружения. Если модель исправляет только небольшое количество ошибок, большая часть слов остается человеческой и маркировать ее невозможно.
Маркируются ли переводы, выполненные Claude?
Да. Anthropic указывает, что перевод может получить водяной знак, поскольку при создании переведенного текста модель выбирает фактически все слова.
Можно ли удалить водяной знак?
Сильное редактирование или полное переписывание текста способно разрушить статистический сигнал. Поэтому водяной знак нельзя рассматривать как неуничтожимую метку.
Может ли преподаватель использовать водяной знак как единственное доказательство списывания?
Это крайне ненадежный подход. Маркировка показывает вероятное участие Claude, но не определяет объем использования ИИ и не отличает написание текста от его редактирования или перевода.
Зачем Anthropic вообще внедрила маркировку?
Основная причина — выполнение требований европейского регулирования, связанного с прозрачностью контента, созданного искусственным интеллектом. Anthropic также рассматривает маркировку как способ обеспечить возможность последующей проверки происхождения контента.
Повлияет ли водяной знак на качество ответов Claude?
Anthropic заявляет, что технология не должна заметно влиять на качество, читаемость и творческие характеристики текста. В маркировку не добавляются дополнительные токены и скрытые символы.
Когда появится официальный инструмент проверки водяных знаков?
Anthropic сообщила, что работает над API для обнаружения маркировки. Конкретные детали публичного механизма проверки компания должна определить отдельно.
Что делать университетам вместо обычных AI-детекторов?
Лучше сочетать разные методы оценки: устную защиту, черновики, историю изменений, практические задания и проверку способности студента объяснить собственные выводы. Такой подход оценивает реальные знания, а не только вероятность происхождения текста.
Основные технические детали о принципе работы водяного знака и его ограничениях сверены с официальным объяснением Anthropic от 14 августа 2026 года.
Редактор: AndreyEx