Невидимая маркировка текстов Claude: Anthropic раскрыла принцип работы

17 августа 20264 просмотров

Новое поколение моделей будет встраивать в ответы незаметный узор, по которому можно оценить, насколько вероятно участие ИИ в создании текста. Это не скажется на качестве, читаемости и стоимости генерации, зато поможет соблюсти требования Евросоюза.

Невидимая маркировка текстов Claude: Anthropic раскрыла принцип работы

Anthropic объявила, что все тексты, генерируемые её флагманской моделью Claude, скоро получат невидимую маркировку. Это сделано для соответствия требованиям ЕС, которые вступают в силу с 2 августа. Компания также впервые раскрыла технические детали: раньше было известно лишь то, что водяной знак не меняет содержание и не добавляет в текст скрытых символов.

Как работает маркировка

В основе метода — технология SynthID-Text, разработанная Google DeepMind и опубликованная в Nature в 2024 году. Сама идея была предложена Скоттом Ааронсоном ещё в 2022-м. При обычной генерации модель выбирает следующее слово с помощью случайного числа. В версии с водяным знаком случайность заменяется детерминированной функцией: она использует секретный ключ и несколько предыдущих слов. В результате последовательность слов выглядит случайной, но несёт в себе паттерн, который можно проверить.

На каждом шаге все слова-кандидаты делятся на «зелёные» и «красные». Модель немного чаще выбирает из зелёного списка, но красные слова не запрещены — просто менее вероятны. Состав списков зависит от контекста и ключа, поэтому фиксированного набора слов, который можно было бы запомнить, не существует. Тот, кто владеет ключом, может в любой момент вычислить, в какой список попало конкретное слово в конкретном месте. Без ключа это невозможно.

Чтобы понять идею, представьте игру в Monopoly, где вместо кубика используется книга цифр числа пи. Стороннему наблюдателю бросок кажется случайным, но игрок, у которого есть эта книга, заранее знает все выпавшие числа. Аналогично, водяной знак не меняет правила генерации, а лишь меняет источник случайности.

По сути, это разновидность стеганографии: информация скрыта в самом выборе слов, а не в явных метках. Маркировка не добавляет в текст никаких токенов и не увеличивает стоимость генерации. Читатель не может отличить маркированный текст от обычного ни визуально, ни на слух.

Как это влияет на качество

Anthropic провела внутренние тесты и не обнаружила негативного влияния на содержание, креативность или читаемость. Аналогичные результаты были получены в ходе экспериментов Google DeepMind с моделью Gemini: пользовательские оценки (лайки и дизлайки) не показали статистически значимых различий между маркированными и обычными ответами. В контролируемом исследовании эксперты, сравнивавшие тексты бок о бок, также не увидели разницы.

Водяной знак не содержит идентифицирующей информации: по нему нельзя понять, кто именно общался с моделью, в каком чате и когда. Максимум — рассчитать вероятность того, что текст был сгенерирован именно этой моделью. При этом для коротких фраз (менее нескольких десятков слов) точность детекции падает до нуля: нужен достаточно длинный текст, чтобы статистический паттерн стал заметен.

Примечательно, что модель никогда не вынуждают выбирать редкие или неестественные слова. В зелёный и красный списки попадают те же слова, которые модель рассматривает в обычном режиме, поэтому текст остаётся естественным.

Что дальше

Внедрение маркировки — часть масштабного тренда. С 2 августа ЕС требует от всех поставщиков ИИ-услуг помечать контент, созданный их моделями. Anthropic — не единственная: другие крупные компании подписали Кодекс практики и уже работают над собственными схемами водяных знаков. Таким образом, невидимая маркировка станет стандартом отрасли, а не уникальной фишкой Claude.

Правда, у технологии есть ограничения: с помощью секретного ключа можно получить только вероятностную оценку происхождения текста, но не абсолютную уверенность. Тем не менее, для регуляторов это достаточный инструмент, а для пользователей — дополнительный уровень прозрачности.

Итог: маркировка текстов Claude — это компромисс между прозрачностью, регулированием и удобством. Она практически не влияет на качество генерации и при этом позволяет проверять происхождение текста, не нарушая приватность пользователей.

Часто задаваемые вопросы

Похожие материалы

Все материалы