Claude - как клод маркирует контент - 2026
Published: 2026-08-11
В текстах от Claude скоро появятся вотермарки! Токенизатор делит все подходящие слова-продолжения на условные «красные» и «зеленые» списки. Алгоритм может требовать использовать, например, два «зеленых» слова на каждые десять сгенерированных. Для читателя разницы нет (синонимы выглядят естественно), но система точно знает, какое слово было заложено. На коротких отрывках легко получить ложное срабатывание - человек мог сам случайно написать эти слова. Но на больших объемах текста случайности исключены. Как обойти: Классический студенческий лайфхак - просто переведите текст на другой язык и обратно. Защита (типа SynthID) слетает мгновенно.
Claude — как Claude маркирует контент в 2026 году: невидимые вотермарки в тексте, подписанные C2PA-метаданные для файлов, технические методы (KGW, SynthID-Text), стеганография Claude Code, атаки на вотермарки и ограничения системы.
Введение
11 августа 2026 года Anthropic официально анонсировала систему маркировки контента, сгенерированного моделью Claude. Анонс опубликован в официальной базе знаний (Claude Help Center) и вызвал бурную дискуссию в техническом сообществе: разработчики, пользователи и исследователи безопасности начали разбирать, как именно будут устроены «невидимые вотермарки» в тексте и что это значит для всех, кто использует Claude для работы — от написания кода до генерации статей и перевода документов.
Причиной нововведения стало не собственное желание компании, а внешнее регуляторное давление: Anthropic подписала Кодекс практики по прозрачности AI-сгенерированного контента (Article 50(2) Code of Practice on Transparency of AI-Generated Content) — документ, принятый в рамках европейского Закона об искусственном интеллекте (EU AI Act). Согласно этому документу, провайдеры генеративных моделей обязаны обеспечивать машиночитаемую маркировку контента, чтобы его можно было отличить от человеческого.
В этой статье мы подробно разберём:
- официальные обязательства Anthropic и сроки внедрения;
- два технических механизма маркировки — вотермарки в тексте и подписанные метаданные провенанса;
- как технически могут быть устроены текстовые вотермарки (Unicode-гомоглифы, статистические методы KGW и турнирная схема Christ, используемая в SynthID-Text от Google);
- стеганографию в промптах Claude Code, обнаруженную исследователями;
- известные атаки на вотермарки — парафразирование, watermark stealing и watermark distillation;
- официальные ограничения системы и влияние на конечных пользователей и разработчиков.
Контекст: почему Anthropic начала маркировать контент
EU AI Act и Кодекс практики Article 50(2)
Европейский Закон об искусственном интеллекте (EU AI Act) — первый в мире всеобъемлющий закон, регулирующий AI. Статья 50 закона посвящена прозрачности: контент, созданный или обработанный AI, должен быть машиночитаемо помечен как «созданный искусственно», чтобы люди и автоматические системы могли распознавать его происхождение.
Ключевые элементы, относящиеся к Claude:
- Article 50(2): провайдеры общих моделей (GPAI) обязаны обеспечивать машиночитаемую маркировку синтетического контента;
- Article 50(4): требование маркировать сгенерированные текст, аудио, изображения и видео;
- Кодекс практики (Code of Practice): добровольный, но фактически обязательный документ, детализирующий, как компании будут выполнять требования закона. Anthropic его подписала.
Стоит подчеркнуть: хотя закон европейский, маркировка будет применяться глобально. Anthropic прямо заявляет, что метки появятся «везде, где предлагается Claude, по всему миру». Это характерная черта регуляторного давления «Брюссельского эффекта»: требования одного крупного рынка становятся де-факто мировым стандартом, потому что компаниям дешевле внедрить маркировку сразу везде, чем поддерживать две разные версии продукта.
Ключевая дата: 2 августа 2026 года
Важная дата — 2 августа 2026 года. Именно с этого момента:
- модели Claude, запущенные в ЕС на или после 2 августа 2026 года, будут поддерживать машиночитаемую маркировку с первого дня;
- для моделей, выпущенных до этой даты, действует переходный период — Anthropic работает над добавлением маркировки и для них;
- генерируемый текст будет нести встроенный вотермарк, а генерируемые файлы — цифровые подписанные метаданные провенанса (там, где это поддерживается).
Для сравнения, Google внедрила свою систему SynthID в Gemini ещё в 2024 году, OpenAI долго экспериментировала с вотермарками (исследования Скотта Ааронсона), но массового внедрения не делала. Anthropic, таким образом, замыкает «большую тройку» американских лабораторий, которые маркируют контент на уровне модели.
Официальные обязательства Anthropic
В статье Help Center компания перечисляет четыре ключевых обещания:
- Новые модели маркируют AI-контент с первого дня. Модели Claude, запущенные в ЕС начиная с 2 августа 2026 года, поддерживают машиночитаемую маркировку с момента релиза. Сгенерированный текст несёт встроенные вотермарки, файлы — цифровые подписанные метаданные провенанса (где поддерживаются).
- Маркировка работает везде, где вы используете Claude. Метки применяются к выводу поддерживаемых моделей во всех продуктах: Claude Platform (API), приложение Claude, Claude Code, Claude Cowork и Claude Tag. Некоторые платформы или функции могут не поддерживать отдельные типы маркировки.
- Anthropic поможет обнаруживать метки. Компания обязуется предоставить пользователям и третьим лицам инструменты для детекции вотермарков и метаданных, как того требует Кодекс практики. Технические подробности появятся в последующей документации.
- Существующие модели — в работе. Переходный период, предусмотренный законом для моделей, запущенных до 2 августа 2026 года, будет использован для добавления маркировки и к старым моделям.
Что именно покрывается
- Модели: все поддерживаемые модели Claude, включая запущенные после 2 августа 2026 года, а также (после обновления) более ранние.
- Продукты: Claude Platform (API), Claude (веб/десктоп/мобайл), Claude Code, Claude Cowork, Claude Tag.
- Облачные партнёры: вотермарки в тексте будут применяться при доступе к Claude через AWS (Amazon Bedrock), Google Cloud (Vertex AI) и Microsoft Foundry. Подписанные метаданные провенанса могут быть недоступны на всех платформах — это зависит от функциональности платформы.
- Регионы: маркировка применяется по всему миру, вне зависимости от того, где находится пользователь.
Как Claude маркирует контент: два механизма
Anthropic использует два взаимодополняющих механизма:
- вотермарки, встроенные непосредственно в текст;
- подписанные метаданные провенанса, прикрепляемые к файлам.
1. Встроенные вотермарки в тексте
Когда поддерживаемая модель Claude генерирует текст, она «вплетает» невидимый вотермарк прямо в сам текст. По заявлению Anthropic:
- вотермарк невидим для читателя;
- он не меняет смысл, качество, стиль или читаемость ответа;
- так как вотермарк является частью текста, он «путешествует» вместе с текстом при копировании и вставке в другой документ, сайт, письмо или приложение;
- вотермарк может сохраняться после некоторого редактирования;
- маркировка происходит на уровне модели, поэтому вотермарк присутствует независимо от того, из какого продукта получен текст.
Это принципиальное отличие от «примитивных» схем, где метку добавляет приложение (например, дисклеймер «этот текст создан AI» в конце ответа). Встроенный вотермарк нельзя удалить простым копированием, обрезкой конца текста или заменой нескольких слов.
Важный нюанс: вотермарк применяется не только к сгенерированному тексту. Если пользователь принёс в Claude собственный текст для корректуры, перевода, суммаризации или конвертации — результат тоже может получить метку Claude, даже если идеи и материал принадлежат человеку.
2. Подписанные метаданные провенанса (C2PA)
Для файлов — пока это .svg, .png и .jpg — Claude будет прикреплять подписанные метаданные провенанса. Эти метаданные следуют открытому стандарту C2PA (Coalition for Content Provenance and Authenticity — Коалиция за провенанс и подлинность контента), который используется во всей индустрии для записи информации о происхождении контента.
C2PA — это индустриальный стандарт, созданный консорциумом, в который входят Adobe, Microsoft, Intel, Google, OpenAI и другие. Суть: к файлу прикрепляется криптографически подписанный манифест, описывающий:
- что за контент (хэш файла);
- кто и чем его создавал/обрабатывал (например, «Claude»);
- какие инструменты участвовали в цепочке обработки;
- были ли внесены изменения после подписи.
Если подписанная метка присутствует — это сигнал, что файл был обработан Claude, и позволяет проверить, не был ли файл изменён (тамперинг) после подписи: любое изменение бинарных данных сломает криптографическую подпись.
Важно: C2PA-метаданные — это «метаданные», они существуют отдельно от пикселей. Их можно удалить, сохранив файл через другой конвертер, пересохранив его, сделав скриншот или загрузив в соцсеть, которая сжимает и перекодирует изображение. Поэтому C2PA дополняется перцептивными вотермарками (встроенными в сами пиксели) — но для файлов Claude пока заявлены только подписанные метаданные.
Разница между двумя механизмами
| Характеристика | Вотермарк в тексте | C2PA-метаданные |
|---|---|---|
| Что маркируется | Текст | Файлы (.svg, .png, .jpg) |
| Где хранится | Внутри самого текста (на уровне модели) | В метаданных файла |
| Переживает копирование/вставку | Да | Нет (метаданные привязаны к файлу) |
| Переживает редактирование | Частично | Нет (при пересохранении часто теряются) |
| Переживает конвертацию/скриншот | Да | Нет |
| Защита от подделки | Статистическая (детекция по ключу) | Криптографическая подпись |
| Стандарт | Собственный (подробности не раскрыты) | C2PA (открытый стандарт) |
Как технически могут работать текстовые вотермарки
Anthropic пока не раскрыла технические детали своего вотермарка — обещана «последующая техническая документация». Но сообщество уже провело аналогии с существующими схемами, и можно достаточно точно описать, какие варианты возможны.
Требования к хорошему вотермарку
Прежде чем разбирать конкретные схемы, определим, каким должен быть вотермарк, чтобы считаться удачным:
- Незаметность: не менять смысл, стиль и качество текста;
- Устойчивость: переживать копирование, частичное редактирование, парафраз;
- Статистическая доказуемость: детектор должен давать количественную оценку (p-value, z-score), а не гадать;
- Секретность ключа: без ключа нельзя ни поставить, ни снять вотермарк;
- Ложноположительная устойчивость: человеческий текст не должен случайно распознаваться как вотермаркнутый.
Наивный вариант: Unicode-гомоглифы
Самый простой способ встроить метку в текст — использовать Unicode-гомоглифы: символы, которые выглядят одинаково, но имеют разные кодовые точки. Например, латинская буква a (U+0061) и кириллическая а (U+0430) выглядят практически идентично. Меняя невидимые для человека символы, можно записать произвольные биты информации — это классическая стеганография.
Существуют генераторы «омоглиф-атак» (например, irongeek.com), показывающие, сколько визуально неотличимых вариантов существует для каждого символа. Есть и механизмы вроде невидимых пробелов, zero-width joiners и т.п.
Почему это плохой вариант для Anthropic? Потому что:
- детектится одним вызовом sed — или, точнее, нормализацией Unicode (NFC/NFKC), которая схлопывает гомоглифы:
sed 's/[^\x00-\x7F]//g'
- виден невооружённым глазом при копировании кода (программисты моментально замечают «битые» кавычки и буквы);
- ломается любым пересказом.
Впрочем, такой механизм уже был обнаружен в Claude Code — но не в тексте вывода, а в системных промптах (об этом ниже).
Статистические вотермарки: две ключевые идеи
Гораздо более серьёзный класс — статистические вотермарки в сэмплере. Они не встраивают явную информацию в текст, а смещают процесс генерации токенов так, чтобы в итоговом распределении токенов появилась статистически заметная, но визуально незаметная структура. Детектор, зная ключ и токенизатор, восстанавливает эту структуру и проверяет гипотезу.
Существует множество реализаций, но ключевых идей по сути две: KGW (по фамилиям авторов — Kirchenbauer, Geiping, Wen) и семейство Christ (турнирная схема, известная как SynthID-Text в Google Gemini).
Метод KGW: зелёный и красный списки
Алгоритм KGW описан в работе «A Watermark for Large Language Models» (Kirchenbauer et al., 2023, arXiv:2301.10226).
Как это работает:
- словарь модели делится на две части — «зелёную» и «красную»;
- разделение зависит от секретного ключа и предыдущих токенов: hash(ключ, предыдущие токены) — для каждой позиции в тексте псевдослучайно выбирается, какая доля словаря «позеленеет»;
- на этапе генерации логиты «зелёных» токенов повышаются на величину δ (дельта);
- если δ достаточно велика, модель статистически чаще выбирает «зелёные» токены — доля зелёных в сгенерированном тексте отклоняется от естественной (например, 50% при размере зелёного списка в половину словаря);
- детектор, зная ключ и токенизатор, воспроизводит раскраску для каждого токена текста и считает долю «зелёных». Если она статистически выше ожидаемой — вычисляется z-оценка, и текст признаётся вотермаркнутым.
Основные свойства и проблемы KGW:
- Плюсы: простота, детекция без хранения полного текста (достаточно токенов), статистическая строгость.
- Минус — искажение распределения: модель выбирает не тот токен, который выбрала бы без метки. При большой δ текст «пишет странно», теряет качество; при малой δ вотермарк легко пропадает при редактировании. Есть математическая граница: чем сильнее вотермарк, тем заметнее деградация.
- Минус — ломкость при редактировании: вставка, удаление или замена токенов ломает цепочку «предыдущих токенов», из-за чего раскраска «разъезжается» и вотермарк может стать недетектируемым.
Метод Christ: турнирная выборка (SynthID-Text)
Второе семейство — турнирные схемы, предложенные в работе «Undetectable Watermarks for Language Models» (Christ, Gunn, Zamir, 2023), промышленную реализацию которой — SynthID-Text — использует Google в Gemini (статья в Nature, 2024).
Идея турнирной схемы:
- из исходного распределения вероятностей модели для следующего токена извлекается 2^m кандидатов;
- кандидаты разбиваются на пары, и проводятся m раундов «турнира на вылет»;
- в каждом раунде для каждого токена вычисляется бит: hash(ключ, предыдущие токены, номер раунда, id токена) → 0 или 1;
- в паре дальше проходит тот кандидат, у которого выпал бит 1;
- после m раундов остаётся один победитель — он становится следующим сгенерированным токеном;
- детектор, зная ключ, воспроизводит турнир и проверяет, действительно ли выбранные токены были победителями своих пар (что при случайном тексте происходит лишь с вероятностью 2^-m на токен).
Сильные стороны турнирной схемы:
- Сохраняет распределение: если извлечение кандидатов и поправки подобраны правильно, распределение выбранных токенов совпадает с исходным — текст не выглядит «странно», в отличие от KGW;
- Многоуровневость: можно настраивать количество раундов m и добавлять корректирующие коды — чем больше m, тем надёжнее детекция, но тем больше падает разнообразие.
Слабые стороны:
- Падение разнообразия: на один и тот же промпт модель с одним и тем же ключом будет выбирать одних и тех же «победителей» — разнообразие между разными ответами снижается (это же свойство делает текст чуть более предсказуемым);
- Сложность реализации: нужно аккуратно извлекать кандидатов из распределения и калибровать веса, иначе можно потерять качество;
- Требование ключа на детекции: как и KGW, требует знания секретного ключа и точного токенизатора.
| Характеристика | KGW | Турнирная схема (Christ / SynthID-Text) |
|---|---|---|
| Принцип | Смещение логитов «зелёных» токенов на δ | Турнир на вылет среди 2^m кандидатов |
| Искажение распределения | Да, прямое | Минимальное (при правильной калибровке) |
| Качество текста | Деградирует при большой δ | Сохраняется |
| Разнообразие ответов | Снижается слабо | Снижается заметнее (одинаковые «победители») |
| Детекция | Z-тест на долю «зелёных» | Проверка «победителей» турниров |
| Устойчивость к парафразу | Низкая | Выше (можно с кодом исправления ошибок) |
| Промышленное использование | OpenAI (исследования), множество Open Source | Google Gemini |
Какое семейство выберет Anthropic — неизвестно. Компания имеет исследовательскую базу (её сотрудники публиковали работы по вотермаркам, включая участие в команде SynthID), а также опубликованные работы о том, что вотермарки «бесплатны» для качества при правильной калибровке. Наиболее вероятен вариант на базе KGW-подобной схемы с ключом, хранимым на сервере, — как самый зрелый и проверенный, либо турнирная схема с поправками. Официально обещается «техническая документация», и до неё остаются только предположения.
Стеганография в промптах Claude Code
Отдельная громкая тема 2026 года — обнаруженная исследователями стеганографическая маркировка системных промптов Claude Code. Разбор на сайте thereallo.dev и его обсуждение на Hacker News показали, что Claude Code — агентный CLI-инструмент Anthropic — встраивает скрытые маркеры в системные промпты, которые отправляет на API Anthropic.
Что было обнаружено (по данным дифференциального анализа исследователя @kirushik):
- системный промпт Claude Code варьируется в зависимости от окружения хоста — часового пояса и значений переменных окружения;
- небольшие различия в пробелах, пунктуации и структуре промпта несут информацию — это не случайный дрейф, а структурированная, воспроизводимая сигнатура;
- по сути, в промпт кодируются метаданные вызывающего окружения: часовой пояс (например, UTC+5:30 кодируется несколькими битами), значения переменных вроде CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC и, предположительно, хэш API-ключа;
- маркировка сохраняется даже при установке флага CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1, который должен отключать «необязательный трафик», — что намекает, что Anthropic считает это «essential traffic».
Для чего это нужно? Основная гипотеза — защита от дистилляции модели. Если на рынке появится модель, обученная на ответах Claude, Anthropic сможет проверить, содержат ли её выводы латентные отпечатки промптов — это судебно-аналитическая цепочка провенанса для защиты интеллектуальной собственности.
В контексте анонса о маркировке контента это выглядит частью единой многослойной экосистемы маркировки, которую Anthropic строит в 2026 году. Но есть и тревожный аспект: в отличие от Google, которая публично заявляет о SynthID, Anthropic не раскрывала стеганографию промптов до обнаружения сообществом. Это породило волну обсуждений о прозрачности и о том, как разработчики, использующие Claude API, должны относиться к скрытым маркерам в своих промптах.
Атаки на вотермарки
Любая схема маркировки уязвима. Учитывая, что Anthropic применяет детерминированный ключ, сообщество может статистически оценивать поведение схемы, а значит — атаковать её. Рассмотрим основные классы атак.
Парафразирование и пересказ
Самая простая атака: попросить другую (локальную) модель «перефразировать» текст. Любой статистический вотермарк — и KGW, и турнирная схема — ломается пересказом, потому что меняется сама последовательность токенов:
- KGW: раскраска зависит от цепочки предыдущих токенов; пересказ рвёт цепочку, и статистический сигнал исчезает;
- Турнирная схема: новые токены не являются «победителями» турниров, посчитанных для оригинального ключа;
- Гомоглифы: исчезают при переписывании.
Устойчивость SynthID-Text выше именно за счёт встроенных кодов исправления ошибок, но и она не гарантирована. Anthropic в официальных ограничениях честно признаёт: текст, который «сильно отредактирован, перефразирован, переведён или смешан с другим письмом», может не нести детектируемой метки.
Watermark stealing (кража вотермарка)
Более серьёзная атака — watermark stealing, описанная в работе Hlavacek et al. (2024) «Watermark Stealing in Large Language Models».
Идея: если у атакующего есть доступ к «оракулу» — например, к вотермаркнутой модели или к детектору, — он может:
- собирать пары (промпт, вотермаркнутый текст);
- статистически оценивать, какие токены и при каких условиях «зеленеют» (в KGW) или побеждают в турнирах;
- по сути, восстанавливать поведение ключа на всём словаре;
- после этого либо убирать вотермарк без потери качества, либо подделывать его (ставить вотермарк на чужой текст, чтобы подставить другого).
Это подрывает саму основу схемы: секретность ключа перестаёт быть секретом, если схему можно восстановить по наблюдениям. Чем больше текста вы отдаёте наружу (а вотермаркнутый текст выходит наружу по определению — иначе зачем маркировать?), тем больше данных для атаки.
Watermark distillation (дистилляция)
Смежная атака — watermark distillation (Swaminathan et al., arXiv:2312.04469). Атакующий использует вотермаркнутые ответы модели как обучающие данные: если дистиллировать «студента» на вотермаркнутом тексте, студент частично перенимает статистический сигнал вотермарка.
Кажется, это плюс для защиты? На деле — наоборот: дистилляция позволяет:
- убрать вотермарк: если в обучение добавить шум, дропаут или нормализацию, студент усвоит смысл, но не статистическую структуру — вотермарк «стирается» в процессе обучения;
- проверить, откуда данные: вотермарк может работать как «маяк» для поиска несанкционированных дистиллированных моделей (это, вероятно, одна из целей стеганографии в Claude Code);
- атаковать детектор: обучив модель на парах (текст, метка), можно обманывать детекторы.
Для провайдеров дистилляция — главный кошмар: вотермарк, который должен защищать модель, сам становится инструментом для её копирования, а при неудачной настройке — и для удаления меток в больших объёмах.
Детерминированный ключ — корень проблем
Все эти атаки объединяет одна причина: у схемы есть единый детерминированный ключ, и он используется на множестве запросов. Чем больше ответов сгенерировано с одним ключом, тем больше статистики у атакующего. Anthropic может ротировать ключи, использовать случайную выборку ключей, добавлять шум — но каждая такая мера снижает детектируемость или увеличивает стоимость.
Официальные ограничения системы
Anthropic честно перечисляет ограничения своей системы. Это важная часть: система маркировки не является полноценным AI-детектором.
Найденная метка ≠ авторство Claude
Обнаружение метки Claude — сигнал того, что контент мог быть обработан Claude, но не более. Причины:
- Claude может быть не автором. Люди часто используют Claude для корректуры, перевода, суммаризации, конвертации файлов. Результат может нести метку Claude, даже если идеи, текст и данные изначально принадлежали человеку или другому источнику.
- Контент мог измениться после обработки. Помеченный контент может быть модифицирован, сокращён или объединён с другим материалом после того, как Claude его обработал.
Отсутствие метки ≠ человеческое авторство
Отсутствие детектируемой метки не доказывает, что текст написан человеком. Метка может не обнаруживаться, если:
- контент сгенерирован моделью, выпущенной до внедрения маркировки;
- текст сильно отредактирован, перефразирован, переведён или смешан с другим текстом;
- отрывок слишком короткий — слишком мало текста для надёжного статистического сигнала;
- метаданные файла удалены при конвертации формата, пересохранении, скриншоте или другими способами;
- контент создан на платформе, в функции или в формате файла, где конкретный тип маркировки не поддерживался.
Это означает, что система задумана как сигнал провенанса, а не как самостоятельный детектор AI-контента. Её нельзя использовать как доказательство в суде, для наказания студентов или для автоматических блокировок без дополнительного контекста.
Влияние на разработчиков и пользователей
Для разработчиков, использующих API
Anthropic прямо пишет: если вы разворачиваете Claude в своём продукте, вы должны самостоятельно оценить, что статья 50 EU AI Act требует от ваших продуктов. Конкретно:
- если ваше приложение генерирует изображения, аудио или видео через GPAI API — вы обязаны сохранять и распространять метаданные провенанса от провайдера;
- нельзя удалять C2PA-метаданные в своём конвейере;
- вы должны маркировать дипфейки (Article 50(3)).
С учётом стеганографии промптов, о которой речь шла выше, разработчикам стоит:
- проверять, какие скрытые маркеры попадают в их системные промпты;
- быть осторожными с кэшированием и перераспространением ответов: вотермаркнутый контент несёт сигнатуру, которую нельзя «отмыть»;
- следить за официальной документацией Anthropic по детекции и маркировке.
Для программистов и качества кода
Один из главных страхов сообщества, озвученный сразу после анонса: модели могут начать писать менее оптимальный код в угоду маркерам. Логика простая: если вотермарк требует статистического сдвига в выборе токенов, модель может пожертвовать «самым естественным» продолжением — а в коде самым естественным продолжением часто является самый идиоматичный, эффективный или минимальный фрагмент.
Насколько этот страх обоснован? Опыт KGW показывает, что при калибровке δ < 3 искажение качества незначительно, а турнирные схемы и вовсе могут сохранять распределение. Но компромисс фундаментален: чем надёжнее вотермарк, тем заметнее деградация или потеря разнообразия. В коде потеря разнообразия особенно опасна: одни и те же «победители турнира» означают, что на похожие задачи модель будет генерировать похожие (возможно, не лучшие) решения.
Впрочем, важно отметить: Anthropic заявляет, что вотермарк «не меняет качество, стиль и читаемость», и технически это может быть правдой для качественно откалиброванных схем. Останется ли это правдой после давления регуляторов — вопрос открытый.
Для обычных пользователей
Для обычных пользователей Claude последствия двойственные:
Плюсы:
- прозрачность: можно проверить, был ли текст обработан AI;
- единый стандарт: метки работают глобально, во всех продуктах Claude и у облачных партнёров.
Минусы:
- персональные тексты, переведённые или отредактированные Claude, будут нести метку «обработано Claude» — даже если автор текста — вы;
- невозможно «снять» метку легально — это может мешать публикации авторских материалов;
- детекторы могут использоваться для автоматических решений без учёта контекста;
- если вотермарк повлияет на качество генерации (особенно кода), это почувствуют все.
Конфиденциальность и правовые риски
Отдельный слой рисков — юридический:
- GDPR: если метаданные в ответах связываемы с физическим лицом (например, через хэш ключа), возможны обязательства по прозрачности (Articles 13–14) и DPIA (Article 35);
- Коммерческая тайна: ответы, несущие скрытые маркеры, уходят в продукты третьих сторон, что может раскрывать использование Claude клиентами;
- Сокрытие от клиентов: если маркировка не раскрыта в пользовательском соглашении, это риск для доверия и судебных споров.
Экосистема маркировки в 2026 году
Анонс Anthropic — не изолированное событие, а часть общей картины:
- Google / DeepMind: SynthID работает в Gemini с 2024 года для изображений и текста; компания публично заявляет о существовании вотермарков — в отличие от скрытой стеганографии Claude Code;
- OpenAI: публиковала исследования по вотермаркам (работа Скотта Ааронсона, позже — исследовательские статьи), патентовала подходы к фингерпринтингу запросов; массового включения в продукты не было;
- C2PA: стандарт становится де-факто индустриальным: подпись манифестов поддерживают Adobe (Content Credentials), Microsoft, Google, OpenAI;
- EU AI Act: Article 50(4) требует от всех провайдеров, генерирующих синтетический контент, машиночитаемой маркировки; CEN/CENELEC ссылаются на C2PA как на конформный подход;
- DeepSeek, Mistral, Meta и др.: каждый выбирает свой путь — от полного отсутствия до открытых схем (например, Meta публиковала исследования по перцептивным вотермаркам).
В этом контексте Anthropic замыкает тройку крупнейших американских лабораторий, внедряющих маркировку на уровне модели. Вопрос не в том, будет ли маркировка — она будет. Вопрос в том, чья схема устойчивее к атакам и кто больше потеряет в качестве и прозрачности.
Что остаётся неясным
На момент публикации этой статьи (11 августа 2026 года) официально не раскрыты:
- какой именно алгоритм вотермарка использует Claude (KGW-подобный, турнирный, гибрид);
- как работает детектор и будет ли он публичным;
- как обрабатываются короткие тексты (Anthropic признаёт, что для коротких отрывков сигнал может быть недостаточен);
- когда именно обновят старые модели;
- как поведут себя облачные партнёры (AWS, Google Cloud, Microsoft Foundry) с C2PA-метаданными;
- как будет решаться конфликт между секретностью ключа и обязательствами по прозрачности.
Anthropic обещает публиковать техническое руководство «по мере готовности». Сообщество продолжает эксперименты: уже появились инструменты для проверки текстов на стеганографию и исследования поведения API при разных настройках.
Заключение: выстрел в ногу или необходимый шаг?
В техническом сообществе анонс встретили скептически. Главные аргументы критиков:
- Вотермарки ломаются: парафраз, перевод или даже ручное редактирование уничтожают сигнал — система даёт ложное чувство защищённости;
- Watermark stealing: секретность ключа иллюзорна, схему можно восстановить статистически;
- Качество страдает: есть риск, что модели начнут генерировать менее оптимальный код и текст ради маркеров;
- Пользователи платят первыми: маркировка вводится не потому, что её хотят пользователи, а из-за регуляторного давления — а неудобства (метки на переведённых личных текстах, снижение разнообразия) ложатся на них;
- Конфликт с прозрачностью: стеганография Claude Code была скрытой — как это сочетается с «транспарентностью», которую требует EU AI Act?
Аргументы сторонников:
- регуляторное требование существует, и лучше подготовиться заранее;
- система проектируется с осторожностью: явные ограничения, честное описание ложноположительных и ложноотрицательных случаев;
- вотермарки — часть зрелой экосистемы (SynthID доказал работоспособность в промышленности);
- открытая детекция позволит журналистам, платформам и пользователям лучше ориентироваться в происхождении контента.
Итог: маркировка — не техническое поражение и не победа, а компромисс. Её реальная ценность будет определяться не красотой алгоритма, а тем, насколько честно Anthropic опишет ограничения, насколько устойчива окажется схема и сколько качества она отнимет у пользователей. Пока это — «выстрел в ногу» для тех, кто рассчитывал на безусловно чистый контент, и «необходимый шаг» для тех, кто видит в прозрачности ценность. Ответ появится, когда выйдет техническая документация и сообщество начнёт тестировать детектор вживую.
Резюме
- 11 августа 2026 года Anthropic анонсировала машиночитаемую маркировку контента Claude в рамках EU AI Act (Article 50(2) Code of Practice).
- Модели, запущенные в ЕС с 2 августа 2026 года, маркируют контент с первого дня; старые модели получат маркировку в переходный период.
- Используются два механизма: невидимые вотермарки в тексте (на уровне модели, переживают копирование и частичное редактирование) и подписанные C2PA-метаданные для файлов (.svg, .png, .jpg).
- Маркировка применяется глобально во всех продуктах Claude (API, Claude Code, Claude Cowork, Claude Tag) и у облачных партнёров (AWS, Google Cloud, Microsoft Foundry).
- Технически текстовые вотермарки делятся на два семейства: KGW (сдвиг логитов «зелёных» токенов, детекция z-тестом) и турнирные схемы Christ/SynthID-Text (выбор «победителя» из 2^m кандидатов). Конкретный метод Claude не раскрыт.
- Наивная альтернатива — Unicode-гомоглифы — снимается одним вызовом sed/нормализацией Unicode.
- Claude Code уже содержит стеганографические маркеры в системных промптах (часовой пояс, переменные окружения), обнаруженные исследователями в июне 2026 года.
- Основные атаки: парафразирование (ломает все статистические схемы), watermark stealing (восстановление ключа по наблюдениям), watermark distillation (использование вотермаркнутого текста для обучения и снятия меток).
- Официальные ограничения: найденная метка не доказывает авторство Claude, отсутствие метки не доказывает человеческое авторство.
- Риски: возможное снижение качества кода и разнообразия ответов, метки на личных переведённых текстах, правовые риски для разработчиков (GDPR, распространение C2PA-метаданных).
- Техническая документация по детекции и реализации обещана Anthropic «по мере готовности».
Ссылки
- Официальная статья Anthropic: How Claude marks AI-generated content
- Kirchenbauer et al., A Watermark for Large Language Models (KGW), arXiv:2301.10226
- Christ, Gunn, Zamir, Undetectable Watermarks for Language Models, arXiv:2306.09194
- SynthID: Scalable watermarking for identifying large language model outputs (Nature, 2024)
- Watermark Stealing in Large Language Models (Hlavacek et al., 2024)
- Watermark Distillation (Swaminathan et al., arXiv:2312.04469)
- Claude Code Prompt Steganography — разбор thereallo
- Homoglyph Attack Generator
- Anthropic to Add Invisible Watermarks to All Claude AI Outputs — CybersecurityNews
- Claude AI Watermark: How it works — Business Standard
- EU AI Act Art.50 Watermarking: Technical Implementation Guide
- Claude's Steganographic Request Marking: What Developers Need to Know
