
Кілька днів тому компанія Anthropic оголосила, що майбутні моделі Claude генеруватимуть текст із вбудованим водяним знаком. Тепер компанія вирішила детально пояснити, як саме працюватиме цей механізм. За задумом, водяний знак дозволить визначити ймовірність того, що текст був написаний саме за участю Claude.

Принцип нового механізму маркування базується на тому, що мовні моделі на кшталт Claude генерують текст слово за словом. Щоразу вони обирають наступне слово зі списку ймовірних варіантів. Наприклад, у реченні «Погода сьогодні була холодна і…» наступним словом навряд чи стане «цукрова», але цілком імовірно — «похмура» чи «сіра». У таких випадках, коли кілька варіантів практично рівнозначні за змістом, вибір зазвичай визначається випадковим числом.
Водяний знак використовує саме такі «низькоризикові» моменти вибору — яких у будь-якому згенерованому тексті трапляється багато — щоб залишити у відповідях Claude непомітний для читача патерн. Розпізнати цю послідовність слів можна лише за наявності спеціального ключа.
Технічно слова так само обираються випадково, але джерелом цієї випадковості стає не довільний генератор чисел, а комбінація ключа та кількох попередніх слів. Це дозволяє перевірити, чи узгоджується послідовність слів у тексті з тим вибором, який зробив би Claude, використовуючи цей ключ. На основі цього можна оцінити ймовірність, що текст згенеровано саме цією моделлю.
Важливо: водяний знак не змушує модель постійно обирати одне й те саме слово (наприклад, завжди «похмура», а не «сіра») — вибір, як і раніше, залежить від контексту. Він також не підштовхує Claude до слів, які модель за звичайних умов навіть не розглядала б.
Чи впливає це на якість тексту?
За даними Anthropic, водяний знак жодним чином не впливає на якість, креативність чи читабельність текстів Claude. Для читача він нічим не відрізняється від звичайного — на відміну від водяних знаків на банкнотах чи документах, які видно неозброєним оком.
Компанія посилається на дослідження Google DeepMind, викладене в статті про метод SynthID-Text у журналі Nature — саме на цьому методі базується підхід Anthropic. Тестуючи водяні знаки на частині трафіка Gemini, DeepMind не виявили статистично значущої різниці в оцінках користувачів («лайки» проти «дизлайків») між моделями з водяним знаком і без нього. Контрольоване дослідження з участю людей-оцінювачів також не показало різниці в якості відповідей.
Anthropic пропонує таку аналогію: уявіть гру в «Монополію», де замість кидання кубика гравці по черзі використовують цифри з числа пі. Результат для гри залишається однаково випадковим — але якщо потім проаналізувати всю послідовність ходів, маючи значення пі, можна встановити, що саме воно було джерелом випадковості. Так само працює водяний знак у тексті: він не змінює сенсу чи сприйняття тексту читачем, але дозволяє згодом перевірити, чи брав участь у його створенні Claude.
Обмеження методу
У Anthropic наголошують: водяний знак може лише відповісти на питання «яка ймовірність, що цей текст частково написав Claude». Він не підтверджує, що текст написаний людиною, і не може визначити, чи його створив інший штучний інтелект (навіть якщо той теж використовує водяні знаки — ключ і метод будуть іншими).
Метод погано працює на коротких фрагментах тексту — там менше можливостей для вибору слів, а отже, менше «сигналу». Що довший текст, то вища впевненість у результаті перевірки.
Водяний знак також слабше проявляється у фактологічних текстах, де варіативність слів мінімальна: наприклад, у фразі «Найвідоміша праця Ісаака Ньютона називалася Principia…» немає простору для вибору — правильна відповідь лише одна. Те саме стосується коректури: якщо Claude лише виправляє граматику та пунктуацію в чужому тексті, водяному знаку майже немає на чому «закріпитися».
А що з кодом і редагуванням чужих текстів?
Коли Claude редагує написаний людиною текст, водяний знак застосовується лише до тих слів, які обрав сам Claude. Якщо правки незначні, вловити водяний знак може бути складно чи неможливо — просто через брак «матеріалу».
З кодом ситуація схожа: там, де потрібне точне, єдино правильне рішення (наприклад, «2 + 2 =» точно завершується «4»), водяний знак не застосовується — адже вибору між рівнозначними варіантами тут немає. Тому код у цілому має суттєво менше водяного маркування, ніж звичайний текст, хоча в довільних елементах — наприклад, коментарях у коді — водяний знак все ж може бути присутній.
Практичні питання щодо водяних знаків Claude
Чи сповільнює це роботу моделі або підвищує вартість? Ні — водяний знак не потребує додаткових токенів і не впливає на швидкість генерації.
Чи можна відстежити знак до конкретного користувача чи організації? Ні. Водяний знак стосується лише моделі та її виводу — він не містить жодної ідентифікуючої інформації про користувача, компанію чи конкретний чат.
Чому взагалі впроваджують водяні знаки? Причина — вимоги Кодексу практик ЄС щодо прозорості контенту, згенерованого ШІ (EU Code of Practice on Transparency of AI-Generated Content), який Anthropic підписала в липні 2026 року разом із приблизно 190 іншими організаціями. Водяне маркування впроваджується глобально одразу при запуску — оскільки наразі немає надійного способу обмежити його лише регіоном ЄС.
Як перевірити, чи текст написаний Claude? Anthropic найближчим часом планує запустити окремий API для виявлення водяних знаків.
А що з зображеннями та іншими файлами? Для підтримуваних форматів файлів (наприклад, .png, .jpg, .svg) Claude додаватиме криптографічно підписану мітку в метадані файлу за відкритим галузевим стандартом C2PA — тим самим, який використовують виробники камер і редактори фото. Це не водяний знак: файл не змінюється, мітка лише вказує на участь Claude у створенні чи обробці файлу.
Чи можна обійти водяний знак редагуванням тексту? Частково так. Легке редагування, ймовірно, не видалить знак повністю, а повне переписування кожного слова — видалить.
Чи застосовується це до перекладів? Так — якщо кожне слово в перекладі обирає Claude, водяний знак застосовується повністю.
А старі моделі Claude? Закон ЄС передбачає перехідний період для моделей Anthropic, випущених до 2 серпня 2026 року — компанія працює над додаванням водяних знаків і для них, впровадження триватиме кілька місяців.
Чим це відрізняється від сервісів виявлення ШІ-тексту на кшталт Pangram? Такі сервіси не мають ключа Anthropic і покладаються на інший підхід — пошук характерних «слідів» у стилі ШІ (наприклад, конструкцію «це не X, це Y» або надмірне вживання певних слів). Це принципово інший метод, ніж перевірка водяного знака.
Чи змінює це права власності на текст або відповідальність за нього? Ні. Водяний знак лише допомагає перевірити, чи міг Claude брати участь у створенні контенту — він не стосується авторства чи прав власності і не змінює умов використання сервісу.
