Як діє прихований водяний знак у текстах та коді Claude, пояснює Anthropic

Фото до статті

Дмитро Сімагін

Редактор

Нещодавно Anthropic повідомила, що майбутні версії Claude будуть створювати тексти із вбудованим цифровим водяним знаком. Зараз компанія надала детальні пояснення щодо функціонування цього механізму. Основна мета — дозволити ідентифікувати ймовірність того, що текст було згенеровано за допомогою Claude.

Новий метод розмітки ґрунтується на принципі генерації тексту мовними моделями, як-от Claude: послідовно, слово за словом, з вибором наступного варіанту з переліку ймовірних. Наприклад, після фрази «Погода сьогодні була прохолодна і…» найменш ймовірним продовженням буде «цукрова», тоді як «похмура» чи «сіра» є цілком можливими. У ситуаціях, коли декілька варіантів мають близьке значення, вибір часто визначається випадковим чином.

Цифровий маркер використовує саме такі моменти з низьким ризиком вибору — яких у будь-якому згенерованому тексті чимало — щоб вбудувати в відповіді Claude непомітний для ока патерн. Розпізнати цю закономірність слів можливо лише за наявності спеціального ключа.

Технічно вибір слів залишається випадковим, але джерелом цієї випадковості виступає не довільний генератор, а поєднання ключа та попередніх слів. Це дозволяє перевірити, чи відповідає послідовність слів у тексті вибору, який би зробив Claude з цим ключем, і на цій основі оцінити вірогідність генерації тексту саме цією моделлю.

Важливо зазначити: водяний знак не примушує модель завжди обирати одне й те саме слово (наприклад, «похмура» замість «сіра») — вибір, як і раніше, залежить від контексту. І він не спонукає Claude до вживання слів, які модель за звичайних умов не розглядала б.

Чи впливає це на якість контенту?

За даними Anthropic, цифровий маркер жодним чином не впливає на якість, креативність чи зручність читання текстів Claude. Для читача такий текст виглядає ідентично звичайному — на відміну від водяних знаків на купюрах чи документах, які помітні неозброєним оком.

Компанія посилається на дослідження Google DeepMind, опубліковане в журналі Nature під назвою SynthID-Text — саме воно є основою підходу Anthropic. Тестуючи водяні знаки на частині трафіку Gemini, DeepMind не виявили статистично значущих відмінностей у відгуках користувачів («лайки» проти «дизлайків») між моделями з цифровим маркуванням і без нього. Контрольоване дослідження із залученням людей-оцінювачів також не показало різниці в якості відповідей.

Anthropic наводить таку аналогію: уявіть гру в «Монополію», де замість кидка кубика гравці послідовно використовують цифри з числа пі. Результат гри залишається однаково випадковим — але якщо потім проаналізувати всю послідовність ходів, маючи доступ до значення пі, можна встановити, що саме воно було джерелом випадковості. Подібним чином діє водяний знак у тексті: він не змінює змісту чи сприйняття тексту читачем, але дає змогу згодом перевірити, чи брав Claude участь у його створенні.

Обмеження методу

В Anthropic підкреслюють: цифровий маркер може лише дати відповідь на питання «яка ймовірність, що цей текст частково написав Claude». Він не підтверджує авторство людини і не може визначити, чи створено текст іншим штучним інтелектом (навіть якщо той теж використовує водяні знаки — ключ і метод будуть іншими).

Метод малоефективний для коротких уривків тексту — вони надають менше можливостей для вибору слів, а отже, менше «сигналу». Чим довший текст, тим вища впевненість у результаті перевірки.

Цифровий маркер також менш помітний у фактологічних текстах, де варіативність слів мінімальна: наприклад, у реченні «Найвідоміша праця Ісаака Ньютона називалася Principia…» немає простору для вибору — правильна відповідь лише одна. Те саме стосується коректури: якщо Claude лише виправляє граматику та пунктуацію в чужому тексті, водяному знаку майже ні на чому «зачепитися».

А як щодо коду та редагування чужих текстів?

Коли Claude редагує текст, написаний людиною, цифровий маркер застосовується лише до тих слів, які обрав сам Claude. Якщо правки незначні, виявити водяний знак може бути складно або неможливо — просто через недостатність «матеріалу».

З кодом ситуація подібна: там, де потрібне точне, однозначне рішення (наприклад, «2 + 2 =» точно завершується «4»), водяний знак не застосовується — адже вибір між рівнозначними варіантами тут відсутній. Тому код загалом має значно менше цифрового маркування, ніж звичайний текст, хоча в довільних елементах — наприклад, коментарях у коді — цифровий маркер все ж може бути присутнім.

Практичні аспекти використання цифрових маркерів Claude

Чи уповільнює це роботу моделі або збільшує витрати? Ні — цифровий маркер не потребує додаткових токенів і не впливає на швидкість генерації.

Чи можна відстежити знак до конкретного користувача чи організації? Ні. Цифровий маркер стосується лише моделі та її виводу — він не містить жодної інформації, що ідентифікує користувача, компанію чи конкретний чат.

Чому взагалі впроваджуються цифрові маркери? Причина — вимоги Кодексу належної практики ЄС щодо прозорості контенту, згенерованого ШІ (EU Code of Practice on Transparency of AI-Generated Content), який Anthropic підписала в липні 2026 року разом із приблизно 190 іншими організаціями. Цифрове маркування впроваджується глобально одразу при запуску — оскільки наразі немає надійного способу обмежити його лише регіоном ЄС.

Як перевірити, чи текст написаний Claude? Anthropic найближчим часом планує запустити окремий API для виявлення цифрових маркерів.

А що з зображеннями та іншими файлами? Для підтримуваних форматів файлів (наприклад, .png, .jpg, .svg) Claude додаватиме криптографічно підписану мітку в метадані файлу згідно з відкритим галузевим стандартом C2PA — тим самим, який використовують виробники камер і редактори фото. Це не водяний знак: файл не змінюється, мітка лише вказує на участь Claude у створенні чи обробці файлу.

Чи можна обійти цифровий маркер шляхом редагування тексту? Частково так. Легке редагування, ймовірно, не видалить маркер повністю, а повне переписування кожного слова — видалить.

Чи застосовується це до перекладів? Так — якщо кожне слово в перекладі обирає Claude, цифровий маркер застосовується повністю.

А старі версії Claude? Закон ЄС передбачає перехідний період для моделей Anthropic, випущених до 2 серпня 2026 року — компанія працює над додаванням цифрових маркерів і для них, впровадження триватиме кілька місяців.

Чим це відрізняється від сервісів виявлення ШІ-тексту на кшталт Pangram? Такі сервіси не мають ключа Anthropic і покладаються на інший підхід — пошук характерних «слідів» у стилі ШІ (наприклад, конструкцію «це не X, це Y» або надмірне вживання певних слів). Це принципово інший метод, ніж перевірка цифрового маркера.

Чи змінює це права власності на текст або відповідальність за нього? Ні. Цифровий маркер лише допомагає перевірити, чи міг Claude брати участь у створенні контенту — він не стосується авторства чи прав власності і не змінює умов використання сервісу.

Нагадаємо, нещодавно стало відомо, що китайська компанія ByteDance розробляє гігантську LLM на 10 трлн параметрів, щоб конкурувати з Claude.

Головна > Новини > Як працює водяний знак у текстах і коді Claude — пояснює Anthropic

Джерело

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *