Як працює водяний знак у тексті та коді Claude — пояснення від Anthropic

Фото до статті

Дмитро Сімагін

Редактор

Нещодавно Anthropic повідомила, що майбутні ітерації Claude будуть генерувати текст з інтегрованим цифровим маркером. Тепер компанія надала розширені пояснення щодо функціонування цього механізму. Основна мета — дати змогу визначати ймовірність того, що текст було створено за участю Claude.

Суть нового методу маркування полягає в тому, що такі системи, як Claude, формують текст послідовно, вибираючи наступне слово з набору потенційних варіантів. Наприклад, у фразі «Температура сьогодні була низькою і…» наступним елементом навряд чи буде «солодкою», проте цілком імовірно — «холодною» або «мрячною». У ситуаціях, коли кілька варіантів є практично еквівалентними за значенням, вибір часто визначається випадковим чином.

Цифровий маркер використовує саме такі «малоризиковані» точки вибору — яких у будь-якому створеному тексті є чимало — для вписування в результати роботи Claude непомітного для читача патерну. Ідентифікувати цю послідовність елементів можна лише за наявності спеціального ключа.

Технічно вибір слів залишається випадковим, але джерелом цієї випадковості стає не довільний генератор чисел, а поєднання ключа та попередніх елементів тексту. Це дозволяє перевірити, чи відповідає послідовність слів у тексті вибору, який зробила б система Claude з цим ключем, і на основі цього визначити ймовірність генерації тексту цією моделлю.

Важливо: цифровий маркер не змушує систему постійно обирати однакове слово (наприклад, завжди «холодною», а не «мрячною») — вибір, як і раніше, залежить від контексту. І він не спонукає Claude до використання слів, які система за звичайних обставин навіть не розглядала б.

Чи впливає це на якість генерації?

За даними Anthropic, цифровий маркер жодним чином не впливає на якість, оригінальність чи зрозумілість текстів, створених Claude. Для читача маркований текст нічим не відрізняється від звичайного — на відміну від водяних знаків на банкнотах чи документах, які помітні неозброєним оком.

Компанія посилається на дослідження Google DeepMind, опубліковане в журналі Nature щодо методу SynthID-Text — саме на цьому методі базується підхід Anthropic. Під час тестування цифрових маркерів на частині трафіку Gemini, DeepMind не виявила статистично значущої різниці в оцінках користувачів («лайки» проти «дизлайків») між моделями з маркером і без нього. Контрольоване дослідження за участю людей-оцінювачів також не показало відмінностей у якості результатів.

Anthropic пропонує таку аналогію: уявіть гру в «Монополію», де замість кидання кубика гравці по черзі використовують цифри з числа пі. Результат для гри залишається однаково випадковим — але якщо потім проаналізувати всю послідовність ходів, маючи значення пі, можна встановити, що саме воно було джерелом випадковості. Так само працює цифровий маркер у тексті: він не змінює змісту чи сприйняття тексту читачем, але дозволяє згодом перевірити, чи брав участь у його створенні Claude.

Обмеження підходу

У Anthropic наголошують: цифровий маркер може лише дати відповідь на питання «яка ймовірність, що цей текст частково написав Claude». Він не підтверджує, що текст написано людиною, і не може визначити, чи його створив інший штучний інтелект (навіть якщо той теж використовує цифрові маркери — ключ і метод будуть іншими).

Метод малоефективний на коротких уривках тексту — там менше можливостей для вибору слів, а отже, менше «сигналу». Що довший текст, то вища ймовірність точного результату перевірки.

Цифровий маркер також слабше виявляється у фактичних текстах, де варіативність слів обмежена: наприклад, у фразі «Найвідоміша праця Ісаака Ньютона називалася Principia…» немає простору для вибору — правильна відповідь лише одна. Те саме стосується коректури: якщо Claude лише виправляє граматику та пунктуацію в чужому тексті, цифровому маркеру майже немає на чому «зачепитися».

А як щодо програмного коду та редагування чужих текстів?

Коли Claude редагує написаний людиною текст, цифровий маркер застосовується лише до тих слів, які обрав сам Claude. Якщо правки незначні, виявити цифровий маркер може бути складно або неможливо — просто через брак «матеріалу».

З програмним кодом ситуація аналогічна: там, де потрібне точне, єдино правильне рішення (наприклад, «2 + 2 =» точно завершується «4»), цифровий маркер не застосовується — адже вибору між рівнозначними варіантами тут немає. Тому код у цілому має суттєво менше цифрового маркування, ніж звичайний текст, хоча в довільних елементах — наприклад, коментарях у коді — цифровий маркер все ж може бути присутній.

Практичні аспекти щодо цифрових маркерів Claude

Чи сповільнює це роботу системи або підвищує вартість? Ні — цифровий маркер не потребує додаткових токенів і не впливає на швидкість генерації.

Чи можна відстежити маркер до конкретного користувача чи організації? Ні. Цифровий маркер стосується лише системи та її виводу — він не містить жодної ідентифікуючої інформації про користувача, компанію чи конкретний діалог.

Чому взагалі впроваджують цифрові маркери? Причина — вимоги Кодексу належних практик ЄС щодо прозорості контенту, згенерованого ШІ (EU Code of Practice on Transparency of AI-Generated Content), який Anthropic підписала в липні 2026 року разом із приблизно 190 іншими організаціями. Цифрове маркування впроваджується глобально одразу при запуску — оскільки наразі немає надійного способу обмежити його лише регіоном ЄС.

Як перевірити, чи текст написаний Claude? Anthropic найближчим часом планує запустити окремий API для виявлення цифрових маркерів.

А що з зображеннями та іншими файлами? Для підтримуваних форматів файлів (наприклад, .png, .jpg, .svg) Claude додаватиме криптографічно підписану мітку в метадані файлу за відкритим галузевим стандартом C2PA — тим самим, який використовують виробники камер і редактори фото. Це не цифровий маркер: файл не змінюється, мітка лише вказує на участь Claude у створенні чи обробці файлу.

Чи можна обійти цифровий маркер редагуванням тексту? Частково так. Легке редагування, ймовірно, не видалить маркер повністю, а повне переписування кожного слова — видалить.

Чи застосовується це до перекладів? Так — якщо кожне слово в перекладі обирає Claude, цифровий маркер застосовується повністю.

А старі системи Claude? Закон ЄС передбачає перехідний період для систем Anthropic, випущених до 2 серпня 2026 року — компанія працює над додаванням цифрових маркерів і для них, впровадження триватиме кілька місяців.

Чим це відрізняється від сервісів виявлення текстів ШІ на кшталт Pangram? Такі сервіси не мають ключа Anthropic і покладаються на інший підхід — пошук характерних «слідів» у стилі ШІ (наприклад, конструкцію «це не X, це Y» або надмірне вживання певних слів). Це принципово інший метод, ніж перевірка цифрового маркера.

Чи змінює це права власності на текст або відповідальність за нього? Ні. Цифровий маркер лише допомагає перевірити, чи міг Claude брати участь у створенні контенту — він не стосується авторства чи прав власності і не змінює умов використання сервісу.

Нагадаємо, нещодавно стало відомо, що китайська компанія ByteDance розробляє гігантську LLM на 10 трлн параметрів, щоб наздогнати Claude.

Головна > Новини > Як працює водяний знак у текстах і коді Claude — пояснює Anthropic

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *