OpenAI внедрит невидимые водяные знаки в тексты ChatGPT и Codex

OpenAI объявила о внедрении скрытых водяных знаков для текстов, созданных в ChatGPT и Codex. На первом этапе технология появится в странах Европейского союза, где вступают в силу требования закона об искусственном интеллекте.
Европейские правила обязывают разработчиков генеративных моделей делать созданный ими контент распознаваемым с помощью алгоритмов. В ближайшие недели невидимые метки начнут добавляться к ответам пользователей ChatGPT всех тарифов в ЕС.
Для клиентов API OpenAI намерена предложить эту функцию по всему миру, но в формате опции, которую можно включить по желанию. Детектор водяных знаков вначале будет доступен только проверенным исследователям и профильным организациям. Позднее компания планирует опубликовать исходный код технологии.
Как работает textGrain
Система получила название textGrain. Она добавляет в текст малозаметный статистический паттерн во время выбора нейросетью следующих слов. По внутренним бенчмаркам OpenAI, испытания на флагманской модели Astra показали: технология практически не влияет на качество и точность ответов.
При этом разработчики признают, что метод не универсален. Детектор хуже справляется с короткими фрагментами, а также с текстами на темы, где выбор формулировок ограничен. В качестве примера OpenAI приводит математику: из-за специфики таких ответов алгоритму сложнее выделить статистический признак.
Редактирование снижает точность обнаружения
Водяной знак также можно частично разрушить обычным редактированием. Если в тексте объёмом 400 токенов заменить синонимами 10% слов, точность распознавания снижается с 92% до 66%. При замене четверти слов показатель падает до 17%.
В OpenAI подчёркивают, что метка не содержит сведений о пользователе и не раскрывает исходные промпты. Она также не подтверждает достоверность содержания: детектор может показать, что текст был сгенерирован моделью, но не способен определить, правдивы ли изложенные в нём утверждения.


