OpenAI внедрит невидимые водяные знаки в тексты ChatGPT и Codex

OpenAI объявила о внедрении скрытых водяных знаков в текстовые ответы ChatGPT и Codex. В странах Европейского союза технология должна заработать в ближайшие недели и будет применяться к пользователям всех тарифов.
Изменение связано с требованиями европейского закона об искусственном интеллекте. Нормы обязывают разработчиков генеративных моделей делать созданный искусственным интеллектом контент распознаваемым для алгоритмов. В OpenAI рассчитывают выполнить это требование с помощью статистических меток, которые незаметны при обычном чтении.
Как будет работать технология
Фирменный метод OpenAI получил название textGrain. Он формирует малозаметный статистический паттерн на этапе выбора слов нейросетью. По данным внутренних тестов компании на флагманской модели Astra, внедрение метки практически не сказывается на качестве и точности ответов.
Для клиентов API возможность добавления водяных знаков планируют сделать доступной по всему миру, но использовать её можно будет по выбору. Детектор меток на первом этапе предоставят только проверенным исследователям и профильным организациям. В дальнейшем OpenAI намерена опубликовать исходный код технологии.
Ограничения распознавания
Разработчики признают, что метод не универсален. Детектор хуже работает с короткими фрагментами, а также с текстами на темы, где выбор формулировок ограничен. В качестве примера OpenAI приводит математику: из-за специфики таких ответов статистический паттерн сложнее обнаружить.
Метка также может разрушаться при ручном редактировании. Если в тексте объёмом 400 токенов заменить синонимами 10% слов, точность распознавания снижается с 92% до 66%. При замене четверти слов показатель падает до 17%.
В OpenAI подчёркивают, что водяной знак не содержит персональных данных пользователя, не раскрывает его промпты и не позволяет проверить фактическую достоверность текста. Технология предназначена только для определения вероятного участия генеративной модели в создании материала.


