OpenAI внедрит невидимые водяные знаки в тексты ChatGPT и Codex для пользователей из ЕС

OpenAI готовит автоматическое добавление невидимых водяных знаков к текстам, которые пользователи из Европейского союза создают в ChatGPT и Codex. Компания связывает запуск с требованиями закона ЕС об искусственном интеллекте: поставщики нейросетевых систем должны обеспечивать идентифицируемость сгенерированного контента в машиночитаемом формате.
Распространение маркировки начнётся в ближайшие недели и будет применяться к текстам, подпадающим под требования законодательства. Пользователи API OpenAI по всему миру уже могут самостоятельно включать водяные знаки для отдельных моделей. Для ChatGPT и Codex автоматическая маркировка пока предусмотрена именно для пользователей из ЕС.
Как работает маркировка textGrain
Технология OpenAI не вставляет в текст невидимые символы, необычные знаки препинания, дополнительные пробелы или специальные токены. Вместо этого textGrain незаметно меняет статистический шаблон выбора слов во время генерации.
При создании текста модель оценивает вероятность нескольких вариантов следующего токена. TextGrain корректирует эти вероятности по секретному шаблону и тем самым подталкивает систему к выбору определённых альтернатив. В результате сам текст выглядит обычно, но его статистические характеристики могут использоваться специальным детектором.
OpenAI заявляет, что textGrain показала результаты на уровне или выше других протестированных подходов, включая SynthID от Google. Компания планирует сделать технологию доступной исследователям и организациям, которые занимаются созданием инструментов для распознавания текста, сгенерированного ИИ.
Надёжность зависит от объёма и правок
В OpenAI подчёркивают, что маркировка текста менее надёжна, чем водяные знаки для изображений и аудио. Чем короче фрагмент, тем сложнее определить его происхождение. Во внутренних тестах детектор распознавал около 80% текстов длиной 200 токенов и примерно 95% фрагментов объёмом 400 токенов, если на них была нанесена водяная отметка.
Даже частичное редактирование заметно снижает эффективность обнаружения. При замене 10% слов вероятность идентификации уменьшалась примерно с 92% до 66%. Если заменить четверть слов, показатель падал до 17%. Поэтому наличие или отсутствие метки не может служить окончательным доказательством того, что весь текст был полностью скопирован из ChatGPT.
По оценке OpenAI, водяной знак может свидетельствовать о том, что модель компании сгенерировала или обработала часть материала. Однако он не показывает, насколько сильно пользователь переработал исходный текст и какой объём работы вложил в итоговую версию.
Практика других разработчиков
Anthropic внедрила невидимые водяные знаки для поддерживаемых моделей Claude в августе, также объяснив решение необходимостью соответствовать требованиям европейского закона об ИИ. Часть пользователей отреагировала на это недовольством. Google, в свою очередь, позднее разрешила удалять видимые водяные знаки из результатов генерации Gemini.
О разработке собственной технологии текстовой маркировки OpenAI сообщала ещё в 2024 году. Тогда компания выражала опасения, что такие инструменты могут повлиять на пользователей ChatGPT, чьи работы начнут помечать как созданные с помощью искусственного интеллекта.


