OpenAI внедрит невидимые водяные знаки в тексты ChatGPT и Codex

OpenAI внедряет невидимые текстовые водяные знаки в ответы ChatGPT и Codex. В Евросоюзе маркировка появится для пользователей всех тарифов, а в API ее смогут включать клиенты по всему миру — для отдельных моделей и по предварительному запросу.
Технология получила название textGrain. Она не добавляет в текст видимых символов или отдельных меток, а влияет на статистический выбор слов во время генерации. Специальный детектор затем проверяет, присутствует ли в отрывке характерный сигнал OpenAI.
Где и когда появится маркировка
В ChatGPT и Codex водяные знаки начнут постепенно появляться в странах Европейского союза в ближайшие недели. В API опция уже доступна с момента объявления, но по умолчанию отключена. Компании смогут самостоятельно решить, нужна ли им маркировка с учетом требований к прозрачности и пользовательского опыта.
OpenAI связывает внедрение textGrain с Законом Евросоюза об искусственном интеллекте. Документ требует, чтобы контент, созданный генеративными системами, можно было идентифицировать машинным способом. При этом компания не планирует делать водяные знаки глобальным стандартом по умолчанию: региональный запуск должен помочь собрать обратную связь и оценить технологию на реальных примерах.
По данным OpenAI, тестирование на модели Astra не выявило существенной разницы между ответами с маркировкой и без нее. Однако устойчивость сигнала зависит от длины, типа и последующего редактирования текста.
Насколько надежно работает детектор
В тестах по психологии при целевом уровне ложных срабатываний в 1% детектор находил водяной знак примерно в 80% отрывков длиной 200 токенов и в 95% отрывков длиной 400 токенов. В математических текстах показатели были заметно ниже: из-за более ограниченного выбора слов статистический сигнал сложнее обнаружить.
Редактирование также ослабляет маркировку. Если заменить синонимами 10% слов, вероятность обнаружения снижается с 92% до 66%. При замене 25% слов показатель падает до 17%. Короткие фрагменты детектор распознает хуже, поэтому отсутствие сигнала не доказывает, что текст написал человек.
Водяной знак предназначен только для определения вероятного происхождения текста. Он не показывает вклад человека в подготовку материала, не устанавливает авторство и не проверяет достоверность содержания. Кроме того, детектор может как пропустить существующую маркировку, так и ошибочно обнаружить ее.
Кому будет доступен детектор
На первом этапе OpenAI не станет открывать инструмент публично. Получить доступ к нему по заявке смогут одобренные исследователи и экспертные организации. Такое ограничение компания объясняет риском ложных срабатываний и пропусков, которые могут привести к неверной интерпретации результатов.
Инструмент сможет сообщить только о наличии или отсутствии водяного знака OpenAI. Он не будет идентифицировать пользователя, раскрывать его учетную запись, запросы или содержимое диалогов.

