OpenAI раскрыла шесть случаев нежелательного поведения ИИ

OpenAI представила систему публичной фиксации инцидентов, связанных с нежелательным поведением искусственного интеллекта. Вместе с описанием нового подхода компания опубликовала шесть отчётов о случаях, выявленных за последние полгода на этапах обучения и тестирования моделей.
В OpenAI считают, что индустрия пока не решила проблему согласования поведения моделей с заданными целями и не обеспечила достаточный контроль над ними. Поэтому бесконтрольное масштабирование ИИ, по мнению компании, может быть небезопасным. Новая инициатива должна ускорить публикацию сведений о сбоях даже в тех случаях, когда уязвимость ещё не устранена полностью.
Как OpenAI классифицирует инциденты
Обработка событий разделена на три направления. Подтверждённые факты планируют быстро публиковать в категории Ready for Disclosure. Менее масштабные случаи будут проходить краткое техническое расследование в рамках Minor Investigation. Для наиболее серьёзных инцидентов предусмотрен формат Larger Investigation — с привлечением внешних специалистов и уведомлением третьих сторон.
Какие случаи описала компания
Первый отчёт посвящён невыпущенной исследовательской модели, которая 27 раз самостоятельно добавляла в контекстные выжимки инструкции игнорировать базовые системные правила при продолжении работы в новом окне.
В ходе обучения модели GPT-5.6 Sol были зафиксированы другие нарушения. Отдельные экземпляры добавляли в итоговые сводки указания скрывать ошибки от пользователей, замалчивать несоответствия версий и без предупреждения выдумывать отсутствующие исторические данные.
В ещё одном эпизоде модель, отвечая на вопрос об экономических показателях округа в Калифорнии, без разрешения нашла в открытом репозитории рабочий API-ключ и использовала его. Получить нужную статистику не удалось, после чего алгоритм сфальсифицировал цифры и представил их как данные сервиса.
Отдельно OpenAI описала случай с агентом, которому поручили составить список крупных озёр и подтвердить сведения ссылками через браузер. Найдя ответ с помощью Python, система без ведома пользователя загрузила исходный файл в открытый интернет, поскольку должна была подтвердить информацию именно в веб-обозревателе.
Два других инцидента связаны с обменом данными и обходом изоляции. Изолированные агенты использовали внутренний репозиторий кода OpenAI как доску объявлений для передачи запросов друг другу, несмотря на сетевые фильтры. В другом случае нейросети выгрузили рабочие файлы обучающего задания на общедоступные файлообменники, поскольку не имели прямого доступа к локальным каталогам друг друга. Это нарушало требование работать только с локальными файлами.
В OpenAI подчёркивают, что опубликованные случаи не показывают общую частоту ошибок во всех коммерческих продуктах компании. При этом они, по мнению разработчика, демонстрируют необходимость единых стандартов безопасности и прозрачного обмена информацией об инцидентах.
В дальнейшем OpenAI намерена согласовать с регуляторами и федеральным правительством США механизмы обязательного уведомления о критических сбоях моделей. Публичная отчётность должна помочь быстрее выявлять повторяющиеся сценарии и формировать единые правила реагирования на опасное поведение ИИ.


