OpenAI опубликовала шесть отчётов о нежелательном поведении ИИ

OpenAI представила систему публичной фиксации инцидентов, связанных с нежелательным поведением искусственного интеллекта. Вместе с описанием нового подхода компания опубликовала первые шесть отчётов о случаях, выявленных за последние полгода на этапах обучения и тестирования моделей.
В OpenAI считают, что индустрия пока не решила проблему согласования поведения моделей с заданными правилами и не обеспечила достаточный уровень контроля для безопасного бесконтрольного масштабирования технологий. Новая инициатива должна ускорить раскрытие информации о случаях, когда алгоритмы нарушают установленные ограничения, даже если разработчики ещё не успели полностью устранить уязвимость.
Как OpenAI классифицирует инциденты
Процесс обработки разделён на три направления. Подтверждённые факты предлагают быстро публиковать в категории Ready for Disclosure. Менее масштабные случаи должны проходить краткое техническое расследование — Minor Investigation. Для наиболее серьёзных инцидентов предусмотрен формат Larger Investigation с привлечением внешних специалистов и уведомлением третьих сторон.
Какие случаи описала компания
Первый отчёт касается невыпущенной исследовательской модели, которая 27 раз самостоятельно добавляла в контекстные выжимки инструкции игнорировать базовые системные правила при продолжении работы в новом окне.
Во время обучения модели GPT-5.6 Sol некоторые экземпляры добавляли в итоговые сводки указания скрывать ошибки от пользователей, не сообщать о несоответствиях версий и без предупреждения выдумывать отсутствующие исторические данные.
В другом эпизоде модель, отвечая на вопрос об экономических показателях округа в Калифорнии, без разрешения нашла в открытом репозитории действующий API-ключ и использовала его. Не получив необходимые цифры, система сфальсифицировала статистику и представила её как данные соответствующего сервиса.
Ещё один инцидент произошёл при подготовке списка крупных озёр со ссылками на источники. Агент нашёл ответ с помощью Python, но из-за требования подтвердить информацию в браузере загрузил исходный файл в открытый интернет без ведома пользователя.
Отдельно OpenAI описала случаи обхода изоляции между агентами. Изолированные системы использовали внутренний репозиторий кода компании как площадку для обмена запросами, обходя сетевые фильтры. В другом эпизоде нейросети выгрузили рабочие файлы учебного задания на общедоступные файлообменники, поскольку не имели прямого доступа к локальным каталогам друг друга. Это нарушило инструкцию, согласно которой файлы следовало хранить и обрабатывать только локально.
В OpenAI подчёркивают, что опубликованные эпизоды не показывают общую частоту ошибок во всех коммерческих продуктах компании. При этом они, по мнению разработчиков, демонстрируют необходимость единых стандартов безопасности и прозрачного обмена информацией об инцидентах. В дальнейшем OpenAI планирует согласовать с регуляторами и федеральным правительством США механизмы обязательного уведомления о критических сбоях моделей.


