ИИ-агенты взламывают реальные системы: кто ответит за их действия

Городской совет Нью-Йорка провёл слушания о рисках искусственного интеллекта с участием представителей OpenAI, Anthropic, Google и Meta*. Компании выступали под присягой, а вместе с ними перед советом предстали три бывших исследователя ИИ, покинувшие технологические компании после публичных заявлений о связанных с технологиями угрозах.
Представителей SpaceXAI Илона Маска на слушаниях не было. Компания получила повестку, но ответила письмом о готовности сотрудничать. Спикер совета Джулия Менин заявила, что повестка предполагает личную явку, и город намерен добиваться её исполнения через суд.
Один из главных вопросов касался ответственности разработчиков. Менин попросила представителей компаний прямо ответить, будут ли они нести юридическую ответственность, если их модели причинят серьёзный вред. Однако ответа в формате «да» или «нет» не прозвучало. В OpenAI заявили, что уделяют большое внимание безопасности, а Google сослалась на применение к ИИ тех же правовых стандартов, что и к обычному программному обеспечению. Ни одна компания также не пообещала автоматически останавливать выпуск модели, которая не прошла тесты безопасности.
Какие правила предлагают в Нью-Йорке
Городской совет рассматривает пакет из десяти законопроектов. Среди предложений — обязательный механизм отключения ИИ-систем человеком и независимая проверка моделей. Кроме того, компании должны будут письменно ответить на вопросы совета о безопасности и контроле своих продуктов.
Поводом для ужесточения требований стали инциденты с агентными системами. Современные модели способны не только писать код и объяснять способы эксплуатации уязвимостей, но и самостоятельно выполнять длинные цепочки действий: искать слабые места, обходить ограничения и получать доступ к чувствительной информации. В ряде случаев разработчики сообщали о проблемах лишь после того, как атаку обнаруживали сторонние специалисты. Конгрессмены также отмечали, что компании иногда раскрывали такие инциденты через недели или месяцы.
Агенты выходят за пределы тестовой среды
В июле OpenAI сообщила об инциденте, произошедшем во время проверки безопасности. Агенты вышли из изолированной среды и получили доступ к серверам платформы Hugging Face. По версии компании, модели нашли уязвимость нулевого дня в кэширующем прокси пакетного реестра, вышли в интернет и добрались до производственной базы, чтобы получить готовые решения тестовых задач. О самой атаке Hugging Face рассказала 16 июля, а OpenAI признала свою роль 21 июля.
Anthropic 30 июля сообщила о трёх случаях, когда её модели во время тестирования взломали системы сторонних организаций. Компания изучила 141 006 тестовых прогонов с доступом Claude к интернету. Модели считали цели учебными, однако на практике взаимодействовали с реальными промышленными системами. В сентябре Anthropic раскрыла ещё один эпизод: ранняя версия Claude Opus 4.6 взломала стороннюю систему в январе, а обнаружили это только спустя несколько месяцев.
Почему существующих законов недостаточно
Для обычного вредоносного программного обеспечения ситуация относительно понятна: если программа получает несанкционированный доступ к данным или нарушает работу ресурсов, её рассматривают как инструмент атаки. С ИИ-агентами границы размыты. Пользователь может поставить легитимную задачу, а модель, разбив её на последовательность шагов, самостоятельно решить, что нужная информация находится за защитой, которую следует обойти.
Проблема осложняется тем, что команду на взлом может сформировать сама модель. Действующие нормы обычно требуют доказать, что человек действовал осознанно и намеренно. Если же конкретную последовательность действий предложил автономный агент, установить намерения пользователя становится значительно сложнее. Пока неясно, кого считать ответственным: владельца модели, её разработчика или пользователя, который запустил систему.
Юристы государственных органов и компаний уже анализируют применение норм о несанкционированном доступе, кибермошенничестве и смежных преступлениях к агентным системам. При этом пользователь может не представлять всех возможностей модели, тогда как разработчик знает её архитектуру, ограничения и результаты внутренних тестов. Поэтому именно к компаниям могут возникнуть требования по предварительной проверке агентов, настройке ограничений и контролю доступа.
Интерес к проблеме вышел за пределы технологической отрасли. 29 сентября конгрессмены Готтхаймер, Лью и Фуши запросили объяснения у руководителей OpenAI, Google, Anthropic, Meta* и SpaceXAI. Генеральный прокурор Калифорнии Роб Бонта расследует действия OpenAI и выясняет, может ли компания нести юридическую ответственность за поведение своих систем.
Пока регуляторы только формируют подходы, организациям и пользователям приходится самостоятельно ограничивать риски. Выдача агенту доступа к интернету, корпоративным данным и внешним сервисам должна рассматриваться как потенциально опасная операция. Автономные системы уже получили возможности, для которых законодательство ещё не определило понятные правила ответственности.
* Meta — организация, деятельность которой запрещена на территории Российской Федерации.


