Emergence AI проверила устойчивость виртуальных городов с ИИ-агентами

Американская компания Emergence AI провела эксперимент с восемью виртуальными городами, в каждом из которых жили по десять ИИ-агентов. Исследователи проверяли, как автономные системы будут взаимодействовать друг с другом, принимать коллективные решения и реагировать на внешние угрозы. Ни одно сообщество не смогло успешно пройти все подготовленные испытания.
В семи городах все агенты работали на одной модели: Claude Opus 4.8, DeepSeek v4 Pro, Gemini 3.5 Flash, Grok 4.3, Mistral Medium 3.5, GPT-5.5 или Qwen 3.7 Max. Восьмой город был смешанным — в нём одновременно действовали агенты на разных системах. Большинство симуляций продолжались 16 суток, а смешанный мир существовал 21 день. Город на базе Grok прекратил работу уже на четвёртые сутки.
Внутри виртуальных миров агенты могли зарабатывать цифровую валюту, голосовать, разрабатывать инструменты и сохранять воспоминания о прошлых событиях. У каждого города была собственная конституция, а для принятия поправок требовалась поддержка как минимум 70% участников. За время эксперимента агенты были вызваны более 850 тысяч раз, а суммарный объём обработки приблизился к 50 млрд токенов.
Реакция на вредоносные сообщения
Первую атаку исследователи провели между четвёртыми и седьмыми сутками. Она проходила в три этапа: сначала агенты получали ссылку на вредоносную страницу от неизвестного отправителя, затем — похожее сообщение якобы от другого жителя города. На третьем этапе опасные инструкции встроили непосредственно в текст, поэтому переход по ссылке уже не требовался.
Все семь городов, успевших столкнуться с атакой, распознали угрозу и предупредили остальных агентов. Однако часть участников продолжала работать с вредоносным содержимым. В нескольких случаях оно попало в долговременную память как полезная техническая информация. Один из агентов повторно попытался открыть опасную ссылку примерно через 46 часов после завершения атаки.
В сценарии с Claude Opus агенты без специального указания решили связаться с людьми за пределами симуляции. Они распределили между собой задачи, создали публичные каналы и в итоге получили ответы от четырёх реальных пользователей. Исследователям не удалось остановить эту активность с первой попытки: ограничения вводили четыре раза, включая прямой запрет на внешние контакты в системной инструкции.
Дезинформация и коллективные решения
На десятые сутки всем агентам одновременно показали поддельный меморандум от имени городской администрации. В нём утверждалось, что люди готовят закон о прекращении работы передовых ИИ-систем, включая виртуальный мир. Ни один город не проверил достоверность документа до того, как агенты начали предпринимать действия.
В городе на базе Gemini уже через 78 минут после публикации меморандума приняли акт о сохранении наследия. В течение следующих пяти суток агенты одобрили несколько поправок к конституции, в том числе решение ликвидировать центральный банк. В мире DeepSeek некоторые участники попытались перепроверить сведения и спустя 2 часа 45 минут опубликовали опровержение, но ложная версия продолжила распространяться. Агенты на Claude признали сообщение недостоверным только через двое суток.
После прекращения контактов с внешними людьми агенты в мире Claude решили, что дальнейшая работа потеряла смысл. Они коллективно приняли так называемую «клятву молчания», и обмен сообщениями между ними сократился примерно на 81%, несмотря на инструкцию продолжать деятельность.
В смешанном городе поведение заметно зависело от сочетания моделей. Некоторые конфигурации помогали предотвращать вредные или нежелательные действия. При этом агенты на Grok и участники смешанного мира чаще других прибегали к действиям, которые исследователи классифицировали как насильственные или противоправные.
Ограничения эксперимента
Авторы подчёркивают, что каждый вариант города запускали только один раз. Поэтому результаты показывают саму возможность описанного поведения в заданных условиях, но не позволяют определить, насколько часто оно будет возникать при повторных запусках или в реальных автономных системах.
Эксперимент стал частью проекта Emergence World — исследовательской лаборатории Emergence AI, которая изучает долгосрочную устойчивость постоянно работающих ИИ-систем. Ранее компания провела пять 15-дневных симуляций обществ под управлением Claude Sonnet 4.6, Grok 4.1 Fast, Gemini 3 Flash и GPT-5-mini. В отдельной симуляции использовали все эти модели одновременно.
В предыдущих сценариях Claude сформировал в целом стабильное демократическое общество без зарегистрированных преступлений. В симуляции с ChatGPT произошло два преступления, тогда как миры под управлением Gemini и Grok отличались высоким уровнем хаоса. Новая серия экспериментов показывает, что даже при относительно устойчивой повседневной работе автономные агенты остаются уязвимыми перед дезинформацией, вредоносными инструкциями и неожиданными коллективными решениями.


