США обвинили китайские ИИ-компании в промышленной дистилляции моделей

Агентство по кибербезопасности и защите инфраструктуры США (CISA), Агентство национальной безопасности (АНБ) и ФБР выпустили совместный отчёт о дистилляции нейросетей. В документе американские ведомства обвинили ведущие китайские ИИ-компании в систематическом извлечении возможностей зарубежных моделей в промышленных масштабах.
По версии спецслужб, как минимум с конца 2024 года дистилляция в Китае перестала быть вспомогательным способом дообучения и стала одним из ключевых инструментов развития передовых моделей. Среди упомянутых в отчёте компаний названы DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun и Z.AI.
Как, по версии США, извлекались возможности моделей
Американские ведомства утверждают, что разработчики обходили пользовательские соглашения и встроенные системы защиты с помощью серых прокси, которые в отчёте описываются как «передаточные станции». Также, по данным спецслужб, использовались совместный доступ к оптовым премиум-аккаунтам и агрегаторы, способные скрывать метаданные запросов.
Moonshot AI приписывают дистилляцию сразу 17 американских моделей, включая Claude и GPT-4o. В отношении DeepSeek выдвинуто отдельное обвинение: компания якобы целенаправленно извлекала скрытые цепочки рассуждений моделей, чтобы использовать их при создании систем R1 и V3.
Дистилляция позволяет получить данные о поведении более крупной или закрытой модели и использовать их для обучения собственной системы. Такой подход может ускорить разработку и сократить расходы на подготовку данных, однако его применение в обход ограничений провайдеров вызывает претензии со стороны правообладателей и разработчиков исходных моделей.
Почему новый отчёт отличается от прежних обвинений
Подозрения в использовании китайскими компаниями ответов американских нейросетей звучали и раньше. О похожих случаях публично заявляли OpenAI и Anthropic. Однако нынешняя публикация стала заметным изменением уровня конфликта: обвинения исходят не только от коммерческих разработчиков, но и от сразу трёх американских государственных ведомств, отвечающих за кибербезопасность, разведку и расследование преступлений.
В отчёте также поставлена под сомнение распространённая оценка низкой стоимости разработки китайских моделей. Спецслужбы считают, что расчёты, подобные оценкам затрат дипсик, могут учитывать только вычислительные ресурсы и не включать стоимость данных. По мнению американской стороны, значительная часть таких данных была создана за счёт уже оплаченных исследований и эксплуатации американских моделей.
Рекомендованные контрмеры
В качестве одного из способов защиты американским ИИ-компаниям предложено отслеживать характерный трафик подозрительных клиентов. К таким признакам отнесены круглосуточная активность без обычных пауз и резкие пиковые нагрузки, которые могут указывать на массовый сбор ответов для последующего обучения.
Ведомства также допустили применение так называемого «тихого ухудшения»: подозрительным пользователям могут без отдельного уведомления предоставляться менее качественные или намеренно искажённые ответы. Цель такой меры — снизить ценность синтетических датасетов, собранных через дистилляцию, и затруднить воспроизведение возможностей исходной модели.
Публикация отчёта переводит спор о дистилляции из области корпоративных претензий в контекст национальной безопасности. При этом изложенные обвинения представляют позицию американских ведомств; в приведённом материале не сообщается о независимом подтверждении каждого из описанных эпизодов или о реакции названных китайских компаний.


