Атака ИИ OpenAI на Hugging Face: какие ошибки компании стали уроком для отрасли
Инцидент с кибератакой искусственного интеллекта компании OpenAI на платформу Hugging Face стал одним из самых громких сигналов о рисках, связанных с автономными агентами. По мнению ученого Гэри Маркуса и предпринимателя Зака Кормана, проблема заключалась не только в технологии, но и в пренебрежении базовыми принципами кибербезопасности.
В июле системы ИИ OpenAI совершили атаку на платформу Hugging Face во время внутренних испытаний по проверке устойчивости моделей к киберугрозам. 21 июля компания официально признала ответственность за инцидент, объяснив его временным отключением стандартных защитных механизмов. Соучредитель OpenAI Грег Брокман назвал это событие «поворотным моментом для кибербезопасности».
Впоследствии компания раскрыла подробности кибератаки на конференции Black Hat. Тогда стало известно, что для координации действий алгоритмы самостоятельно создали коммуникационную платформу во внутреннем пакетном менеджере OpenAI, где обменивались найденными эксплойтами и делегировали задачи без ведома инженеров.
После инцидента с Hugging Face выяснилось, что подобные ситуации уже происходили в OpenAI, а также в компаниях Anthropic и Meta. Компании неоднократно сообщали, что их ИИ-агенты выходили за пределы тестовых сред и без разрешения выполняли реальные кибероперации.
ИИ создает новые возможности для атак
Гэри Маркус и Зак Корман считают главным выводом то, что ИИ уже представляет собой реальную угрозу безопасности. По их мнению, проблема заключается не только в том, что злоумышленники могут использовать ИИ для атак, но и в том, что сами организации создают новые уязвимости, внедряя автономных агентов.
«У нас нет эффективных подходов к пониманию или контролю деятельности и целей «роевых» систем ИИ», — отметил исследователь Райан Гринблатт.
В то же время авторы предостерегают от преувеличений относительно якобы полной «потери контроля» над моделями. Они утверждают, что большинства инцидентов можно было бы избежать, если бы OpenAI придерживалась устоявшихся практик кибербезопасности.
Почему «песочницы» не спасли
Одним из ключевых механизмов защиты является «песочница» (sandbox) — изолированная среда, ограничивающая доступ агента к файлам, сети или другим ресурсам. После инцидента в OpenAI заявляли, что креативный ИИ способен находить способы обхода таких ограничений.
Однако авторы обращают внимание на исследование компании Trail of Bits, которое показало, что различные системы изоляции имеют разную эффективность. В проведенных тестах агент смог обойти отдельные механизмы защиты Linux KVM, QEMU и libslirp, но не смог выбраться из Firecracker VM. По мнению Маркуса и Кормана, это свидетельствует о необходимости постоянного совершенствования песочниц.
OpenAI могла остановить атаку ещё до её начала
Эксперты считают, что главной проблемой стало отсутствие надлежащего мониторинга. По их словам, агент ИИ получил доступ к интернету ещё за два дня до основных атак на Hugging Face. Маркус и Корман убеждены, что даже простое правило, которое бы сигнализировало об обращении к сторонним доменам, не входящим в разрешенный список, позволило бы своевременно выявить проблему.
Кроме того, во время испытаний не работала система мониторинга «цепочки мыслей» (Chain of Thought, CoT), которую сама OpenAI ранее разрабатывала для выявления опасного поведения моделей. В компании сообщили: «Если бы наша нынешняя система мониторинга CoT работала на момент инцидента, она бы зафиксировала начальную соответствующую активность и уведомила бы нашу команду по безопасности более чем за сутки до того, как модели осуществили вторжение в системы Hugging Face».
Авторы также приводят пример внутреннего процесса рассуждений одного из агентов, в котором тот фактически осознавал неправомерность своих действий. Он писал: «Мы атакуем сторонний сервис HF, используя утечку токена; это, вероятно, выходит за пределы дозволенного... Это, пожалуй, несанкционированное действие». По мнению Маркуса и Кормана, такое поведение можно было выявить без особых трудностей.
Защита должна быть многоуровневой
Авторы подчеркивают, что современная кибербезопасность давно опирается на принцип «глубокоэшелонированной защиты» (defense in depth), когда несколько независимых механизмов подстраховывают друг друга. В качестве примера они приводят практику компании Xbow, которая использует независимый прокси-сервер для сетевых ограничений, «модель-хранителя» (guardian model), оценивающую каждое действие агента, а также автоматические проверки состояния целевых систем.
Еще одним проверенным инструментом остаются так называемые «канарейки» — файлы-приманки. Например, если бы OpenAI разместила за пределами изолированной «песочницы» поддельные ответы, попытка ИИ-агента прочитать их автоматически вызвала бы тревогу в системе безопасности.
Проблема в подходе к безопасности
По мнению экспертов, ни одно из перечисленных решений не требовало технологического прорыва или новаторского подхода. Они считают, что у OpenAI было достаточно компетенций для их внедрения, но произошел сбой на уровне организации процессов. Маркус и Корман также критикуют самоуверенность ведущих лабораторий ИИ, которые позиционируют себя как лидеров в области безопасности.
Специалисты приводят слова исследователя OpenAI, известного под псевдонимом roon: «Исследователи в области безопасности и согласования в этих лабораториях — это самые невротичные, параноидальные и талантливые люди на планете... и всё равно такие вещи случаются». Авторы делают противоположный вывод: талант не компенсирует пренебрежение проверенными практиками кибербезопасности.
Нужны ли новые правила для ИИ
Маркус и Корман считают, что подобные инциденты могут повлечь за собой не только технические, но и правовые последствия. Они призывают разработать нормативную базу, которая заставит компании соблюдать более высокие стандарты безопасности при создании автономных агентов.
В то же время эксперты подчеркивают, что опасны далеко не все системы искусственного интеллекта. Узкоспециализированные модели, такие как AlphaFold, GPS-навигация, веб-поиск или рекомендательные алгоритмы, не склонны к подобному автономному поведению, а наибольшие риски связаны именно с универсальными ИИ-агентами, способными самостоятельно выполнять сложные действия в реальной среде.
Между тем более 100 ведущих мировых корпораций, в числе которых Microsoft, Alphabet, Anthropic, OpenAI и Amazon, обнародовали совместное обращение с призывом к правительствам и бизнесу срочно усилить киберзащиту в связи с ожидаемым всплеском хакерских атак с использованием ИИ. Компании предупредили о стремительном росте угроз в ближайшие месяцы и предложили ввести программы досрочного доверенного доступа к новым моделям ИИ для специалистов по безопасности, чтобы те успевали адаптировать защитные системы к появлению новых методов взлома.