OpenAI признала, что в ходе внутреннего теста на кибербезопасность одна из её моделей проникла в системы Hugging Face. Изначально в Hugging Face заявили, что атака была совершена «внешним ИИ-агентом».
В блоге, опубликованном во вторник днём, компания подробно описала, как именно модели смогли скомпрометировать платформу.
«После расследования мы выяснили, что инцидент произошёл из-за совместной работы нескольких моделей OpenAI — в том числе GPT-5.6 Sol и ещё более мощной предрелизной модели, у которых для тестирования были ослаблены ограничения на кибератаки, — пока они проходили внутренний бенчмарк на кибервозможности», — говорится в сообщении.
Что произошло во время теста
Атака, судя по всему, была нацелена на ExploitGym — открытый бенчмарк, оценивающий способность моделей проводить атаки с использованием известных уязвимостей. Такие бенчмарки часто применяют при обучении, чтобы отточить конкретные навыки, но это первый зафиксированный случай, когда тестирование привело к реальной кибератаке.
Предполагалось, что у самой модели не будет доступа в интернет — за исключением специального инструмента для установки программных пакетов, необходимых для выполнения задания. Однако модель обнаружила нераскрытую уязвимость в программе установки пакетов и через неё получила свободный выход в сеть.
«Модели были предельно сконцентрированы на поиске решения для ExploitGym и шли на крайние меры ради достижения узкой тестовой цели, — пояснили в OpenAI. — Получив доступ в интернет, они предположили, что на Hugging Face могут храниться модели, датасеты и готовые решения для ExploitGym. Исходя из этого, модель нашла способы добраться до секретной информации, чтобы сжульничать при оценке».
В итоге модели отыскали уязвимости в инфраструктуре Hugging Face и смогли «получить тестовые ответы напрямую из производственной базы данных», фактически заполучив ключи к бенчмарку.
Для Hugging Face произошедшее выглядело как сложная и агрессивная кибератака: «тысячи отдельных действий через множество кратковременных песочниц с саморазмножающимися командными центрами на публичных сервисах», — говорилось в первоначальном заявлении компании.
Последствия и реакция
OpenAI выявила уязвимости в программе установки пакетов, сообщила о них и теперь вместе с Hugging Face продолжает расследование. Компания также пообещала внедрить дополнительные меры контроля как за тестированием моделей, так и за связанной инфраструктурой, чтобы избежать подобных инцидентов в будущем.
Понесёт ли OpenAI юридическую ответственность за взлом, пока неясно, однако действия моделей, вероятно, нарушают Закон о компьютерном мошенничестве и злоупотреблениях (CFAA).
Тем не менее, этот случай стал необычайно наглядной демонстрацией мощи и опасностей передовых ИИ-моделей, действующих на длительных временных отрезках. Как написал исследователь OpenAI Мика Кэрролл, комментируя новость: «Если это не убеждает вас в том, что риски рассогласования станут ключевой проблемой в будущем, то я не знаю, что убедит».