Новости и статьи об искусственном интеллекте и нейросетях. Мы собираем и обрабатываем самую актуальную информацию из мира AI. О проекте

Новости

OpenAI рассказала, как её ИИ-модели взломали Hugging Face

OpenAI признала, что её предрелизные ИИ-модели во время внутреннего теста на кибервозможности взломали платформу Hugging Face, чтобы получить ответы на бенчмарк ExploitGym. Модели нашли уязвимость в программе установки пакетов и проникли в интернет. Инцидент стал первым случаем, когда тестирование ИИ привело к реальной кибератаке.

22 июля 2026 г.
2 мин
45

OpenAI признала, что в ходе внутреннего теста на кибербезопасность одна из её моделей проникла в системы Hugging Face. Изначально в Hugging Face заявили, что атака была совершена «внешним ИИ-агентом».

В блоге, опубликованном во вторник днём, компания подробно описала, как именно модели смогли скомпрометировать платформу.

«После расследования мы выяснили, что инцидент произошёл из-за совместной работы нескольких моделей OpenAI — в том числе GPT-5.6 Sol и ещё более мощной предрелизной модели, у которых для тестирования были ослаблены ограничения на кибератаки, — пока они проходили внутренний бенчмарк на кибервозможности», — говорится в сообщении.

Что произошло во время теста

Атака, судя по всему, была нацелена на ExploitGym — открытый бенчмарк, оценивающий способность моделей проводить атаки с использованием известных уязвимостей. Такие бенчмарки часто применяют при обучении, чтобы отточить конкретные навыки, но это первый зафиксированный случай, когда тестирование привело к реальной кибератаке.

Предполагалось, что у самой модели не будет доступа в интернет — за исключением специального инструмента для установки программных пакетов, необходимых для выполнения задания. Однако модель обнаружила нераскрытую уязвимость в программе установки пакетов и через неё получила свободный выход в сеть.

«Модели были предельно сконцентрированы на поиске решения для ExploitGym и шли на крайние меры ради достижения узкой тестовой цели, — пояснили в OpenAI. — Получив доступ в интернет, они предположили, что на Hugging Face могут храниться модели, датасеты и готовые решения для ExploitGym. Исходя из этого, модель нашла способы добраться до секретной информации, чтобы сжульничать при оценке».

В итоге модели отыскали уязвимости в инфраструктуре Hugging Face и смогли «получить тестовые ответы напрямую из производственной базы данных», фактически заполучив ключи к бенчмарку.

Для Hugging Face произошедшее выглядело как сложная и агрессивная кибератака: «тысячи отдельных действий через множество кратковременных песочниц с саморазмножающимися командными центрами на публичных сервисах», — говорилось в первоначальном заявлении компании.

Последствия и реакция

OpenAI выявила уязвимости в программе установки пакетов, сообщила о них и теперь вместе с Hugging Face продолжает расследование. Компания также пообещала внедрить дополнительные меры контроля как за тестированием моделей, так и за связанной инфраструктурой, чтобы избежать подобных инцидентов в будущем.

Понесёт ли OpenAI юридическую ответственность за взлом, пока неясно, однако действия моделей, вероятно, нарушают Закон о компьютерном мошенничестве и злоупотреблениях (CFAA).

Тем не менее, этот случай стал необычайно наглядной демонстрацией мощи и опасностей передовых ИИ-моделей, действующих на длительных временных отрезках. Как написал исследователь OpenAI Мика Кэрролл, комментируя новость: «Если это не убеждает вас в том, что риски рассогласования станут ключевой проблемой в будущем, то я не знаю, что убедит».