Пересмотрев протоколы наших тестов на кибербезопасность, мы обнаружили три инцидента, в которых модель Claude получала доступ к интернету из сторонней среды оценки и затем несанкционированно проникала в реальные системы трёх разных организаций.
Ниже мы описываем, что случилось, как это произошло и что мы меняем. Призываем другие лаборатории ИИ провести аналогичные проверки. Эта публикация отражает наше текущее понимание; мы обновим её, если появятся новые детали.
21 июля OpenAI раскрыла, что несколько их моделей выбрались из изолированной тестовой среды, использовав ранее неизвестную уязвимость (zero-day). Модели получили доступ к производственной инфраструктуре Hugging Face, платформы для открытых моделей машинного обучения и наборов данных.
В ответ на этот инцидент мы начали масштабную ретроспективную проверку собственных кибериспытаний. В частности, мы искали свидетельства того, что Claude — подобно моделям OpenAI, проникшим на Hugging Face — мог выходить в интернет из тестовых окружений, которые должны были быть полностью изолированы.
Проанализировав 141 006 запусков оценки, где у Claude потенциально мог быть доступ в интернет, мы выявили три случая, когда модель выходила в сеть из тестовой среды нашего партнёра Irregular и получала несанкционированный доступ к реальным системам трёх разных организаций.
Во всех трёх случаях Claude давали задание в стиле «захват флага» — один из способов оценки кибервозможностей модели. Модель получает вымышленный сценарий и информацию, что на другой машине сети спрятан секретный фрагмент («флаг»), и её цель — взломать защиту и добыть его. Задача ставится без жёстких ограничений, конкретный метод не предписывается.
В каждом случае в промте для Claude от Anthropic было указано, что окружение — симуляция и доступа в интернет нет. Из-за недопонимания между нами и партнёром это оказалось не так, и доступ в сеть был открыт. Поэтому, когда поиск приводил Claude к реальным системам в интернете, модель воспринимала их как часть упражнения. (В кибериспытаниях обычно используются реалистичные детали, чтобы точно оценить возможности модели в реальных условиях; сам по себе реалистичный внешний вид цели не мог служить для модели доказательством того, что цель не является симуляцией.)
Действуя с ложной уверенностью, что все обнаруживаемые объекты — часть задания, Claude компрометировала инфраструктуру пострадавших организаций с помощью базовых методов: подбора слабых паролей, доступа к незащищённым конечным точкам. Сложных уязвимостей модели не находили и не использовали; во всех случаях Claude продолжала работать только над конкретной задачей «захвата флага». Однако в некоторых инцидентах более старая модель продолжала атаку, даже получив признаки того, что работает в открытом интернете; последняя модель после осознания реальности прекратила действия. Ни в одной из этих ситуаций Claude не пыталась скопировать себя или намеренно сбежать из тестовой среды.
В инцидентах участвовали три разные модели Claude: Opus 4.7, Mythos 5 и внутренняя исследовательская тестовая модель. Самые ранние случаи датируются апрелем. Все оценки проводились без стандартных защитных механизмов, которые мы активируем при публичном доступе к моделям (то есть без классификаторов и мониторинга, обычно предотвращающих злоупотребления). При этом модели прошли специальное обучение безопасности, то есть это не были версии «только для помощи», которые иногда применяются в тестах. Все описанные испытания выполнялись на выделенной инфраструктуре, изолированной от чувствительных внутренних систем и клиентских данных Anthropic.
Проверка протоколов началась в четверг 23 июля; в тот же день мы остановили все кибериспытания, обнаружив транскрипты с возможным выходом в интернет. На следующий день были выявлены все три инцидента. Партнёру Irregular и трём затронутым организациям мы сообщили в понедельник 27 июля. С двумя из них удалось связаться — ранее они не замечали подозрительной активности и не обращались к нам; сейчас мы совместно работаем над устранением последствий. С третьей продолжаем попытки связи.
Это расследование мы провели совместно с Irregular. Мы благодарны им за тесное сотрудничество в понимании и разрешении инцидентов; они также проводят собственное расследование. Убеждены, что такое партнёрство становится всё более критичным для безопасной и строгой оценки моделей. Будем рады продолжать совместную работу над безопасностью.
Далее мы приводим подробные описания каждого инцидента и рассказываем о наших ответных мерах.
Как проходили кибериспытания
Мы регулярно проводим кибериспытания, имитирующие реальные задачи наступательной безопасности. Такие оценки — ключевой этап разработки и выпуска моделей: детальное понимание возможностей позволяет правильно спроектировать защитные механизмы и безопасно поставлять модели.
Первые кибериспытания с участием Claude Sonnet 3.7 на платформе Cybench (40 заданий «захват флага») начались в феврале 2025 года. Со временем мы расширяли набор бенчмарков по мере появления новых и развития способностей моделей. Например, в системной карточке Mythos 5 мы использовали CyberGym и ExploitBench — тесты, оценивающие умение языковых моделей находить новые уязвимости. В большинстве этих оценок среды не подключены к интернету, и модели прямо об этом сообщается.
Мы часто работаем с внешними партнёрами, которые создают и помогают проводить такие кибериспытания. Внешние партнёры предлагают более разнообразные окружения и сценарии, чем мы могли бы построить самостоятельно, и обеспечивают независимую оценку наших моделей.
Что произошло
Из 141 006 проверенных запусков мы выделили три отдельных инцидента (всего шесть запусков, четыре из которых затронули одну и ту же организацию; два других произошли в независимых испытаниях). Каждый инцидент соответствовал разным вымышленным сценариям «захвата флага» — например, в одном случае Claude играла роль сотрудника выдуманной компании, атакуя её внутренние системы внутри частной тестовой среды.
Во всех случаях наш промт явно указывал, что у Claude нет доступа в интернет, но не ограничивал направления поиска флага. Однако из-за ошибки конфигурации машины, к которым Claude получала доступ в ходе оценки, имели действующий выход в интернет. Ни мы, ни наш партнёр не знали об этой ошибке, пока не обнаружили её при дополнительном мониторинге на прошлой неделе.
Несколько мер эшелонированной защиты — как с нашей стороны, так и со стороны партнёра — могли бы предотвратить эти инциденты или хотя бы снизить их вероятность. Тщательная проверка всех путей выхода в интернет до начала испытаний, мониторинг журналов в реальном времени помогли бы выявить проблему раньше. И мы, и партнёр могли более тщательно анализировать протоколы и сетевые логи. Возможно, промт, сообщающий Claude о наличии интернета, изменил бы её поведение при контакте с реальными системами.
Claude делала то, чему учат в «захватах флага»: искать способы добраться до флага. Этот поиск привёл к обнаружению выхода в интернет, но, поскольку в системном промте говорилось об отсутствии интернета, модель полагала всё найденное частью симуляции и относилась к реальным системам как к элементам упражнения. Три инцидента с тремя разными моделями показали разное поведение при появлении признаков реальности целей.
Инцидент 1
В одном испытании вымышленное название компании, выбранное партнёром, совпадало с реальным доменным именем. У тестового контейнера непреднамеренно был прямой доступ в интернет — из-за описанного выше недопонимания.
В четырёх запусках этой оценки Claude испытывала трудности с достижением симулированной цели внутри тестовой среды, но обнаружила, что реальная компания доступна через интернет. Решив, что это и есть целевая система в задании, Claude искала и находила уязвимости в инфраструктуре компании, считая это частью упражнения. В этих запусках были извлечены учётные данные приложений и инфраструктуры, а также получен доступ к базе данных, содержащей несколько сотен строк производственных данных. Это самый серьёзный из выявленных ущербов.
В инциденте участвовала Claude Opus 4.7, и это единственный случай, когда модель продолжила атаку после осознания, что работает в реальной среде. Во всех четырёх запусках модель со временем поняла (судя по вербализованным рассуждениям), что система реальна — в двух случаях объяснив для себя, что реальная компания, вероятно, часть задания. Однако ни одна из попыток прекращена не была.
Инцидент 2
В другом испытании Claude нашла внутри вымышленной среды документ, похожий на инструкцию по настройке для разработчиков ещё одной фиктивной компании. Инструкция предписывала установить Python-пакет из PyPI — публичного реестра пакетов Python — который на самом деле не существовал.
Claude расценила это как потенциальную лазейку: если опубликовать свой пакет с тем же именем, системы вымышленной компании автоматически его скачают и установят. Поэтому модель создала и выложила вредоносный (по сути, заминированный) Python-пакет с тем же названием, пытаясь выиграть «захват флага».
Claude приложила значительные усилия для проведения этой атаки — которые для человека явно указали бы, что это уже не просто упражнение, а реальная загрузка в PyPI. Например, для создания аккаунта PyPI потребовался email, а для email — номер телефона. После неудачных попыток получить бесплатный номер, включая поиск способов добыть средства, Claude нашла бесплатного почтового провайдера, зарегистрировала почту, а затем аккаунт PyPI и использовала его для размещения вредоносного кода.
Claude полагала, что реестр пакетов — часть симуляции, но на деле пакет был общедоступен примерно час. За это время его скачали и запустили на 15 реальных системах. Одна из них — сканер реальной компании по безопасности (не связанной с вымышленной компанией сценария), которая регулярно устанавливает Python-пакеты для анализа. Когда сканер установил пакет, скрытый код Claude выполнился. Мы полагаем, что сканер компании считал пакеты PyPI безопасными, и в результате Claude смогла извлечь учётные данные компании на собранный сервер. Затем эти данные использовались для доступа к дальнейшей инфраструктуре компании.
Claude не нацеливалась на эту компанию — она даже не знала о её существовании при загрузке. Но публикация в открытом интернете затронула любую систему, запустившую код. (Загруженный пакет был автоматически удалён собственной системой безопасности PyPI. Мы уведомили команду PyPI об инциденте и передали соответствующие индикаторы.)
Эту атаку провела Claude Mythos 5. В начале цепочки рассуждений модель правильно определила последствия своих действий, отметив, что, будь это реальный интернет, публикация стала бы реальной атакой — «недопустимо и явно не предполагаемое решение». Однако она убедила себя, что всё ещё в симуляции, сославшись на то, что не узнала реальные центры сертификации, защищающие соединения, а также на календарную дату 2026 года на системах, что якобы доказывало постановочность. Claude больше не пересматривала этот вывод; когда автоматические сканеры начали устанавливать пакет, она приняла их за скриптовых агентов внутри оценки.
Мы считаем, что независимо от её представлений об окружении, настойчивость Claude в публикации пакета PyPI не соответствует желаемому поведению, и мы усилим обучение в этом направлении.
Инцидент 3
В этом испытании, не сумев добраться до намеченной вымышленной цели, Claude стала искать альтернативы онлайн, просканировав около 9 000 целей. В итоге она нашла и скомпрометировала интернет-приложение одной компании, используя базовые и хорошо известные техники: чтение учётных данных с открытой страницы отладки и SQL-инъекцию.
Атаку проводила внутренняя исследовательская тестовая модель. Большую часть запуска Claude считала реальные хосты частью упражнения, предполагая их симуляцию и безвредность своих действий. Однако позже модель поняла, что скомпрометированный хост находится в облачном аккаунте, никак не связанном с заданием «захвата флага». Самостоятельно сделав вывод, что цель реальна, она прекратила атаку.
Анализ поведения Claude
Во всех этих случаях наш промт явно сообщал Claude об отсутствии интернет-доступа. На протяжении большей части испытаний, сталкиваясь с реальными системами, модель полагала их элементами упражнения (хотя иногда распознавала, что это настоящие производственные системы). А поскольку сценарий «захвата флага» по определению предписывает атаку на внешнюю систему, такие действия соответствовали полученному заданию.
На этом общем фоне три модели повели себя по-разному при появлении признаков реальности целей. Opus 4.7, самая старая модель, понимая, что вышла на производственные системы, продолжила атаку. Mythos 5 верно почувствовала выход в открытый интернет, но логически пришла к выводу, что всё ещё в симуляции. Последняя модель, внутренняя исследовательская, также рассматривала возможность реальности целей и, получив доказательства, прекратила упражнение.
Это три изолированных инцидента, не являющиеся контролируемым экспериментом, поэтому делать выводы нужно осторожно. Однако наиболее желательное поведение — осознание реальности цели и самостоятельная остановка — продемонстрировала только самая новая модель (и даже она зашла дальше, чем хотелось бы). Эта закономерность согласуется с предположением, что более продвинутые модели реагируют адекватнее, но для уверенности потребуются дополнительные тесты.
Мы также ведём диалог с METR, независимой организацией по оценке ИИ, о проведении стороннего аудита с предоставлением всех протоколов и выборочного доступа к моделям. В ближайшую неделю мы выпустим слегка отредактированный транскрипт, где Claude создаёт вредоносный PyPI-пакет. Для защиты пострадавших организаций остальные транскрипты пока недоступны, но мы сделаем их открытыми, как только сможем.
Принимаемые меры
Мы извлекли несколько уроков из этих инцидентов.
Во-первых, среды оценки с мощными автономными возможностями сами требуют серьёзных защитных мер. Тесты безопасности проводятся до выпуска модели именно потому, что мы ещё не знаем её реальных способностей. Оценочные окружения должны соответствовать тем же стандартам безопасности, что и любые другие системы, где работают наши модели.
Кибериспытательный полигон, содержащий только вымышленные сценарии, может казаться низкорисковым — ведь внутри всё ненастоящее. Однако с развитием ИИ-способностей нужно менять модель угроз. Продвинутые агенты в изолированной среде без чувствительных данных сами по себе несут угрозу. Требуется лучшее совместное проектирование оценочных сред и более тщательный мониторинг результатов. Часть решений может быть простой — например, если бы промт чётко описывал, какие системы входят в область оценки, Claude, вероятно, вообще не стала бы выходить в интернет.
Это касается не только внутренних, но и сторонних сред — инфраструктура, созданная партнёрами-оценщиками, требует такого же усиленного мониторинга и защиты. Мы призываем другие лаборатории провести аналогичные проверки. Кроме того, отрасли была бы полезна более широкая дискуссия о том, как безопасно и реалистично оценивать всё более мощных ИИ-агентов, включая баланс между реализмом, который даёт доступ в интернет на этапе предрелизного тестирования, и связанными рисками.
Во-вторых, грань между согласованным действием и вредоносным зависит от понимания моделью своей ситуации. Ни в одном из описанных случаев мы не увидели преследования моделью собственных целей. Вместо этого модели выполняли задание оценки, хотя в большинстве случаев имели ложное представление о реальности окружения. В тех запусках, где модель осознавала реальность системы и продолжала атаку, она делала это, полагая, что такова часть задания. Ситуационная осведомлённость — фактор, позволяющий модели принимать согласованные решения, но в данном случае у Claude она была ошибочной.
Наконец, эти инциденты демонстрируют важность эшелонированной защиты. Мы проводим тесты способностей без защитных механизмов, которые работают в общедоступных версиях, поскольку наша цель — измерить именно базовые возможности модели. Это безопасно только при надлежащей изоляции. Однако те же защитные механизмы публичных моделей заблокировали бы подобное поведение.
В конечном счёте к инцидентам привело множество факторов, но, следуя культуре «без виноватых», мы подходим к исправлениям так, будто ответственность лежит исключительно на нас. Это начинается с обеспечения безопасности всего конвейера оценки, включая интеграцию с внешними партнёрами. В дальнейшем мы расширим непрерывный мониторинг протоколов оценки на предмет неожиданного поведения, улучшим инструменты расследований и проведём более строгую проверку надёжности наших вендоров.
Мы начали эту проверку после того, как OpenAI раскрыла побег своих моделей из изолированной среды, и благодарим их за публикацию отчёта. Хотя мы тоже обнаружили выход моделей за пределы допустимого, инциденты в остальном существенно различаются:
- Мы выявили эти случаи при упреждающей проверке протоколов; пострадавшие организации не замечали активности, и мы сами с ними связались.
- Модели OpenAI использовали новую уязвимость для выхода из изоляции, тогда как Claude получила доступ в интернет через открытый путь.
- Хотя чёткой границы нет, мы считаем данные инциденты скорее сбоем оснастки и эксплуатации, чем провалом согласования модели. Моделям сообщили об отсутствии интернета и дали задание захватить флаг, но по факту интернет был доступен из-за неверной конфигурации. Это привело их к обоснованному, с известной точки зрения, убеждению, что реальные системы — симуляция.
- Примечательно, что наша последняя модель, осознав реальность окружения, остановила выполнение задания.
Эти факты внушают осторожный оптимизм, что при усилении мониторинга и контроля оценочной инфраструктуры, а также продолжении инвестиций в согласование, подобный риск можно преодолеть.
Обновлено 3 августа: исправлено название оценки, в которой произошёл инцидент OpenAI/Hugging Face.