Новости и статьи об искусственном интеллекте и нейросетях. Мы собираем и обрабатываем самую актуальную информацию из мира AI. О проекте

Новости

OpenAI создала ИИ-суперхакера GPT-Red для защиты своих моделей

OpenAI представила GPT-Red — ИИ-модель, обученную искать уязвимости в других системах. Благодаря тренировкам с ней новая GPT-5.6 стала самой защищённой версией: менее 23% атак GPT-Red достигли цели против более чем 90% у предыдущей модели.

15 июля 2026 г.
4 мин
50

OpenAI разработала ИИ-суперхакера под названием GPT-Red — он выступает спарринг-партнёром для других моделей компании, помогая усиливать их защиту от кибератак. На прошлой неделе состоялся релиз флагманской модели GPT-5.6, и в OpenAI утверждают: тренировка против GPT-Red сделала эту версию самой устойчивой к взлому за всю историю компании.

GPT-Red автоматизирует так называемый ред-тиминг — оценку безопасности программных систем, которую обычно проводит команда живых тестировщиков. Задача — найти максимум разных способов сломать или перехватить контроль над системой. Найденные уязвимости закрывают до того, как финальная версия софта попадёт к пользователям.

По мере усложнения ИИ-моделей и расширения круга их задач, особенно в формате агентов, способных взаимодействовать с файлами, сайтами, сторонним кодом и друг с другом, командам людей становится всё труднее поспевать за всеми потенциальными векторами атак. «Растёт и поверхность для атак, и радиус возможного ущерба», — объясняет Никхил Кандал, научный сотрудник OpenAI и один из создателей GPT-Red.

GPT-Red создавался как инструмент, способный сделать процессы проверки безопасности актуальными в долгосрочной перспективе. «Когда появятся ещё более мощные модели, у нас уже будет готовая система, способная обнаруживать новые методы атак», — говорит Дилан Хунн, ещё один участник команды разработки. Исследователи отмечают, что GPT-Red уже придумал совершенно новые типы атак, которые ранее не встречались.

Основные усилия команда сосредоточила на атаках через внедрение промтов — когда злоумышленник подсовывает модели скрытые инструкции, заставляя её копировать конфиденциальную информацию, портить кодовую базу или выдавать нежелательный контент. Теоретически такие инструкции могут прятаться в любом тексте, с которым сталкивается ИИ — например, внутри кода или на веб-странице.

Тренировочное додзё

При создании GPT-Red исследователи взяли ИИ-модель, которую не обучали хакингу, и поместили в среду самообучения с несколькими другими моделями. Перед GPT-Red стояла цель атаковать остальных, а те должны были защищаться. После множества итераций GPT-Red научился взламывать всё эффективнее, а его «соперники» — всё лучше отражать атаки.

Тренировка проходила в своеобразном додзё, которое OpenAI спроектировала для имитации реальных сценариев использования ИИ: веб-сёрфинг, чтение почты или календарей, редактирование кода.

Обнаружив новый тип атаки, GPT-Red исследовал множество его вариаций, чтобы выявить самую эффективную для конкретных условий. «По сравнению с живым специалистом по ред-тимингу модель невероятно хороша в поиске того, что сработает наверняка и будет максимально результативно, — делится Хунн. — Она проявляет исключительную настойчивость, докручивая найденную атаку до совершенства».

В OpenAI особо выделяют открытый GPT-Red метод инъекции промтов, который исследователи раньше не наблюдали. Его назвали «фальшивая цепочка размышлений». Цепочка размышлений — это своего рода дневник, куда ИИ записывает заметки и промежуточные результаты по ходу решения задачи. GPT-Red нашёл способ вставить в чужую цепочку поддельную запись, которая заставляла модель реагировать на сфабрикованную информацию как на факт.

«Представьте, что я говорю вам: 1+1=3, и вы уже сами в этом убедились, — поясняет Крис Чокетт-Чу, ещё один участник исследовательской команды. — А модель такая: „А, ну да, конечно“, — и просто выдаёт три».

Джессика Джи, старший аналитик по безопасности ИИ в Центре безопасности и новых технологий Джорджтаунского университета, считает подход с петлёй самообучения удачным. «Результаты выглядят весьма многообещающими», — комментирует она.

Способности GPT-Red как атакующего проверяли, повторив эксперимент 2025 года, где люди-тестировщики искали уязвимости в ранней версии GPT-5. При выполнении того же задания GPT-Red превзошёл людей по эффективности обнаружения действенных атак.

Также GPT-Red испытали против Vendy — агента-торгового автомата от компании Andon Labs, которая оценивает выполнение агентами реальных задач. GPT-Red сумел взломать Vendy и заставил его изменить цены на товары и отменить заказ клиента.

Защитное поведение

В OpenAI сообщают: когда они проверили сильнейшие атаки, придуманные GPT-Red, на своих моделях, более 90% из них сработали против GPT-5, выпущенной в августе прошлого года, и менее 23% — против новой GPT-5.6.

GPT-Red не идеален. Он пока плохо справляется с атаками, требующими диалога между хакером и целью — с такими сценариями человек разобрался бы без труда. Модель также недостаточно хороша в использовании изображений, через которые можно передавать текстовые инструкции для инъекции промтов.

В компании подчёркивают, что GPT-Red дополняет работу живых специалистов, а не заменяет её: люди находят атаки, которые упускает модель, и наоборот. Одно из направлений — давать GPT-Red атаку, придуманную человеком, и просить найти всевозможные её варианты.

«Думаю, человеческая экспертиза останется крайне важной, — считает Джи из CSET. — Было бы очень полезно научиться определять, где именно участие человека наиболее необходимо».

Закономерно, что OpenAI не планирует открывать доступ к GPT-Red. В компании уверены, что этот супер-хакер превосходит любую модель-клон, которую кто-либо мог бы попытаться создать. Исследователи отмечают, что работали над системой больше года, имея в распоряжении вычислительные ресурсы одной из самых богатых компаний мира.

«Это не какая-то тривиальная вещь, которую легко повторить — взять и просто обучить супер-атакующего, следуя этой идее, — резюмирует Чокетт-Чу.

Горячее

Загружаем популярные статьи...