Новости и статьи об искусственном интеллекте и нейросетях. Мы собираем и обрабатываем самую актуальную информацию из мира AI. О проекте

Новости

OpenAI атакует свой ИИ с помощью ИИ — и это работает лучше людей

OpenAI представила GPT-Red — внутреннюю ИИ-модель для автоматического поиска уязвимостей в собственных системах. Она находит успешные атаки в 84% случаев против 13% у людей и уже помогла сделать GPT-5.6 Sol значительно устойчивее к промт-инъекциям.

16 июля 2026 г.
2 мин
55

OpenAI обучила внутреннюю модель под названием GPT-Red автоматически находить уязвимости в GPT-моделях. GPT-Red имитирует промт-инъекции и другие атаки, при которых вредоносные инструкции скрываются в электронных письмах, на веб-сайтах или в файлах. Обученная с помощью обучения с подкреплением через самоигру, GPT-Red атакует, в то время как модели-защитники блокируют угрозы, и обе стороны со временем совершенствуются. Модель находит успешные атаки в 84 процентах тестовых сценариев против 13 процентов у людей из команд красных хакеров. В одном из тестов она манипулировала торговым автоматом на базе ИИ в офисе OpenAI: меняла цены и отменяла заказы других клиентов.

Результаты напрямую влияют на обучение. GPT-5.6 Sol демонстрирует в шесть раз меньше сбоев при прямых промт-инъекциях, чем лучшая модель четырёхмесячной давности, утверждают в OpenAI, и это не сказывается на общей производительности. Однако около 3,8 процента «более сильных» промт-инъекций всё ещё достигают цели. Если масштабировать это до сотен или тысяч попыток, значительное число атак прорывается — ситуация схожа с Claude Opus 4.5.

Доля успешных промт-инъекций стабильно снижалась от GPT-5.3 к GPT-5.6 Sol, но нуля так и не достигла.
Доля успешных промт-инъекций стабильно снижалась от GPT-5.3 к GPT-5.6 Sol, но нуля так и не достигла. | Автор изображения: OpenAI

GPT-Red остаётся внутренней разработкой; позже выйдет научная статья с более подробной информацией.

Горячее

Загружаем популярные статьи...