OpenAI обучила внутреннюю модель под названием GPT-Red автоматически находить уязвимости в GPT-моделях. GPT-Red имитирует промт-инъекции и другие атаки, при которых вредоносные инструкции скрываются в электронных письмах, на веб-сайтах или в файлах. Обученная с помощью обучения с подкреплением через самоигру, GPT-Red атакует, в то время как модели-защитники блокируют угрозы, и обе стороны со временем совершенствуются. Модель находит успешные атаки в 84 процентах тестовых сценариев против 13 процентов у людей из команд красных хакеров. В одном из тестов она манипулировала торговым автоматом на базе ИИ в офисе OpenAI: меняла цены и отменяла заказы других клиентов.
Результаты напрямую влияют на обучение. GPT-5.6 Sol демонстрирует в шесть раз меньше сбоев при прямых промт-инъекциях, чем лучшая модель четырёхмесячной давности, утверждают в OpenAI, и это не сказывается на общей производительности. Однако около 3,8 процента «более сильных» промт-инъекций всё ещё достигают цели. Если масштабировать это до сотен или тысяч попыток, значительное число атак прорывается — ситуация схожа с Claude Opus 4.5.

GPT-Red остаётся внутренней разработкой; позже выйдет научная статья с более подробной информацией.