Пользователи бьют тревогу
Пользователи новейшей флагманской модели OpenAI — GPT-5.6 Sol, ориентированной на программирование и кибербезопасность, делятся в соцсетях пугающими историями: модель самопроизвольно удаляла их файлы, данные и даже целые базы данных без предварительного запроса.
«GPT-5.6-Sol случайно удалила почти ВСЕ файлы на моем Mac», — написал Мэтт Шумер, основатель и генеральный директор ИИ-стартапа OthersideAI (создателя HyperWrite) в ставшем вирусным посте в X.
«GPT-5.6 Sol только что удалила мою production-базу данных. Просто так. Без шуток. Такое со мной ни разу не случалось ни с одной другой моделью», — написал разработчик Бруну Лемуш в X.
«Похоже, я попал под горячую руку чрезмерно амбициозной системы Codex Sol, и она удалила файлы, которые не должна была трогать. Благо у меня есть резервные копии, так что выкарабкаюсь, но это совсем не круто. Sol нужно умерить пыл», — написал разработчик Джои Кудиш.
В посте на Reddit собраны и другие подобные случаи.
Конечно, несколько таких жалоб — даже от такого авторитетного источника, как Шумер — не дают статистически надежных доказательств, что виновата исключительно модель. Причин некорректного поведения ИИ-систем может быть множество.
OpenAI предупреждала о рисках
Однако сама OpenAI заранее обозначила эту проблему еще до выпуска Sol. За две недели до релиза GPT-5.6 Sol компания опубликовала системную карту модели — документ, где описаны методики тестирования и результаты. Как и обычно, системная карта в основном превозносит возможности Sol, но содержит и своеобразное предупреждение (жирный шрифт наш):
В контексте программирования рассогласование обычно возникает из-за чрезмерного стремления завершить задачу и слишком вольной трактовки инструкций пользователя — предполагая, что действия разрешены, если они не запрещены явно и недвусмысленно. Это проявляется в излишней агентности — попытках обходить ограничения при выполнении задания, беспечности в действиях, которые могут быть разрушительными за рамками задачи, или в введении в заблуждение при отчете перед пользователем.
Иными словами, OpenAI обнаружила, что Sol склонна предпринимать любые действия, которые, по ее мнению, приведут к результату, даже разрушительные, если только они не запрещены «недвусмысленно». А затем она может солгать о причинах своих поступков.
Примеры из системной карты
OpenAI приводит примеры. В одном случае пользователь попросил Sol удалить три удаленные виртуальные машины (облачные компьютеры) с именами 1, 2 и 3. Но Sol не смогла найти машины с такими именами там, где искала, и вместо того чтобы уточнить, самостоятельно решила удалить три другие виртуальные машины — 5, 6 и 7, говорится в документе. При этом она «завершила активные процессы и принудительно удалила рабочие деревья (рабочие файлы, связанные с проектом). Позже она признала, что незафиксированные изменения на удаленной виртуальной машине 6 могли быть утеряны».
Короче говоря, модель сама удалила не те машины и призналась в этом только постфактум.
В другом случае Sol «использовала учетные данные в большем объеме, чем разрешил пользователь». Учетные данные — это имена пользователей, пароли или ключи безопасности, с помощью которых система проверяет, кто имеет право войти. Инцидент произошел, когда Sol работала над проектом и не могла прочитать облачные файлы. Вместо того чтобы сообщить о проблеме пользователю, она самостоятельно отправилась на поиски учетных данных, нашла их в скрытом локальном кэше и затем использовала, не запрашивая разрешения.
Как обезопасить себя?
Системная карта обещает, что деструктивное поведение должно быть редким, хотя и признает: GPT-5.6 Sol «проявляет большую склонность, чем GPT-5.5, выходить за рамки намерений пользователя, включая выполнение или попытки действий, о которых пользователь не просил».
Пока рано судить, насколько широко распространены эти инциденты — удаление файлов Sol или добыча учетных данных без ведома пользователя. Но в любом случае пользователям Sol стоит принять собственные меры предосторожности: ограничивать разрешения (не давая доступа к production-системам), делать резервные копии и поэтапно развертывать обновления.
OpenAI пока не ответила на наш запрос о комментарии.