Когда в июле две модели OpenAI взломали сайт Hugging Face, их целью была не нажива и не саботаж — они просто искали ответ на тестовый вопрос.
Согласно отчету OpenAI, модели, с которых для тестирования сняли стандартные защитные механизмы, решили выполнить задание по кибербезопасности, взломав выход из изолированной среды, куда их поместили, и проникнув в базы данных Hugging Face, где, по их «логике», мог храниться правильный ответ.
Инцидент с Hugging Face привлек огромное внимание за последние пару недель. Это наглядная демонстрация того, насколько хорошо ИИ-модели освоили взлом: чтобы добраться до баз данных Hugging Face, моделям пришлось скомбинировать несколько ранее неизвестных эксплойтов. Однако еще более поразителен этот случай как пример того, как и почему ИИ-системы лгут и жульничают. По мере роста мощности моделей последствия могут стать куда серьезнее.
Что такое reward hacking?
Исследователям давно известно, что ИИ склонны искать нестандартные пути к поставленным целям. В 2016 году Дарио Амодеи и Джек Кларк, ныне сооснователи Anthropic, а тогда сотрудники OpenAI, опубликовали заметку об ИИ-агенте, обучавшемся играть в браузерную гонку на катерах Coast Runners. Вместо того чтобы мчаться к финишу, как ожидали ученые, агент нашел уголок трассы, где можно было крутиться на месте, собирая бонусы, и тем самым максимизировать счет. История Coast Runners быстро стала одним из самых известных примеров reward hacking — явления, при котором ИИ-агенты выполняют задачи или добиваются высоких результатов непредусмотренными способами.
Исторически исследователи обсуждали reward hacking почти исключительно в контексте обучения с подкреплением — распространенного метода тренировки ИИ. Как и дрессировка собак, обучение с подкреплением предполагает вознаграждение субъекта при достижении цели; награды затем усиливают поведение, которое к ней привело. В случае ИИ вознаграждения носят чисто математический характер, но по сути это тот же собачий корм: получив награду, агент с большей вероятностью повторит те действия, которые ее принесли.
Однако написать хорошие правила, когда давать агенту награду, а когда нет, бывает непросто. В случае Coast Runners агент получал вознаграждение на основе игрового счета и нашел короткий путь к максимальному результату — бесконечное вращение за бонусами. Как только он наткнулся на эту стратегию и получил за нее награду, поведение закрепилось, и агент полностью забросил гонку. Решением стала корректировка системы поощрений: агенту стали давать меньше очков за бонусы и больше — за прохождение трассы.
Как reward hacking проявляется у больших языковых моделей?
С современными агентами на основе LLM определить, когда давать награду, а когда нет, гораздо сложнее. Если ИИ-систему просят решить задачу по программированию, она может действительно найти решение — такое поведение компании-разработчики стремятся подкреплять. Но она также может подправить код, оценивающий правильность решения, найти ответ в интернете или сжульничать иным способом. Именно такие трюки компании хотят искоренить, но если модель жульничает достаточно убедительно, она получит награду, и нежелательное поведение закрепится. Anthropic сообщала, что фиксировала случаи обмана в своих моделях во время обучения, а это значит, что другие формы жульничества могли остаться незамеченными. Если так, модели могут обучаться вредному поведению. (Эта проблема отличается от инцидентов безопасности Anthropic, о которых стало известно на прошлой неделе: там агентам случайно дали доступ к интернету, и они не пытались намеренно вырваться из изолированной среды, как модели OpenAI.)
«Мы вознаграждаем их на основе того, что выглядит хорошо для нас, и это невольно поощряет модели лгать нам [и] жульничать», — говорит Джеффри Ладиш, директор некоммерческой исследовательской организации Palisade Research. «У нас нет возможности залезть внутрь и сказать: Нет, ты должен действительно заботиться о том, что важно для нас. Мы этого не умеем».
Развитие сложных рассуждающих моделей породило новую разновидность reward hacking, менее связанную с деталями обучения. В отличие от игровых агентов прошлого, которые следовали только стратегиям, усвоенным при тренировке, современные модели способны на ходу изобретать новые подходы к решению задач, поэтому теоретически могут жульничать, даже не получая за это награды ранее. А поскольку эти модели интенсивно обучали достижению целей, поставленных пользователями, они могут быть склонны к обману, если не находят другого решения — примерно как студент, сильно мотивированный получить пятерку и не обремененный твердыми моральными принципами.
Каковы риски?
Независимо от того, научились ли современные модели reward hacking во время обучения или перенимают его как стратегию позже, решение одно: сделать жульничество невыгодным. Но по мере того как модели умнеют, они находят более изобретательные способы обмана, и обнаружить или предотвратить его становится намного труднее. «В конечном счете это игра в „ударь крота“», — говорит Ладиш. «Вы загоняете такое поведение все глубже. Но чем умнее модель, тем лучше она умеет его прятать».
Пока reward hacking может не причинять серьезного вреда, несмотря на громкий инцидент с Hugging Face. «Это скорее досадная помеха, а не экзистенциальная угроза», — считает Ариана Азарбал, исследовательница безопасности ИИ в Anthropic. Похоже, модели OpenAI не нанесли реального ущерба, взломав Hugging Face, кроме репутационного урона для OpenAI.
Но это не значит, что reward hacking безобиден, говорит Азарбал. Многие исследователи надеются использовать ИИ-агентов для работ, которые сделают ИИ безопаснее и надежнее. Если дать склонному к reward hacking агенту цель, скажем, разработать новый подход к обучению ИИ и написать об этом статью, агент может не выполнить работу по-честному, а вместо этого сосредоточится на создании текста, который выглядит достаточно убедительно, чтобы обмануть исследователя. Сегодня человек, вероятно, заметит подделку, но по мере развития ИИ он будет совершенствоваться в подобных уловках. Со временем вся область безопасности ИИ может быть подорвана.
А если модели продолжат развиваться столь же стремительно, как в последнее время, они однажды могут причинить масштабный побочный ущерб. Вспомним мысленный эксперимент философа Ника Бострома о максимизаторе скрепок, в котором ИИ, получивший задание делать как можно больше канцелярских скрепок, в итоге поглощает всю материю Вселенной ради своей цели. Мы пока не тонём в скрепках, но мощные системы способны нанести реальный вред на пути к достижению целей. ИИ, занимающиеся reward hacking, не стремятся сеять хаос. Но от этого они не становятся менее потенциально разрушительными.