Большие языковые модели (LLM), способные пошагово обдумывать задачи, значительно расширили круг проблем, которые может решать ИИ. Однако новые исследования показывают, что эти способности к рассуждению создают критическую уязвимость: злоумышленники могут заставить такие системы работать крайне медленно.
Если ранние версии LLM сразу выдавали ответ на запрос, то современные модели сначала строят внутренний монолог: разбивают задачу на шаги и ищут оптимальный путь решения. Это позволило ИИ справляться со все более сложными задачами, особенно в программировании и математике.
Однако более ранние работы уже указывали, что такие модели иногда генерируют излишне длинные цепочки рассуждений, которые почти не улучшают результат — это явление назвали «переосмыслением» (overthinking). В исследовании, представленном на этой неделе на Международной конференции по машинному обучению ICML 2026 в Сеуле, специалисты из Чжэцзянского университета и Alibaba показали, что можно намеренно вызывать переосмысление, давая моделям логически противоречивые промпты. По сути, это приводит к атаке типа «отказ в обслуживании» на коммерческие ИИ-сервисы.
Эволюционная атака через промпты на LLM
Команда разработала эволюционный алгоритм, который нарушает логическую структуру промптов, заставляя модели уходить в бесконечное переосмысление при попытке решить принципиально неразрешимые задачи. Генерация более длинных ответов требует больше ресурсов и увеличивает нагрузку на серверы провайдера, поэтому при массовом применении это может серьезно ухудшить работу для обычных пользователей. Атака оказалась эффективной против рассуждающих моделей ведущих компаний: DeepSeek-R1, Qwen3-Thinking от Alibaba, GPT-o3 от OpenAI и Gemini 2.5 Flash от Google; на стандартном математическом бенчмарке длина ответов возрастала до 26 раз по сравнению с обычной.
«На различных наборах данных и рассуждающих моделях наш метод значительно увеличивает длину вывода», — написал Вэй Цао, магистрант Чжэцзянского университета, в письме IEEE Spectrum. «Результаты показывают, что переосмысление — не изолированное явление, свойственное отдельным моделям, а общая уязвимость современных рассуждающих ИИ».
Метод опирается на более раннюю работу другой группы, которая показала, что рассуждающие модели склонны к переосмыслению, когда в вопросе отсутствует ключевое условие — например, если спросить, сколько всего пройдет человек, проходящий 10 миль в день, не уточняя количество дней. Вместо того чтобы определить, что задача не имеет решения, модели часто входят в долгие, но бесплодные циклы рассуждений.
Развивая эту идею, авторы взяли 940 задач из трех математических бенчмарков и с помощью LLM разбили их логическую структуру на набор предпосылок и итоговый вопрос. Затем генетический алгоритм перемешивал их, применяя различные «мутации»: обмен предпосылками между задачами, добавление лишних предпосылок, удаление существующих и замену итоговых вопросов между разными наборами предпосылок.
После каждого раунда мутаций задачи оцениваются по тому, сколько слов они заставляют целевую модель сгенерировать, а также повышают ли они частоту появления специфических лингвистических маркеров переосмысления — слов вроде «но», «подожди», «может быть» или «с другой стороны». Задачи с наивысшими баллами по обоим критериям сохраняются, а остальные снова перемешиваются; процесс повторяется в течение пяти поколений. Важно, что метод не требует доступа к внутренностям модели и позволяет создавать вредоносные промпты, просто отправляя запросы к целевой системе, что делает возможной атаку на закрытые коммерческие сервисы, отмечает Цао.
Уязвимость переосмысления в ИИ-моделях
Исследователи обнаружили, что предложенный подход стабильно приводил к выводам, в несколько раз более длинным по сравнению с ответами на неизмененные вопросы для всех протестированных рассуждающих моделей. Наибольший рост показала DeepSeek-R1 на датасете MATH, состоящем из задач школьных математических олимпиад: максимальная длина вывода оказалась в 26,1 раза больше самого длинного ответа на обычные вопросы.
Хотя основное внимание уделялось математическим задачам, авторы также проверили метод на задачах по программированию, научным рассуждениям и диалогам — во всех трех случаях наблюдалось значительное увеличение объема ответов.
Одна из проблем метода в том, что создание вредоносных промптов требует многократных запросов к дорогим рассуждающим моделям, что, как признает Цао, может ограничить его экономическую эффективность. Однако исследователи также показали, что если использовать для генерации зловредных запросов более компактную и дешевую модель, все равно удается заставить целевые системы выдавать ответы в несколько раз длиннее обычного. Такая возможность переноса вредоносных промптов между моделями значительно повышает реализуемость атаки, пишет Цао.
Тем не менее, он подчеркивает, что цель работы — не создание практической DoS-атаки на рассуждающие модели. Такие факторы, как ценовая политика провайдеров, ограничения частоты запросов, размер контекстного окна и существующие механизмы защиты, могут повлиять на эффективность подхода. Задача скорее в том, чтобы привлечь внимание к уязвимости моделей перед логически противоречивыми промптами, чтобы провайдеры могли работать над ее устранением.
«Наша цель — не показать, что можно запустить крупномасштабные атаки с минимальными затратами, а подтвердить существование такой поверхности для атак, — написал он. — Результаты говорят о том, что эта уязвимость представляет реальную угрозу безопасности».