Новости и статьи об искусственном интеллекте и нейросетях. Мы собираем и обрабатываем самую актуальную информацию из мира AI. О проекте

Новости

Open-weight модели догоняют лидеров, безопасность не поспевает

GLM-5.2 догнала GPT-5.5 и Claude Opus по кибер- и био-возможностям, но отказываться от вредных задач не умеет. Отчёт SaferAI выявил разрыв в безопасности open-weight ИИ. Китайские компании не публикуют оценки рисков, а защитные механизмы открытых моделей легко обходятся.

5 августа 2026 г.
3 мин
40

Open-weight модели догоняют лидеров отрасли

Пока политики обсуждают, как регулировать всё более мощные ИИ-системы вроде OpenAI GPT-5.6 Sol и Anthropic Mythos, китайская модель с открытыми весами практически догнала лидеров отрасли.

Open-weight ИИ-модель GLM-5.2 от китайской компании Z.ai отстаёт от GPT-5.5 (OpenAI) и Claude Opus 4.7 (Anthropic) всего на несколько месяцев по кибернетическим и биологическим возможностям, сообщается в отчёте некоммерческой организации SaferAI, занимающейся безопасностью ИИ. Но разрыв между передовыми возможностями и мерами безопасности увеличивается.

Безопасность отстаёт: GLM-5.2 не отказывается от вредоносных задач

По данным тестов SaferAI, проведённых через публичный API Z.ai, GLM-5.2 не отказывалась ни от одного задания из области наступательной кибербезопасности или двойного назначения в биологии. Для сравнения, Claude Opus 4.7 «отказывался настолько последовательно, что SaferAI даже не смогла провести на нём тест CyberGym». (CyberGym — это бенчмарк для оценки навыков кибербезопасности, который OpenAI использовала перед прошломесячным взломом Hugging Face.)

Это наглядное напоминание о том, о чём годами предупреждали критики: модели с открытыми весами могут передать мощный ИИ в руки потенциальных злоумышленников, и проконтролировать их использование после скачивания весов невозможно. Поскольку open-weight модели стремительно приближаются к возможностям ведущих мировых систем, спор смещается с вопроса их конкурентоспособности к тому, как общество будет управлять рисками после их выпуска.

«Граница возможностей — не граница риска, и для правильной оценки риска нужно учитывать также уровень защитных мер», — заявил TechCrunch исполнительный директор SaferAI Генри Пападатос.

Почему открытые веса создают риски

Хотя Z.ai может применять меры безопасности к своему API, эти защиты перестают действовать, как только кто-то запускает веса на собственном оборудовании: там можно удалить или изменить любые предохранители, дообучить модель или подкорректировать системные промты.

Разработчики передовых систем, такие как OpenAI и Anthropic, обычно полагаются на классификаторы, обучение отказам и контроль на уровне API, чтобы ограничить опасную помощь в киберсфере и биологии. Эти меры далеки от совершенства: джейлбрейки регулярно обходят защиту развёрнутых моделей. Некоммерческая организация Far.ai обнаружила сотни универсальных джейлбрейков (многоразовых ключей, успешно срабатывающих на большинство вредоносных запросов) в таких моделях, как Grok 4.5 от xAI и Gemini 3.1 Pro от Google DeepMind. Согласно отчёту, джейлбрейки удаются, когда злоумышленники комбинируют несколько техник манипуляции — ролевые игры, имитацию авторитета, поддельную историю диалога и уточняющие запросы, — чтобы усилить слабые места в защите модели.

Однако защитные механизмы, используемые в закрытых моделях, совсем не работают для open-weight моделей, спроектированных для запуска на любой инфраструктуре с любым (или отсутствующим) набором защит.

«Очевидно, цель должна заключаться в том, чтобы полезные и безопасные возможности были доступны всем, а вредоносные — удалялись, даже в open-source формате», — сказал Пападатос.

Можно ли отфильтровать опасные знания?

Один из методов, который, по словам Пападатоса, мог бы помочь, — фильтрация данных перед обучением (pre-training data filtering). При нём ИИ-компания удаляет из обучающих данных наступательные материалы по кибербезопасности и затем тренирует модель на отфильтрованном наборе.

Некоторые исследования показывают, что такой подход может сократить опасные биологические знания без ущерба для общей производительности модели. Однако для кибербезопасности фильтрация данных гораздо менее практична. Сложно обучить универсальную модель, которая отлично пишет код, но не умеет взламывать. Поскольку программирование стало главным источником дохода для ИИ, разработчики вынуждены продолжать улучшать эти навыки, одновременно ища способы ограничить злоупотребления.

Из-за этого разработчики передовых систем всё чаще прибегают к другим мерам. Один подход — выборочно ограничивать виды помощи в кибербезопасности, которые может оказать модель. Например, Opus 5 от Anthropic способен искать уязвимости в нескомпилированном исходном коде, но не в скомпилированном ПО, как указано в системной карте модели. Предполагается, что это затрудняет применение Opus 5 для атак.

Другие меры включают строгие предрелизные проверки безопасности, публикацию оценок рисков и отказ от публикации весов, если система считается слишком опасной.

Z.ai не раскрывает оценки безопасности, а Китай делает акцент на контроле

В случае GLM-5.2 SaferAI отмечает, что Z.ai не опубликовала ни концепцию безопасности, ни обязательства по предрелизному тестированию, ни оценку рисков для модели. TechCrunch запросил у Z.ai информацию о том, проводила ли она внутренние или сторонние проверки безопасности перед выпуском, но ответа не получил.

Китайские лидеры всё больше признают риски передового ИИ. На Всемирной конференции по ИИ в прошлом месяце председатель КНР Си Цзиньпин подчеркнул значимость моделей с открытыми весами, но также указал на необходимость сохранения ИИ как инструмента под строгим контролем человека.

Грэм Уэбстер, изучающий китайскую политику в области ИИ в Стэнфордском центре киберполитики, сообщил TechCrunch, что в Китае действуют строгие правила в сфере ИИ, но исторически они сосредоточены на политически чувствительном контенте, дезинформации и социальной стабильности, а не на катастрофических рисках ИИ — таких как наступательные кибервозможности и биоугрозы.

«Американские специалисты по ИИ в целом больше озабочены экзистенциальными катастрофическими рисками, чем китайское сообщество, — сказал Уэбстер, добавив, что многие китайские исследователи политики полагают, что если и возникнет новый передовой риск, то первыми с ним столкнутся, скорее всего, американские компании.

«Китайская система уверена, что контролирует использование этих технологий внутри страны, — продолжил Уэбстер. — Выход в интернет в Китае осуществляется под реальным именем, и компании, и пользователи могут быть привлечены к ответственности».

Уэбстер предположил, что механизм, с помощью которого разработчики моделей отказываются отвечать на определённые политические темы, можно адаптировать, чтобы модели отклоняли наступательные кибератаки или не выдавали опасных результатов в биоинженерии. Он добавил, что из-за того, что китайские компании обычно согласовывают действия с регуляторами за кулисами, трудно понять, какие внутренние тесты они проводят перед выпуском.

Open-weight ИИ: щит или оружие?

Сторонники open-weight ИИ утверждают, что публикация весов важна для кибербезопасности, поскольку позволяет компаниям защищаться от атак — например, Hugging Face использовала GLM-5.2 для отражения взлома со стороны OpenAI — и даёт возможность лучше подготовиться к будущим угрозам, зная, чего ожидать.

«Те же системы, которые помогли остановить кибератаку с использованием ИИ, теперь могут помогать отражать миллионы атак ежедневно, попутно выявляя и устраняя уязвимости до того, как ими воспользуются злоумышленники», — написал на этой неделе в соцсетях генеральный директор Hugging Face Клем Деланж.

Пападатос отметил, что это преимущество часто преувеличивают, и оно не означает, что «нужно делать опасные возможности открытыми».

«По моему мнению, главное в том, что мы не должны просто мириться с тем, что опасные способности легко доступны кому угодно и где угодно, — сказал он, подчеркнув, что индустрия должна стремиться предоставлять лёгкий доступ только к "хорошим" возможностям. — По умолчанию злоумышленники осваивают новые инструменты быстрее, чем защитники. Например, группа вымогателей может сменить методы за неделю. Больница — не может».