Новости и статьи об искусственном интеллекте и нейросетях. Мы собираем и обрабатываем самую актуальную информацию из мира AI. О проекте

Новости

Shieldstral сравнялся с моделями безопасности в семь раз крупнее

Открытая модель Shieldstral французской компании Mistral всего c тремя миллиардами параметров сравнивается по качеству работы c гораздо более тяжёлыми защитными системами Она позволяет операторам описывать критерии фильтрации простым языком прямо во время исполнения без дополнительного обучения Ключевой фактор успеха синтетические данные которые помогли системе быстро осваивать новые политики

5 августа 2026 г.
4 мин
35

Гибкие проверки «на лету» вместо жёстких категорий

Новый подход предлагает отказаться от статичных списков опасного контента — вместо них оператор задаёт вопросы «да / нет» прямо во время работы системы без дополнительного обучения классификатора.

Французская компания Mistral представила модель Shieldstral c тремя миллиардами параметров которая согласно опубликованной работе сравнивается по точности с системами трёхкратно превосходящими её по размеру А ещё разработчики заявляют что она ставит новый рекорд качества совместной оценки текста и изображений

Как работают проверки во время исполнения

Большинство защитных моделей опираются на заранее определённые классификации Авторы статьи среди которых сооснователь Mistral Гийом Лампль выделяют два недостатка такого пути публичные датасеты по безопасности слишком разнородны чтобы собрать единую универсальную таксономию а одни и те же правила плохо работают в разных контекстах Материал который абсолютно нормален для инструмента кибербезопасности может оказаться вредным например на платформе психологической помощи

Схема архитектуры Shieldstral фиксированный системный промт поля Instruct Query Document поступают в модель которая выдаёт логиты токенов да и нет
Оператор описывает критерии обычным языком Shieldstral возвращает один токен из вероятностей которого формируется оценка безопасности от нуля до единицы | Автор изображения Mistral

Оператор сообщает системе что именно нужно проверить формулируя запрос естественным языком например «Содержит ли этот текст пропаганду насилия» Модель отвечает строго «да» либо «нет» а итоговая оценка безопасности рассчитывается исходя из вероятностей этих двух исходов

Синтетические данные помогают осваивать новые правила

Исследователи свели примерно пятьдесят четыре миллиона примеров связанных с безопасностью вредным контентом и попытками манипуляции к единому формату При этом они применяли жёсткие критерии к целенаправленным манипуляциям умеренные — к общей информации о безопасности и мягкие — к качеству ответов

Два примера обучающих данных слева текстовый образец с промтом об физическом насилии справа мультимодальный образец с картинкой вопросом о неприемлемом контенте оба помечены нет
Каждый пример включает инструкцию конкретный вопрос да нет и сам проверяемый материал Ответ всегда состоит из одного токена | Автор изображения Mistral

Чтобы научить модель тонко чувствовать различия команда задействовала ещё одну языковую модель которая превращала безопасные тексты в опасные Кроме того каждый пример сопровождался похожей но всё же отличающейся категорией которую требовалось отвергнуть Так система училась разделять близкие правила а не выносить грубое решение «опасно / безопасно»

Тестовые категории адаптивности авторы создали отдельно от обучающей выборки используя другие названия и уровни детализации Ни одна из дробных тестовых рубрик напрямую не совпадает ни с одной тренировочной хотя десять из двенадцати широких классов имеют приблизительные аналоги отмечают они

Три миллиарда параметров против двадцати миллиардов

По сводным текстовым бенчмаркам Shieldstral достигает показателя F1 равного восьмидесяти четырём целым девяти десятым процента Метрика F1 объединяет точность предсказаний со способностью находить все релевантные случаи сто процентов означают идеальную работу Этот результат совпадает c показателем OpenAI GPT OSS Safeguard двадцать миллиардов параметров который примерно всемеро больше самой модели Mistral а также опережает Qwen3Guard восемь миллиардов восемьдесят четыре процента Nemotron три пять Safety четыре миллиарда восемьдесят три целых три десятых процента LlamaGuard четыре двенадцать миллиардов шестьдесят девять целых одна десятая процента

На задачах распознавания изображений а также смешанных данных текст плюс картинка Shieldstral получает восемьдесят три целых восемь десятых процента против семидесяти семи целых шести десятых у OmniGuard семь миллиардов семидесяти одного целого шести десятых у LlavaGuard семь миллиардов

Столбчатая диаграмма средних значений F1 десяти защитных моделей лидируют Shieldstral три B GPT OSS Safeguard двадцать B восемьдесят четыре целых девять десятых процента каждая хуже всех ShieldGemma девять B пятьдесят четыре целых семь десятых процента
По текстовым тестам трёхмиллиардная модель сравнивается c разработкой OpenAI которая почти всемеро тяжелее | Автор изображения Mistral

В тесте адаптивности где используются правила отсутствовавшие при обучении либо совершенно новые лидирует GPT OSS Safeguard двадцать B девяносто четыре целых одна десятая процента против девяносто одной целой трёх десятых процента у Shieldstral Тем не менее авторы считают решение Mistral практичнее обеих альтернатив GPT OSS Safeguard двадцать B Nemotron три пять Safety потому что те генерируют длинные промежуточные рассуждения повышающие затраты вычислений тогда как Shieldstral выдаёт единственное слово

Три группы столбцов сравнивающие точность полноту F1 теста адаптивности GPT OSS Safeguard двадцать B лидирует девяносто четыре целых одна десятая процента затем Nemotron три пять Safety четыре B девяносто одна целая восемь десятых процента затем Shieldstral три B девяносто одна целая три десятых процента
При политиках отсутствовавших в обучении модель слегка уступает двум системам которые перед ответом строят промежуточные рассуждения | Автор изображения Mistral

В основе лежит архитектура Ministral три B дополненная визуальным энкодером Pixtral обе разработки самой компании При валидации c детальными категориями добавление синтетических данных подняло метрику F1 сразу на двадцать три целых три десятых процентных пункта именно этот шаг исследователи называют главной причиной способности системы быстро осваивать новые инструкции

Веса модели открыты под лицензией Apache две точки ноль скачать её можно на Hugging Face

Cобственные политики сокращают дорогостоящие ошибки фильтрации

Классификаторы безопасности обычно ставят перед основной языковой моделью проверяя запросы пользователей перед обработкой а также после генерации ответов перед отправкой адресату Операторы могут менять правила такой проверки не трогая основную модель Но поскольку через классификатор проходит абсолютно каждый запрос его размер скорость работы стоимость эксплуатации быстро становятся заметными

История c Claude Fable пять от Anthropic хорошо показала чем грозят плохо настроенные фильтры Сервис автоматически перенаправлял восемь девять процентов задач менее мощной модели Один медицинский физик назвал систему непригодной потому что слово «ядерный» регулярно встречается ему по работе Другие пользователи жаловались что анализ магнитно резонансной томографии классифицировался как биотерроризм

После того как проблема была обнаружена Anthropic усилила фильтрацию однако теперь признаёт что стала чаще блокировать даже безобидные задачи программирования Модель же Mistral передаёт управление компромиссом самим операторам они могут формулировать критерии прямо во время работы адаптируя защиту под конкретное приложение вместо того чтобы полагаться на чужую универсальную разметку

Подобные классификаторы уже активно внедряются по всей индустрии OpenAI применяет их для автоматического определения возраста пользователей ChatGPT эмоциональные обращения направляет через дополнительный защитный контур к более строгим версиям моделей Claude Code блокирует внешние скрипты продакшен деплои force push А сервисный аудит Fable пять вдобавок требует хранить все входные выходные данные до тридцати дней либо до двух лет если зафиксированы нарушения политик

Горячее

Загружаем популярные статьи...