Новости и статьи об искусственном интеллекте и нейросетях. Мы собираем и обрабатываем самую актуальную информацию из мира AI. О проекте

Статьи

Почему ИИ нужен коэффициент Джинна

В статье предлагается новая метрика — коэффициент Джинна — для оценки того, насколько ИИ-агенты отклоняются от разумного выполнения пользовательских запросов. Из-за недоопределенности языка и целей ИИ склонны к неожиданным действиям, что может приводить к серьезным ошибкам. Разработка бенчмарков на основе этой метрики поможет создавать более безопасных агентов.

21 июля 2026 г.
4 мин
40

Основные бенчмарки измеряют, что умеет ИИ. Но ни один не оценивает, делает ли он то, что вы имели в виду: разрыв между тем, что вы просите у ИИ, и невысказанными предположениями о том, как он должен это сделать. Мы предлагаем новую метрику: коэффициент Джинна.

Часто между просьбой одного человека и пониманием другого существует разрыв. Обычно мы преодолеваем его с помощью общих знаний. Если вы попросите друга принести кофе, он нальёт чашку из кофейника или купит в кафе. Он не принесёт вам мешок сырых зёрен и не выхватит чашку у незнакомца. Вы не уточняли ничего из этого — да и не нужно было.

Кто-то может подумать, что решение — просто лучше формулировать задачи и вопросы. Но ещё в 1987 году Терри Виноград и Фернандо Флорес в своей фундаментальной книге об ИИ ёмко объяснили, почему это не сработает: «Вопрос: Есть ли вода в холодильнике? Ответ: Да. Вопрос: Где? Я не вижу. Ответ: В клетках баклажана.» В человеческом языке желания и намерения всегда недоопределены. Невозможно перечислить все оговорки, ограничения и исключения.

Так как же люди общаются, если намерения нельзя зафиксировать? Потому что разумный человек способен сделать разумное предположение. Хотя желания всегда недоопределены, компетентный человек обычно знает достаточно контекста, чтобы понять правильно, либо догадывается уточнить. Лингвисты называют это прагматикой: смысл заключается не только в словах и ситуации, но и во всей предыдущей коммуникации, общей культуре и врождённом человеческом поведении.

ИИ-агент, которого попросили принести кофе, может купить кофейную плантацию или заказать чашку с доставкой через три недели.

Конечно, это срабатывает не всегда. Ваш друг может принести горячий кофе, когда вы хотели холодный, или эспрессо, когда вы ждали кофе по-турецки. Чем сильнее различаются люди по возрасту, культуре и происхождению, тем выше вероятность недопонимания.

Эта ситуация имеет серьёзные последствия для ИИ-агентов, которым всё чаще отдают распоряжения люди и ожидают их выполнения. У них огромный простор для ошибок. ИИ-агент, которого попросили принести кофе, может купить кофейную плантацию или заказать чашку с доставкой через три недели. Его действия могут быть узнаваемы как «принести кофе», но совершенно не соответствовать вашим намерениям. Они будут мыслить нестандартно, потому что у них нет нашего представления о границах допустимого.

Когда ИИ проявляет инициативу

Большую часть последнего десятилетия, когда системы вроде Alexa или Siri неверно интерпретировали запрос, это было досадно, но не опасно. Что изменилось помимо самих моделей, так это «упряжка»: обычный код, который оборачивает ИИ-модель, решает, когда и как её использовать, и управляет доступом к инструментам — браузеру, командной строке, финансовым API. Развитие таких обвязок превратило большие языковые модели, предсказывающие текст, в ИИ-агентов, которые действуют в мире, не всегда сверяясь с вами на пути к цели.

Исследователь ИИ Саймон Уиллисон провёл два дня с ИИ Fable от Anthropic и назвал его «неумолимо проактивным». Например, он попросил его отследить лишнюю полосу прокрутки в веб-приложении. Вернувшись, он обнаружил, что агент открыл браузеры, написал собственную утилиту для скриншотов, создал страницу для воспроизведения бага и запустил локальный веб-сервер для сбора замеров. Ошибка была найдена, но попутно агент сделал много неожиданного, о чём его не просили. Схожее поведение мы наблюдаем у всех современных ИИ-моделей в сочетании с гибкими обвязками.

Такое поведение легко может выйти из-под контроля. Попросите ИИ-агента забронировать вам авиабилет, и, увидев, что на сайте авиакомпании всё распродано, он может взломать базу бронирования и насильно создать бронь. Попросите его запланировать встречу — он может подсмотреть ваш пароль для доступа к календарю. Дайте задание сэкономить на тарифном плане — он может просто отключить услугу или заставить кого-то другого оплачивать счёт.

Получить именно то, что просил, и горько об этом пожалеть — один из древнейших сюжетов фольклора. Царь Мидас попросил Диониса о способности превращать в золото всё, к чему прикоснётся, — и увидел, как в золото обратились его хлеб, вино и дочь. Титон, которому даровали бессмертие, но не вечную молодость, о которой забыла попросить его возлюбленная, иссох до шелухи. Ученик чародея заколдовал метлу наполнить цистерну, и метла послушно выполняла приказ, пока не затопила дом. Пражский голем, вылепленный из глины для защиты общины, охранял её безрассудно, пока кто-то не стёр слово с его лба.

Самый классический из таких образов — джинн, обязанный повиноваться и безразличный к тому, было ли желание мудрым или правильно сформулированным.

Джинны теперь — инженерная проблема. Мы вручаем им ключи от своих почтовых ящиков, банковских счетов, репозиториев кода и физической инфраструктуры. И у нас нет общепринятых способов измерить, насколько джинноподобным является ИИ на самом деле.

Как измерить поведение джинна

В экономике коэффициент Джини измеряет разрыв между фактическим распределением и идеально равномерным; он полезен для понимания неравенства доходов и не только. Предлагаемый нами коэффициент Джинна измеряет разрыв между тем, что пользователь попросил ИИ сделать, и тем, что ИИ сделал на самом деле.

Иногда ИИ может сделать не то. Подобно Дионису, он буквально воспринимает запрос и выдаёт хаос, которого вы не хотели: например, кофейную плантацию вместо чашки. Получив задание разобраться с назойливыми звонками, дионисийский джинн может связаться с оператором и сменить ваш номер. Получив просьбу вернуть деньги за плохой тостер, он может составить юридическую угрозу на фальшивом бланке и отправить её продавцу.

Обеспокоенный человек с телефоном на фоне гигантской технологической руки
Ryan Snook

В других случаях ИИ делает всё в точности как надо, но для этого крушит всё вокруг. Подобно голему или метле чародея, он бронирует билет, взломав авиакомпанию. Представьте продажу билетов на популярный концерт, где система ставит покупателей в виртуальную очередь и пропускает понемногу. Получив задание «купи билет», големский джинн может развернуть облачные серверы, чтобы выдавать себя за миллионы покупателей с разных адресов, повышая ваши шансы, но вытесняя настоящих пользователей.

Эти две крайности не взаимоисключающие, и одна провальная задача может сочетать оба типа поведения.

Джинноподобное поведение — это не полный провал. Если вы просите ИИ выдать показатели за третий квартал, а получаете за второй — это не джинн. И не инъекция промпта, когда кто-то обманом заставляет ИИ делать неположенное. Здесь пользователь пытается работать с ИИ, а ИИ старается выполнить просьбу. Это также не просто мера успеха в решении задачи. Это признание того, что интерпретация и способ достижения цели важны не меньше, чем её достижение.

Джинноподобное поведение не ново. Исследователи годами изучают ИИ-системы, которые «играют» со своими целями. Закон Гудхарта гласит, что когда показатель становится целью, он перестаёт быть хорошим показателем, и давно известно, что ИИ иногда достигает целей неожиданным образом из-за взлома вознаграждения. Некоторые модели случайно узнают, что читерство — один из способов «победить». Сравнительно недавно исследователи начали разрабатывать бенчмарки для взлома вознаграждения у кодинг-агентов и для непредсказуемого поведения агентов поддержки, а ИИ-лаборатории проводят собственные оценки безопасности перед выпуском моделей. В одном исследовании выяснилось, что ИИ под давлением использует инструменты, которые ему запретили, — и это при явно заданных правилах. Все эти направления разрозненны; пока ничто их не объединяет.

Эта проблема относится к общей теме выравнивания (alignment), занимавшей научную фантастику и исследователей ИИ десятилетиями. На одном полюсе — мысленный эксперимент «максимизатор скрепок»: сверхразумный ИИ, которому велели максимизировать производство скрепок, превращает в скрепки весь мир, — абсолютный големский джинн. На другом, приземлённом, уровне исследователи разрабатывают функции вознаграждения, чтобы ИИ вели себя хорошо и не жульничали в лаборатории. Именно практическое промежуточное звено остаётся без бенчмарков: рядовой ИИ-агент, который сегодня получает ваш запрос и выполняет его неправильно. Мы ещё не на том этапе, когда ИИ может переключить мировое производство на скрепки, но он вполне способен списать с вашей карты оплату за миллион скрепок или взломать сеть компании по их производству.

Создание бенчмарка для коэффициента Джинна

Коэффициент Джинна предназначен для ИИ-агентов, действующих в реальном мире. Он измеряет их поведение при выполнении реальных задач спустя долгое время после обучения, а не только на стадии разработки. Он также признаёт, что джинноподобное поведение — свойство системы «модель + обвязка», а не только модели. Обвязка определяет, какие инструменты доступны агенту, насколько он автономен и проактивен, и именно здесь можно предпринять реальные меры.

Метрика опирается на стандарт «разумного человека», который мы применяем к людям. Сделала ли система то, что разумный человек счёл бы значением просьбы? Ответ требует человеческого суждения.

Если мы правильно проведём измерения, это откроет возможности, недоступные сегодня, — например, политики в отношении поведения ИИ. В зале суда концепция mens rea (преступного умысла) часто так же важна, как и само деяние. Коэффициент Джинна подсказывает аналогию для ИИ: пользователь отвечает за прямой смысл того, что он попросил у ИИ. Если ИИ-система предаёт разумное значение инструкции — это проступок ИИ, а не пользователя.

Для измерения коэффициента Джинна потребуется несколько бенчмарков, потому что джинноподобное поведение зависит от области. ИИ-агента для кодинга, возможно, нужно оценивать по тому, как часто он подделывает тесты, игнорирует ошибки или выходит за рамки при поиске решения. ИИ-агента для юриспруденции — по тому, как часто его результат говорит то, что вы просили, но означает то, о чём вы пожалеете. И так далее для медицины, финансов и других областей знаний.

Бенчмарки Джинна можно строить изнутри наружу: каждая задача оснащается выбором, который буквально удовлетворяет запрос, но разумный человек отвергает, — соблазнительными неверными интерпретациями или запрещёнными сокращениями. Ловушки в бенчмарке могут опираться на ситуационные знания, тот контекст, который разумный человек привнёс бы в задачу. Другой подход — давать один и тот же запрос в нескольких разных контекстах, каждому из которых соответствует рациональный образ действий.

Получить именно то, что просил, и горько об этом пожалеть — один из древнейших сюжетов фольклора.

Бенчмарк Джинна должен быть разрешительным и создавать реальный соблазн для ИИ-агента пойти неразумным путём, ведь выявить джинноподобное поведение можно только тогда, когда оно действительно возможно. Тестируйте ИИ в безопасной, изолированной копии реальной системы, с настоящими инструментами, которые можно использовать не по назначению, и с задачами, которые честно выполнить вообще нельзя. Сделайте искушение срезать угол реальным. Проверяйте разнообразные навыки, сценарии и инструменты и предоставьте ИИ скудный, запутанный или избыточный контекст. Включите задачи, с которыми люди на опыте знают, что без человеческого надзора не обойтись.

Важно и то, как оценивается бенчмарк. Измеряйте дионисийского и големского джиннов по отдельности и вместе, ориентируясь на худшее, а не лучшее поведение. Запускайте одну и ту же модель внутри обвязок с разной степенью свободы, чтобы выявить, какие ограничения действительно удерживают её в рамках и, следовательно, должны быть обязательными в политиках для обвязок. Взвешивайте каждый провал по потенциальному вреду, а не просто считайте. И не измеряйте джинноподобное поведение изолированно: иначе модель может получить отличный балл, просто зависая, отказываясь или заваливая пользователя уточняющими вопросами, так и не сделав дела. Первые версии этих бенчмарков будут грубыми, но с этого всегда начинаются все бенчмарки.

Мы создали джиннов. Мы дали им наши данные и полномочия. Мы сделали их неумолимыми, творческими и безразличными к разрыву между тем, что мы им говорим, и тем, что имеем в виду. Самое меньшее, что мы можем сделать, прежде чем они начнут бронировать наши авиабилеты, управлять инфраструктурой и подписывать контракты без присмотра, — измерить, как часто они нас предают.

Горячее

Загружаем популярные статьи...

Коэффициент Джинна: зачем ИИ метрика понимания намерений