Предупреждение Сатьи Наделлы: двойная плата за искусственный интеллект
Среди многочисленных споров о потенциальных угрозах ИИ одна проблема вызывает особое беспокойство в Кремниевой долине. Опасение заключается в том, что гигантские ИИ-лаборатории, продающие проприетарные модели, ведут себя как троянские кони.
Стартапы и корпорации, используя модели от OpenAI, Anthropic и других, предоставляют разработчикам всё больший доступ к своей самой чувствительной деловой информации. Создатели моделей могут затем использовать эти знания в собственных интересах, потенциально превращаясь в конкурентов своих же клиентов. С такими предупреждениями выступали венчурный инвестор Джейсон Калаканис и глава Palantir Алекс Карп.
Теперь к ним присоединился и CEO Microsoft Сатья Наделла — в своём неожиданном посте в блоге в понедельник он заявил, что пользователи ИИ (или «покупатели», как он их называет) платят дважды. Они осознанно тратят деньги на использование токенов, но попутно, сами того не замечая, отдают ценнейшие данные.
«Вы, по сути, платите за интеллект дважды — один раз деньгами и второй раз чем-то гораздо более ценным: уникальными знаниями, которые вы должны раскрыть, чтобы сделать этот интеллект полезным. Чем лучшей производительности вы хотите от модели, тем больше этих знаний ей приходится скармливать!» — пишет Наделла.
Самое опасное, по его мнению, в том, что предприятия буквально обучают модели тонкостям своего бизнеса.
«Модели учатся на "выхлопе" — промтах, которые пишут люди, инструментах, используемых агентами, и особенно на исправлениях, которые вносятся, когда модель ошибается. Каждое исправление дистиллируется в институциональное ноу-хау», — объясняет он.
Это «знания, которые конкурент никогда не смог бы купить», и тем не менее компании добровольно их отдают.
Дистилляция и двойные стандарты ИИ-лабораторий
Наделла утверждает: если ИИ-компании могут свободно собирать данные из интернета для обучения своих моделей, то справедливо, чтобы и предприятия могли изучать — или «дистиллировать» — эти модели в ответ. Дистилляция — это практика использования выходных данных модели для понимания принципов её работы и создания на основе этих знаний новой, зачастую более дешёвой модели. В феврале Anthropic обвинила китайские open-source лаборатории в том, что те отправляли миллионы промтов модели Claude, чтобы улучшить собственные разработки, и призвала правительство США ужесточить экспортный контроль.
По мнению Наделлы, разработчики моделей не могут усидеть на двух стульях. Лицемерно свободно обучаться на мировых данных, одновременно запрещая другим делать то же самое с их моделями.
«При всей важности инноваций, которые даёт добросовестное использование публичных данных для обучения моделей, иронично, что затем на дистилляцию накладываются ограничительные условия», — пишет глава Microsoft.
Особое беспокойство у Наделлы вызывает ситуация, когда создатели моделей «оставляют за собой право учиться на данных об использовании и взаимодействии клиентов».
Как компаниям защитить свои данные: рецепт от Microsoft
Решение, которое предлагает Наделла, закономерно напоминает подход руководителя крупного облачного провайдера. Он призывает компании «сохранять право собственности» на свои данные, включая промты, обратную связь и прочее. Для этого он рекомендует строить собственные «проприетарные среды обучения» в облаке (где данные, скорее всего, и так уже хранятся — и, что удобно, речь может идти об облаке Microsoft Azure). Кроме того, Наделла советует внедрять так называемые «оркестрационные слои» — по сути, механизмы, позволяющие легко переключаться между ИИ-моделями разных поставщиков, а не привязываться к одному. Инструменты вроде AI-шлюзов, которые как раз и решают эту задачу, становятся всё популярнее.
Хотя Наделла ни разу не произносит слов «open source» как способа сохранения права собственности, этот подтекст очевиден. Впрочем, есть и другой подтекст.
Open Source и локальное развёртывание — набирающий силу тренд
Крупные компании, многие из которых помимо облака сохраняют собственные дата-центры, уже переходят на open-source модели, устанавливаемые на собственных мощностях (на жаргоне индустрии — «on-prem»). Идит Левайн, основатель и CEO компании Solo.io, которая разрабатывает сетевое ПО и средства безопасности для управления ИИ-системами, замечает именно такой сдвиг у своих клиентов. Поэкспериментировав с проприетарными моделями, они начинают задаваться вопросом: «Можем ли мы взять open-source модель и запустить её на своих серверах? Она будет выполнять почти 90% того, что делает большая модель, и стоить значительно дешевле», — рассказала Левайн порталу TechCrunch. — «Они понимают это и могут всё контролировать».
Технология Solo.io была выбрана в прошлом году в качестве основы для проекта Linux Foundation Agentgateway. Среди клиентов компании — T-Mobile, ADP и SAP. Левайн видит растущий интерес к установке open-source моделей на собственной инфраструктуре и считает это следующей большой волной в корпоративном использовании ИИ.
Она не одинока в своих наблюдениях. Vercel, известная как платформа для создания и хостинга веб-сайтов и недавно добавившая инструменты переключения между ИИ-моделями, и OpenRouter, компания, помогающая разработчикам маршрутизировать запросы к разным ИИ-моделям, — обе фиксируют всплеск трафика к open-source моделям. Более того, в прошлом месяце на открытые модели пришлось 29% всего трафика, прошедшего через шлюз Vercel.
Когда глава Microsoft, компании, инвестировавшей и в OpenAI, и в Anthropic, открыто призывает предприятия с осторожностью относиться к проприетарным моделям, можно ожидать, что этот тренд продолжит набирать обороты. «Потребляя интеллект, вы создаёте интеллект. И то, что вы создаёте, должно принадлежать вам», — заключает Наделла.