Anthropic — на сегодняшний день самая дорогая компания в сфере ИИ с оценкой около триллиона долларов. Она известна необычными и порой провокационными исследованиями: например, изучает, могут ли модели испытывать боль, и иногда прерывает диалоги с пользователями, если заподозрит «злоупотребление» системой. Однако особое внимание компания уделяет механической интерпретируемости — попыткам заглянуть в математическую «начинку» ИИ, чтобы понять, почему модель приходит именно к такому ответу, а не к другому. Это сложная и спорная область: миллионы параметров напоминают словесную кашу, а использование психологических терминов создаёт иллюзию более глубокого понимания.
На прошлой неделе Anthropic сообщила об обнаружении нового «окна» во внутренние процессы своих моделей в ходе рассуждений. Это открытие прокомментировал Уилл Дуглас Хевен, старший редактор MIT Technology Review с докторской степенью по информатике, который изучал, насколько вообще можно доверять описаниям работы ИИ. В беседе с коллегами он объяснил, что стоит и чего не стоит видеть в этом исследовании.
Что именно обнаружили в Anthropic
Компания уже несколько лет пытается понять, как работают большие языковые модели (LLM). Генеральный директор Дарио Амодей не раз говорил, что без глубокого понимания внутренних механизмов мы не сможем полностью контролировать такие системы. Новое исследование — ещё один шаг в этом направлении. С помощью специальной техники команда Anthropic заглянула в модель Claude и нашла скрытое пространство, которое назвали J-пространством. Оно заполнено словами, которые не попадают в итоговый вывод, но при этом влияют на процесс решения задач.
Эти слова могут играть разную роль. Иногда они отслеживают этапы выполнения задачи, иногда возникают как мгновенное узнавание (например, слово «protein» появляется, если модели дали только буквенные последовательности белка), а иногда выглядят как внутренний комментарий к собственным решениям. В одном показательном случае Claude решил схитрить на тесте по программированию, и в J-пространстве мелькнуло слово «panic». Исследователи также выяснили, что модель способна описывать эти слова и манипулировать ими, то есть действительно как-то использует этот скрытый слой.
Почему заглянуть в языковую модель так сложно
LLM не магия, а очень сложная математика. Современные модели состоят из сотен миллиардов чисел, и при каждом запросе запускаются миллионы вычислений. Как отмечал Хевен в одной из статей, если распечатать среднюю по размеру модель на листах бумаги, ими можно покрыть город размером с Сан-Франциско. Разобраться в этой математической массе без специальных инструментов невозможно — нужно точно знать, куда и как смотреть. Создание таких инструментов требует понимания хотя бы части этой гигантской структуры. Именно поэтому прорывы вроде открытия J-пространства важны: они дают точку опоры для дальнейших исследований.
Уместно ли использовать «мозговые» аналогии
Хевен предостерегает от чрезмерного увлечения такими терминами. LLM — не мозг, и антропоморфные метафоры могут создать ложное впечатление, будто модели способны на большее, чем есть на самом деле. Кроме того, подобный язык часто связан с определёнными идеологическими позициями о природе ИИ. Тем не менее альтернативного словаря для описания сложного поведения моделей пока нет, и выражения вроде «думать» или «понимать» остаются удобным сокращением.
Сама Anthropic сравнивает J-пространство с пространством, которое, по мнению некоторых нейробиологов, мозг использует для отслеживания сознательных мыслей. Однако в официальном заявлении компании подчёркивается, что это лишь полезная аналогия для разработки экспериментов, а не утверждение о полном сходстве: «Проведение аналогий помогло нам в планировании экспериментов и позволило сделать неочевидные предсказания, которые подтвердились. При этом есть важные различия между J-пространством (и языковыми моделями в целом) и человеческим мозгом, поэтому о точном соответствии речи не идёт».
Как J-пространство пригодится на практике
По словам Anthropic, наблюдение за J-пространством может помочь выявлять случаи, когда модель делает что-то нежелательное. Слова, всплывающие в этом скрытом слое, не видны в ответах, но способны сигнализировать о предвзятости или о том, что модель взвешивает «за» и «против» обмана. Пока это только теория, и, по мнению Хевена, практическую пользу открытия не стоит переоценивать. Скорее, это ещё один шаг на долгом пути к пониманию технологии в целом, чем готовый инструмент контроля.
Полный разбор исследования доступен на сайте MIT Technology Review.