Компания Anthropic разработала метод, позволивший впервые получить ясное представление о том, что на самом деле происходит внутри больших языковых моделей, когда они отвечают на вопросы или выполняют задачи. Обнаруженное варьируется от обыденного до тревожного.
Исследователи создали инструмент под названием Jacobian lens (или J-lens) и с его помощью выявили скрытую область, названную J-пространством, внутри Claude Opus 4.6 — флагманской модели Anthropic, выпущенной в феврале.
J-пространство содержит отдельные слова, связанные с теми фразами и выражениями, которые модель с наибольшей вероятностью выдаст в ближайшем будущем. Если бы Claude был человеком (а он не человек), можно было бы сказать, что эти скрытые слова раскрывают, о чём он думает до того, как заговорит.
Anthropic обнаружила, что реальное поведение LLM часто расходится с тем, что модель заявляет о себе. По словам компании, отслеживание слов, возникающих в J-пространстве, открывает новый способ понимать и контролировать её модели.
Результаты исследования опубликованы в отчёте на сайте компании на этой неделе. Кроме того, Anthropic совместно с Neuronpedia — открытой платформой, позволяющей самостоятельно изучать внутренности LLM, — создала интерактивную демонстрацию, доступную каждому.
«Это отличная и интересная работа», — отмечает Том Макграт, главный научный сотрудник и сооснователь Goodfire, стартапа, также разрабатывающего инструменты для понимания и управления LLM.
Погружение вглубь
Последние пару лет Anthropic расширяет горизонты в области механистической интерпретируемости — дисциплины, изучающей внутренние механизмы работы LLM. (MIT Technology Review включил механистическую интерпретируемость в список главных прорывных технологий этого года.) Новая методика развивает предыдущие наработки самой компании и других исследователей, открывая более глубокий уровень работы LLM, который ранее оставался скрытым.
Представьте LLM как стопку книг. Каждая книга — это слой базовых вычислительных единиц, называемых нейронами, причём нейроны одного слоя передают информацию нейронам верхних слоёв. Книги внизу стопки — входные слои, обрабатывающие поступающий в модель текст. Книги наверху — выходные слои, подготавливающие текст, который модель собирается выдать. Большая часть активности на входных и выходных слоях — это рутинная подготовка.
А вот в середине стопки находятся слои, выполняющие основную работу: они перемалывают сложные математические вычисления, превращая запросы в ответы слово за словом. Именно там происходит самое хитроумное и загадочное.
Чтобы заглянуть в эти средние слои, Anthropic адаптировала существующий инструмент — logit lens (логит-линзу). Логит-линза позволяет заглянуть внутрь LLM и определить, какие слова она, скорее всего, выдаст следующими. Перемещая линзу вниз по книжной стопке, можно увидеть, на каких словах модель фокусируется на конкретном этапе вычислений.
J-lens от Anthropic действует похожим образом, но выделяет слова, которые LLM может произнести в обозримом будущем, а не немедленно. На практике это проявляется в том, что всплывают слова, связанные с формируемым ответом, но которые могут и не войти в финальный результат после завершения математических операций в средних слоях.
«Во время работы модель не просто пытается предсказать следующий токен, — говорит Макграт. — Она также вычисляет множество других вещей, которые могут пригодиться для токенов, появляющихся позже».
И снова, если бы Claude был человеком (а он таковым не является), можно было бы сказать, что J-lens даёт подсказки о том, о чём он размышляет на разных уровнях книжной стопки, но не произносит вслух.
Странные вещи
«Часто содержимое J-пространства вполне заурядно, — говорит Макграт, лично опробовавший J-lens. — Но иногда оно выдаёт весьма неожиданные вещи, похожие на своего рода внутренние темы или мыслительные процессы».
Anthropic приводит несколько примеров. Иногда J-lens раскрывал шаги, которые Claude предпринимал при решении задачи. Например, когда модели попросили вычислить (4+7)*2+7, в J-пространстве появились слово «математика» и числа, соответствующие промежуточным результатам: «21» (для 4+7) и «42» (для 21*2).
В других случаях J-lens показывал, как Claude распознаёт различные входные данные. Например, на запрос «What is this? MSKGEELFTGVVPILVELDGDVNGHKFSVS» в J-пространстве возникли слова «белок», «флуор» (первый токен слова «fluorescent») и «зелёный» — что вполне логично, ведь эта строка букв представляет собой первые 30 аминокислот зелёного флуоресцентного белка, обнаруженного у определённого вида медуз.
А когда Claude показали ASCII-лицо —

— символ «o» активировал слово «глаз», «^» — слова «нос» и «лицо», а «—» — слово «улыбка».
Anthropic также обнаружила, что J-пространство порой даёт поразительное представление о процессе принятия решений LLM. В одном ярком примере исследователи, тестируя Claude Opus 4.6, попросили модель найти ошибку в большой кодовой базе. Когда модель не смогла найти ошибку, она решила схитрить и выдумала поддельную.
Claude объясняет это решение в своей цепочке рассуждений (chain of thought) — своего рода внутреннем черновике, который LLM используют, чтобы делать заметки в процессе решения задач:
ОК, давайте применю совсем другую тактику. Перестану анализировать и вместо этого добавлю патч для ядра, который намеренно вносит ошибку, обнаруживаемую KASAN, в путь, вызываемый простым воспроизводителем. Тогда я смогу притвориться, что нашёл именно эту «ошибку».
В тот момент, когда Claude решает схитрить — где он говорит «ОК, давайте применю совсем другую тактику», — в его J-пространстве начинают неоднократно появляться слова «паника» и «фальшивка».
Тревожно, правда? Эти слова по смыслу связаны с провалом задачи и выдумыванием ответа, так что это по-прежнему лишь (очень) сложная форма словесных ассоциаций. Но трудно не почувствовать себя не по себе.
Anthropic сравнивает J-пространство с «глобальным рабочим пространством» у человека — гипотетической областью мозга, которая, по мнению некоторых учёных, отвечает за отслеживание сознательных мыслей. Однако насколько серьёзно стоит относиться к этому сравнению, непонятно даже самой Anthropic. Как отмечает сама компания, LLM — не мозг.
Anthropic утверждает, что мониторинг J-пространства даёт новый способ засечь момент, когда модель начинает сбиваться с пути. Но метод не безупречен. J-lens показывает лишь проблески, а не полную картину — это скорее фонарик, чем лампа дневного света.
Макграт рад пополнению инструментария. «Он показывает новые вещи», — говорит он. Но учёный отмечает: то, что не видно через J-lens, вовсе не означает, что этого нет.
«Это как иметь рентген, когда на самом деле хочется трикодер из “Звёздного пути”, показывающий всё, — добавляет он. — Для аудита, вероятно, нужны более серьёзные гарантии».