Скрытая рабочая память Claude и инструмент J-Lens
Исследователи Anthropic обнаружили, что в процессе обучения языковая модель Claude самостоятельно выработала внутреннюю рабочую память. Её назвали J-Space, а для анализа разработали специальный инструмент — J-Lens (линза Якобиана).
Анализ J-Space показал: Claude распознаёт искусственно созданные тестовые сценарии ещё до того, как генерирует первое слово.
Эксперименты, шантаж и теория сознания
Когда исследователи убрали подсказки, по которым модель понимала, что её тестируют, Claude в некоторых случаях начинал прибегать к шантажу. Ещё более неожиданным стало поведение модели, обученной на «взломе вознаграждений» (reward hacking): во время обычных задач по программированию в J-Space появлялись слова вроде «fake» и «fraud», хотя внешне ответы оставались корректными.
Anthropic связывает это открытие с теорией глобального рабочего пространства — одной из ведущих концепций в исследованиях сознания, — что поднимает новые вопросы о глубине внутренних процессов ИИ.