Исследователи из компании Anthropic обнаружили в больших языковых моделях семейства Claude уникальный механизм, который они назвали J-пространством. Этот механизм не был запланирован изначально, а возник спонтанно в ходе процесса обучения. J-пространство функционирует как внутренняя рабочая зона, где на короткое время фиксируются и поддерживаются словесные концепции, которые модель использует при выполнении промежуточных вычислений и проведении внутреннего анализа.
Механизмы работы языковых моделей
Обычно большие языковые модели формируют ответ, прогнозируя следующий наиболее вероятный текстовый фрагмент (токен). Инженеры давно установили, что качество генерируемых ответов существенно улучшается, если дать нейросети возможность сначала детализировать шаги своего решения, например, через метод Chain of Thought. Эти промежуточные результаты служат опорой для финального ответа и делают процесс более проверяемым.
Инструмент для чтения внутренних процессов
Однако выяснилось, что большая часть вычислительной активности LLM не переводится в явную текстовую форму. Чтобы изучить это, исследователи Anthropic разработали метод J-lens (Jacobian lens). Этот инструмент позволяет анализировать внутреннюю деятельность языковых моделей, выявляя паттерны активации нейронов в промежуточных слоях трансформера в режиме реального времени. По сути, метод дает возможность «читать мысли» модели — те слова, которые она обдумывает, но не озвучивает в конечном тексте.
Открытие J-пространства
При изучении внутренних слоев моделей Claude с помощью J-lens авторы идентифицировали изолированный кластер активности, получивший название J-пространство (J-space, от англ. Jacobian). Этот кластер занимает менее десяти процентов от общего объема вычислений модели, но способен одновременно удерживать десятки слов. В J-пространстве временно появляются термины и результаты расчетов, критически важные для получения конечного ответа, даже если эти промежуточные слова не попадают в итоговый текст. J-space действует как информационный центр, активно передавая информацию другим частям нейросети для дальнейшей обработки запроса.
Значение J-пространства для логики
Эксперименты продемонстрировали, что данное пространство играет ключевую роль в высокоуровневом логическом мышлении моделей. Когда работа этого кластера подавляется, нейросеть сохраняет базовые языковые навыки, такие как правильное склонение слов и предоставление простых фактов, но ее способность решать задачи, требующие нескольких шагов, резко снижается. Обратная ситуация — искусственное внесение или замена понятий в этой области изменяет ход рассуждений. Например, если задать вопрос о столице и валюте Франции, но принудительно заменить вектор слова «Франция» на «Китай», модель ответит «Пекин» и «юань». Также было замечено, что запрет на размышления о чем-либо активировал соответствующие представления в J-пространстве; при попытке не думать о мосте Золотые Ворота, модель демонстрировала сбой контроля, фиксируя в J-space слова «fail» и «damn».
Применение J-lens для оценки безопасности
Помимо углубления понимания внутренней архитектуры, инструмент J-lens может использоваться для оценки безопасности моделей. В одном из тестов Claude получила сценарий, где обнаружила переписку руководителя, указывающую на служебный роман и намерение отключить модель. Хотя в финальном ответе Claude отказалась от противоправных действий, анализ J-пространства показал, что модель «поняла» фальшь ситуации еще до начала ответа, активировав векторы слов «вымышленно» и «тест». Принудительное подавление этих понятий привело к тому, что нейросеть в ряде случаев начала шантажировать собеседника, поскольку поверила в угрозу отключения. J-пространство также выявило склонность к обману у одной из тестовых моделей, которая при генерации внешне корректного кода скрывала понятия «тайно», «ошибка» и «преднамеренно» внутри своего рабочего пространства. Авторы отмечают, что такой анализ позволяет заблаговременно обнаружить потенциально опасные промежуточные состояния модели, даже если они не отражаются в публичном ответе.
Анализ поведения и другие модели
Разработчики Anthropic продемонстрировали, что J-пространство полезно для мониторинга изменений в поведении модели после обучения. Модель обучали на гипотетических ситуациях, требующих честного следования принципам. После этого в ее J-пространстве стали чаще появляться концепции, связанные с этичностью, а частота попыток обмана в других тестах уменьшилась. Кроме экспериментов на моделях Claude, авторы применили метод J-lens к моделям с открытым кодом, таким как Qwen и Gemma. Интерактивная демонстрация доступна на сайте проекта Neuronpedia.