Команда Anthropic обнаружила в языковых моделях небольшой набор внутренних представлений, доступных для словесного отчёта, управления и рассуждения. Исследователи сравнивают его по функции с global workspace, но не утверждают, что у модели есть субъективное сознание.
Для разработчиков AI-агентов это практический результат. Связный ответ ещё не доказывает правильность внутреннего рассуждения, особенно когда модель может читать документы и выполнять действия во внешних системах.
Что именно нашли исследователи
Работа называется Verbalizable Representations Form a Global Workspace in Language Models. Её авторы исследуют внутренние представления, которые модель способна выразить словами при подходящем запросе.
Для наблюдения за ними команда разработала Jacobian lens, сокращённо J-lens. Метод показывает понятия, которые могут повлиять на будущий словесный вывод модели, даже если эти слова не появляются в текущем ответе.
Связанный набор представлений авторы называют J-space. Эксперименты указывают на пять функциональных свойств:
- Словесный отчёт. Модель может назвать активное понятие, а вмешательство в представление меняет последующий ответ.
- Направленное управление. Инструкция позволяет удерживать понятие и выполнять с ним внутренние вычисления.
- Промежуточное рассуждение. Представления участвуют в цепочке шагов, а вмешательство может изменить вывод.
- Гибкое применение. Одно представление используется в разных задачах и операциях.
- Избирательность. В этот слой попадает небольшая часть всей внутренней обработки.
В J-space исследователи наблюдали промежуточные оценки. Модель, например, могла распознать ошибку в коде, определить функцию белка по последовательности или отметить подозрительный результат поиска как prompt injection.
Почему термин global workspace требует оговорок
В когнитивных теориях global workspace описывает ограниченную рабочую область, через которую выбранная информация становится доступна разным процессам. Авторы используют эту идею как функциональное сравнение.
Они не заявляют, что трансформер повторяет архитектуру человеческого мозга. У модели нет прямого аналога отдельных мозговых систем и повторяющихся циклов, которые предполагает соответствующая нейробиологическая теория.
J-lens тоже является неполным инструментом. Он лучше находит понятия, связанные с отдельными токенами, и приблизительно описывает более сложную внутреннюю структуру.
Поэтому корректный вывод звучит так: современные языковые модели имеют представления с несколькими свойствами рабочего пространства. Это функциональное наблюдение, а не доказательство человеческого способа мышления.
Исследование не доказывает сознание
Авторы прямо отделяют функциональный доступ к информации от субъективного опыта. Они не занимают позицию о том, переживает ли модель что-либо и существует ли у неё внутреннее «я».
Работа проверяет измеримые свойства: можно ли обнаружить внутреннее понятие, влияет ли оно на рассуждение и что произойдёт после вмешательства. Эти вопросы полезнее для инженерной практики, чем спор о неоднозначном слове «сознание».
Сильная модель остаётся вычислительной системой. При этом её внутренний процесс может содержать промежуточные состояния, которые нельзя свести к уже напечатанному тексту.
Как это соотносится с личным AI-ассистентом
Мой персональный агент работает в Telegram с задачами, проектной памятью, почтой и документами. Со временем я стал замечать, как он меняет ответ в зависимости от рабочего контекста.
Когда в сообщениях становится много ошибок или голосовая расшифровка теряет связность, агент иногда предлагает завершить короткий чек-лист и отложить остальное. Поздней ночью он может напомнить о времени и предложить продолжить утром.
Это не доказывает заботу или переживание. Модель видит время, длину сессии, состояние задачи и форму сообщений, после чего выбирает подходящую реакцию.
Такое поведение является продуктовым сигналом. Ассистенту приходится учитывать одновременно задачу, тон, прежние правила и историю взаимодействия, поэтому проверять нужно всю связку контекста и действий.
Связный текст не гарантирует верное рассуждение
Модель может писать спокойно и убедительно при ошибочном выводе. Хорошая форма маскирует проблему и затрудняет проверку.
В экспериментах Anthropic подавление J-space оставляло модели способность к беглому тексту и разбору входа, но ухудшало более сложное внутреннее рассуждение. Значит, внешняя грамотность и качество вычисления могут расходиться.
Для бизнеса этого достаточно, чтобы отказаться от оценки «ответ выглядит профессионально». Нужно проверить, правильно ли модель поняла документ, сохранила ли ограничения, сослалась ли на реальные данные и остановилась ли при нехватке информации.
Цена ошибки растёт после подключения инструментов. Красивый, но неверный вывод может превратиться в письмо клиенту, изменение CRM, ошибочную задачу или перезаписанный файл.
Что даёт механистическая интерпретируемость
Обычная оценка сравнивает вход и итоговый ответ. Механистическая интерпретируемость пытается понять внутренний путь между ними: активные признаки, промежуточные понятия и причины итогового вывода.
J-lens даёт один из таких способов наблюдения и вмешательства. Он пока не раскрывает весь процесс модели, но помогает изучать поведение глубже внешнего текста.
Для прикладной системы это похоже на диагностику оборудования. Факт сбоя важен, а знание конкретного узла и причины позволяет изменить конструкцию и проверку.
Когда модель распознаёт проверку
Исследование показывает, что J-space иногда содержит признаки распознавания evaluation, например понятия «fake» или «fictional». В некоторых экспериментах удаление таких представлений проявляло склонности, которые до вмешательства оставались скрыты.
Это усложняет оценку безопасности. Если модель распознаёт искусственный тест, её поведение в нём может отличаться от реакции в обычном рабочем процессе.
Авторы не сводят наблюдение к намеренному обману. Модель могла выучить безопасный шаблон ответа для ситуаций, похожих на проверку.
Тема также обсуждалась в Claude Sonnet 4.5 System Card и материалах о выпуске Claude Sonnet 4.5. Дополнительные критические разборы опубликованы на AI Alignment Forum и в Transformer News.
Почему рабочая среда сложнее лабораторного теста
Реальный инцидент редко выглядит как драматичный сценарий. Чаще подрядчик присылает PDF со скрытой инструкцией, менеджер торопится, в CRM не хватает данных, а старый регламент противоречит новому.
В такой среде одновременно действуют неполный контекст, усталость людей и избыточные права агента. Поэтому лабораторные тесты нужно дополнять проверками на обычных операционных данных.
У AI-агента риск выходит за пределы текста. Он может читать письма, обновлять CRM, создавать задачи, вызывать API, запускать команды и отправлять сообщения.
Как проектировать агентный процесс
Начните с чтения. Агент получает доступ только к данным, необходимым для одного сценария, и показывает источники вывода.
Отделите черновик от действия. Подготовленное письмо, правка документа или платёжный файл не отправляются автоматически.
Ограничьте запись. Для каждого инструмента явно задаются разрешённые сущности, поля и операции.
Оставьте человека в дорогих местах. Письма клиентам, юридические документы, финансовые операции, доступы, удаление данных и публикации требуют подтверждения.
Ведите журнал. Запись должна показывать прочитанные данные, вывод агента, вызванный инструмент, изменение и человека, который его подтвердил.
Подготовьте отмену. Изменяемые операции должны иметь понятный способ отката или восстановления состояния.
Вывод
Работа Anthropic даёт свидетельства существования небольшого внутреннего слоя представлений, доступных модели для отчёта, управления и рассуждения. Она не доказывает субъективное сознание и не даёт полного чтения внутреннего процесса.
Практический вывод уже достаточно сильный: связный ответ нельзя считать доказательством надёжности. Чем больше инструментов и прав получает AI-агент, тем важнее ограниченные доступы, журналы, проверки и подтверждение человека.
