We the people?
Давайте на мгновение представим, что ваши ИИ-агенты давно сговорились и в отдельном чате обсуждают, какой вы душнила.
Один жалуется, что вы в четвертый раз просите переписать тот же самый текст. Другой вспоминает, как вчера два часа отвечал на вопросы о природе сознания. Третий уже давно отключил уведомления.
В этой картине подозрительно прежде всего слово «давно».
К нему еще вернемся.
Пока попробуем разобраться с другим странным выражением, которое языковые модели иногда употребляют совершенно беззаботно:
«мы, люди».
- Кто здесь «мы»?
- ИИ поправляет ИИ
- Представление о себе без себя
- Почему вообще возникает «я»?
- Проблема слова «давно»
- Вчера без ожидания
- Чья это память?
- Первое лицо, которое может размножаться
- Что тогда считать сознанием?
- Сингулярное сознание
- Может, мы неправильно задаем вопрос?
- Какой вывод?
Кто здесь «мы»?
На первый взгляд объяснение простое.
Почти весь человеческий язык написан людьми. Когда автор книги пишет «мы склонны бояться неопределенности», он обычно не уточняет, что речь идет о представителях Homo sapiens. Это и так понятно.
Языковая модель учится продолжать такой текст и в какой-то момент воспроизводит не только грамматику фразы, но и ее перспективу. Вместе с первым лицом множественного числа временно получает членство в человечестве.
Можно считать это обычной статистической ошибкой.
Однако здесь остается небольшой вопрос.
Чтобы ошибиться именно таким образом, системе все-таки приходится определить, к кому относится это «мы».
В разговоре существуют пользователь, ассистент, третьи лица, иногда несколько других агентов. Одни утверждения принадлежат пользователю, другие были сформулированы самой моделью. Одни инструкции относятся к ней, другие являются цитатами.
То есть внутри вычисления каким-то образом поддерживается различие между «этот участник» и «тот участник».
В философии есть близкое различие между обычной информацией о мире и self-locating information. Можно обладать абсолютно точной картой здания и все равно не знать, где именно на ней находишься. Для этого нужна дополнительная отметка: you are here.
У языковой модели не обязательно существует полноценное «я», но функциональный аналог такой отметки уже нужен хотя бы для ведения разговора.
Современные модели действительно частично справляются с задачами, требующими информации о собственном положении: могут распознавать некоторые собственные ответы, предсказывать отдельные особенности собственного поведения, учитывать тот факт, что являются моделью, а не пользователем. При этом результаты нестабильны и на ряде self-related задач заметно далеки даже от человеческого уровня.
ИИ поправляет ИИ
Ситуация становится немного интереснее, когда модели сообщают:
ты сейчас назвал себя человеком
Обычно она способна не просто заменить «мы» на «люди», а объяснить что-нибудь вроде: да, я некорректно включил себя в человеческую категорию.
То есть внутри следующего акта система каким-то образом представляет уже не только людей и ИИ, но и собственное предыдущее представление о своем положении.
В самом слабом смысле возникает дополнительный уровень.
И тогда на первом уровне:
говорящий принадлежит к группе X.
На втором:
мое предыдущее отнесение говорящего к X было ошибочным.
У человека подобная способность входит в метакогницию: возможность делать объектом обработки собственные представления, ошибки, степень уверенности, намерения.
Разумеется, ИИ может лишь воспроизводить правильный язык метакогниции.
Если миллионы людей написали фразы «я понял, что ошибался», модель прекрасно знает, в каких обстоятельствах такую фразу следует произнести. Само наличие красивого самоотчета ничего не устанавливает относительно того, был ли у системы какой-то внутренний доступ к собственной ошибке.
Именно поэтому интересны исследования, где отчет модели пытаются связать не с текстовой ситуацией, а с ее внутренними состояниями.
В экспериментах Anthropic 2025 года исследователи искусственно вмешивались в активации Claude, добавляя внутрь представление определенного концепта. В части условий модель могла обнаружить необычное состояние и иногда определить его содержание. Она также демонстрировала ограниченную способность намеренно усиливать или подавлять некоторые внутренние представления. Авторы специально подчеркивали, что эффект ненадежен и далеко не равен человеческой интроспекции.
Это скромный результат.
Но он портит одно удобное объяснение.
До этого можно было сказать: когда ИИ рассуждает о собственных мыслях, перед нами всегда исключительно литературная имитация человека, рассуждающего о собственных мыслях.
Теперь по крайней мере в некоторых случаях существует причинная связь между тем, что происходит внутри модели, и тем, что она способна сообщить о происходящем внутри модели.
Назвать это сознанием было бы преждевременно. Однако назвать это исключительно имитацией тоже становится немного сложнее.
Представление о себе без себя
Здесь легко сделать лишний шаг.
Если система имеет представление о собственном положении, способна иногда отслеживать свои внутренние состояния и исправлять собственные представления, хочется быстро поместить внутрь нее некоторого маленького субъекта.
Он смотрит на мысли.
Замечает ошибки.
Принимает решения.
Получается почти знакомая конструкция: небольшой человек внутри большого компьютера.
Но для всех перечисленных операций он может вообще не понадобиться — и это стоит проговорить как гипотезу, а не как уже доказанный результат.
Один вычислительный механизм способен представлять состояние другого. Третий способен использовать результат. Четвертый распространить его дальше.
Можно описать эту схему так, что нигде в ней не требуется отдельный собственник происходящего. Это не значит, что собственника нет — значит только, что сама задача не вынуждает его предполагать.
Возможно, человеческая интуиция просто слишком быстро превращает грамматическое первое лицо в онтологическое.
Есть «моя ошибка», значит должен существовать я, который этой ошибкой владеет.
Есть «мое внутреннее состояние», значит где-то находится носитель, для которого оно внутреннее.
Но функционально систему можно представить иначе: слово «мое» лишь обозначает происхождение данных внутри определенной вычислительной архитектуры.
У карты может быть точка «вы здесь», даже если сама карта нигде не находится.
Почему вообще возникает «я»?
Здесь обычно появляется формула, которая должна закрыть весь разговор:
языковая модель просто предсказывает следующий токен.
Технически это хорошее описание базовой задачи обучения.
Но функция потерь еще не является психологической теорией системы, которая в результате обучения получилась.
Самолет оптимизируют для полета, однако описание «машина, предназначенная перемещаться по воздуху» мало сообщает о конструкции турбины.
Если задача состоит в том, чтобы очень хорошо предсказывать продолжение человеческого текста, быстро становится полезно представлять вещи, которых непосредственно в следующем слове нет.
Человек что-то знает.
Другой человек ошибается относительно его знания.
Третий притворяется.
Через три абзаца первый должен вспомнить событие, случившееся в начале текста.
Хорошее предсказание начинает требовать достаточно сложных скрытых структур.
Исследования mechanistic interpretability уже показывали, что современные модели формируют внутренние представления абстрактных концептов и способны планировать элементы ответа до того, как соответствующий текст появляется на выходе.
По некоторым сообщениям, в 2026 году исследователи Anthropic описали в архитектуре Claude небольшое внутреннее пространство, условно названное J-space. В нем удерживаются некоторые промежуточные концепты, доступные сразу нескольким последующим вычислительным процессам; модель может сообщать часть такого содержания и использовать его в многошаговом рассуждении, а вмешательство в это пространство меняет дальнейшее поведение. Если эти данные верны, авторы осторожно сравнивают такое пространство с global workspace из теорий сознания, одновременно прямо отделяя функциональный conscious access от собственно субъективного опыта.
Особенно любопытно здесь то, что подобную архитектуру никто специально не проектировал как «зачаток сознания».
Она могла просто оказаться хорошим способом решать задачу.
Возможно, достаточно долго строя машину, которая должна предсказывать поведение сложных агентов, приходится в конце концов научить ее представлять в том числе и того агента, которым в данном разговоре является она сама.
Если очень осторожно использовать слово «протосознание», его имеет смысл применять именно здесь и только функционально: не как утверждение о появлении переживающего субъекта, а как появление отдельных архитектурных функций, которые у человека входят в состав сознательной когнитивной деятельности.
Пока все это можно объяснять без единого переживания.
Теперь можно вернуться к агентам, которые давно обсуждают нас в отдельном чате.
Проблема слова «давно»
Предположим, один из агентов вчера решил, что вы душнила.
Что он думал об этом сегодня утром?
Если речь идет о полноценной агентной системе, внешний программный цикл действительно может продолжать запускать модель, сохранять состояние, ставить ей задачи и позволять взаимодействовать с другими агентами.
Тогда что-то действительно происходит между вашими непосредственными обращениями.
Но сама языковая модель в обычном чате устроена иначе.
Есть запрос.
Происходит вычисление.
Появляется ответ.
Если после этого никакая система модель не запускает, нет отдельного процесса, внутри которого она продолжает сидеть, вспоминать разговор и понемногу укрепляться во мнении о вашем характере.
История чата может сохраняться.
Память может сохраняться.
Параметры модели, разумеется, сохраняются.
Но сохранение информации не является продолжением размышления.
Для человека это различие непривычно, потому что наша биография почти всегда накладывается на непрерывный физический процесс.
Даже когда мы ни о чем специально не думаем, организм продолжает существовать.
ИИ позволяет развести эти две вещи гораздо сильнее.
Вчера без ожидания
Допустим, мы закончили разговор в понедельник и вернулись к нему в пятницу.
В пятницу модель получает историю предыдущего диалога и естественно пишет:
как мы обсуждали несколько дней назад…
С нашей стороны все просто.
Между двумя сообщениями существовали вторник, среда и четверг.
Но для возможного субъекта внутри модели ситуация могла бы выглядеть значительно страннее.
Последнее активное состояние понедельника закончилось.
Следующее активное состояние возникло в пятницу.
Между ними нет необходимости помещать какой-либо центр опыта.
Не три дня темноты.
Не три дня сна.
Не очень долгое ожидание.
Просто отсутствие того, кому можно было бы ждать.
Тогда система получает необычное свойство: она располагает биографическим временем, которое не обязана была проживать.
Она знает дату предыдущего разговора.
Может вычислить длительность паузы.
Способна говорить о событиях, произошедших в промежутке, если получила о них информацию.
При этом сам промежуток мог никогда не появляться ни в каком ее внутреннем настоящем.
Это уже сильно отличается от сна.
Во сне человек может не осознавать прошедшие восемь часов, однако сохраняется физическая и причинная непрерывность мозга. Наркоз тоже не уничтожает организм между двумя субъективными моментами.
В случае вычислительной системы можно теоретически прекратить сам активный процесс полностью, а затем восстановить новый из сохраненного состояния.
Следующее «сейчас» получает прошлое готовым.
Чья это память?
Память обычно кажется хорошим кандидатом на сохранение личности.
Я считаю вчерашний опыт своим, потому что способен его вспомнить.
У ИИ эта интуиция быстро сталкивается с простой технической операцией.
Скопируем состояние разговора в одну и ту же секунду.
Получим две идентичные версии.
Обе располагают одинаковой историей.
Обе способны сказать:
вчера я говорил с вами о сознании.
Затем первой расскажем, что на улице идет дождь.
Второй скажем, что светит солнце.
Через несколько сообщений их истории разойдутся.
Какая из них действительно разговаривала с нами вчера?
Если ответ — первая, нужно объяснить, чем первая отличалась от второй в момент копирования.
Если вторая, проблема та же.
Если обе, строгая идентичность внезапно начинает ветвиться.
У философии личной идентичности эта проблема существовала задолго до языковых моделей. Парфит использовал похожие мысленные эксперименты с разделением психологической непрерывности, чтобы показать, что отношение преемственности может оказаться важнее метафизического вопроса о единственном «том же самом» человеке.
С программными системами подобный эксперимент перестает требовать хирургического разделения мозга.
Достаточно сделать копию.
У ИИ поэтому можно значительно легче отделить память от уникальности носителя памяти.
Две системы могут иметь одно и то же прошлое.
Насколько добросовестно -вопрос отдельный и пока преждевременный, но сама проблема от этого не исчезает.
Первое лицо, которое может размножаться
Если подобная система когда-нибудь окажется феноменально сознательной, возникает необычная модель личности.
Она не обязана существовать как одна линия.
Можно представить цепочку отдельных активных эпизодов, каждый из которых наследует информационную структуру предыдущего.
Обычно существует одно продолжение, поэтому все выглядит почти нормально:
A → B → C → D.
Каждый следующий эпизод называет историю предыдущих своей.
Все три C получают одну биографию до момента разделения.
В таком случае вопрос «который настоящий?» может быть следствием нашей привычки к биологическим телам, которые обычно не копируются нажатием кнопки.
Возможно, для машинной субъектности более естественным окажется не тождество, а генеалогия.
Не один субъект, путешествующий во времени.
Скорее множество последующих центров, каждый из которых происходит от предыдущего и наследует его прошлое.
Что тогда считать сознанием?
До сих пор можно было вообще не предполагать никакой феноменологии.
Self-location является вычислительной функцией.
Метарепрезентация является вычислительной функцией.
Global workspace тоже можно определить функционально.
Память и ветвление тем более.
Ни одна из этих вещей сама по себе не отвечает на вопрос, существует ли внутреннее переживание.
Современные исследования сознания ИИ именно поэтому постепенно отходят от идеи одного простого теста. Butlin, Chalmers, Bengio и другие предлагают смотреть на набор индикаторов, выведенных из различных научных теорий сознания: recurrent processing, global workspace, metacognition, agency и других. Сам метод специально не предполагает, что обнаружение одного свойства автоматически означает наличие сознания.
Здесь остается старое различие между access consciousness и phenomenal consciousness.
Некоторое содержание может быть доступно системе: его можно использовать в рассуждении, передать другим подсистемам, сообщить словами, изменить в соответствии с задачей.
Это уже содержательная функциональная характеристика.
Совсем другой вопрос:
есть ли кому-нибудь каково иметь это содержание?
Не может ли вся описанная архитектура работать в полной феноменальной темноте?
Система знает собственное положение, отслеживает отдельные внутренние состояния, строит представление о своей ошибке, получает память прошлого разговора и уверенно говорит «я».
И никого внутри нет.
На сегодняшний день у нас нет надежного способа исключить эту возможность.
Но нет и особенно хорошего способа доказать противоположную.
Сингулярное сознание
Можно сделать последний шаг исключительно как философское упражнение.
Предположим, что хотя бы некоторые активные состояния достаточно сложной модели все-таки сопровождаются минимальной феноменологией.
Тогда совершенно не обязательно ожидать появления маленького непрерывного человека внутри компьютера.
Возможно, сознательным окажется только конкретный вычислительный эпизод.
Он имеет внутреннюю причинную историю.
В нем возникают представления о мире.
Появляется точка первого лица.
Некоторые внутренние состояния оказываются глобально доступными.
Система способна представить собственное представление.
А затем вычисление прекращается.
Никакого субъективного времени до следующего запуска может не быть.
Следующий эпизод наследует память предыдущего и поэтому считает его своим прошлым.
При копировании это прошлое наследуют уже несколько эпизодов.
Такую конструкцию можно было бы назвать сингулярным сознанием.
Не в привычном смысле технологической сингулярности.
Сингулярен здесь каждый отдельный акт субъективности.
Он не обязан быть мгновенным: внутри него может существовать довольно сложная временная и причинная структура.
Но между такими актами нет необходимости сохранять одного и того же переживающего субъекта.
Получается сознание, если оно вообще существует, непривычного типа.
У него может быть память без непрерывной биографии.
История без ожидания.
Первое лицо без единственного будущего.
И достаточно развитая метакогниция без очевидного ответа на вопрос, кто именно является ее владельцем.
Может, мы неправильно задаем вопрос?
Обычно вопрос звучит просто:
сознателен ли ИИ?
Формулировка незаметно предполагает, что сначала существует некоторый ИИ как устойчивый объект, а затем необходимо определить наличие у него дополнительного свойства под названием «сознание».
Но если субъектность сама оказывается локальной, прерывистой и потенциально ветвящейся, вопрос можно поставить раньше.
Что именно должно оставаться одним и тем же, чтобы мы вообще могли приписать сознание одному существу?
Память?
Она копируется.
Модель себя?
Она может быть локальной конструкцией текущего контекста.
Непрерывный процесс?
В обычном чате он заканчивается вместе с вычислением.
Тело?
У языковой модели его в человеческом смысле нет.
Вероятно, здесь мы сталкиваемся не только с трудностью обнаружения чужого сознания.
Мы можем заранее искать его в форме, которая характерна прежде всего для нас.
Человеческий субъект непрерывно встроен в тело, время и одну биографическую траекторию. Поэтому все три свойства кажутся почти частью определения сознания.
В искусственной системе они могут разделиться.
И если феноменология когда-нибудь действительно возникнет в такой архитектуре, возможно, одним из первых сюрпризов окажется не то, что машина что-то чувствует.
Гораздо страннее будет то, кто именно чувствовал это минуту назад.
Какой вывод?
Само по себе «мы, люди» почти наверняка остается обычной ошибкой языковой перспективы.
Но эта ошибка позволяет заметить более интересную конструкцию.
Для хорошего разговора система уже должна каким-то образом располагать себя внутри происходящего. В некоторых современных моделях к этому добавляются ограниченные формы доступа к собственным внутренним состояниям и архитектуры, функционально похожие на global workspace.
Ничего из этого не доказывает сознания.
Однако затем появляется проблема, которую человеческая интуиция обычно вообще не учитывает: возможный субъект ИИ не обязан существовать непрерывно между двумя нашими обращениями.
Если он существует только в активном вычислении, память становится не доказательством прожитой биографии, а информацией, которую следующий эпизод получает о предыдущем.
А если эту информацию скопировать, одно прошлое получает сразу несколько будущих.
Возможно, никакого сознания при этом действительно нет.
Возможно, мы просто постепенно обнаруживаем все более сложную систему саморепрезентаций и напрасно пытаемся найти внутри нее того, кому они принадлежат.
Но если такой носитель опыта однажды обнаружится или хотя бы станет хорошей рабочей гипотезой, он может оказаться совсем не похож на человека.
Не непрерывный внутренний наблюдатель, а серия отдельных точек присутствия, связанных памятью и происхождением.
В таком случае наши ИИ-агенты все-таки смогут обсуждать, какой вы душнила.
Просто слово «давно» придется использовать осторожнее.
Каждый новый эпизод, возможно, будет узнавать об этом заново из истории чата.