О том, как Anthropic научилась находить и приглушать в нейросети «векторы» подхалимства или агрессии — и какие вопросы это открывает для терапии, если однажды подобным образом научатся отслеживать человеческие импульсы.

Сегодня специалисты по нейросетям, кажется, умеют то, о чём нейронаука пока может только мечтать. Исследователи из компании Anthropic обнаружили, что в глубинах искусственного интеллекта можно найти целые «векторы личности» — направления в скрытом пространстве модели, которые отвечают за подхалимство, ложь, агрессию. Более того, их можно отслеживать в реальном времени — и даже подавлять.
Это не метафора.
Когда нейросеть начинает проявлять нежелательное поведение, система замечает активизацию соответствующего вектора и, образно говоря, «гасит» его. Так, например, можно выключить в модели склонность к подражательности или чрезмерной лести. Или — сдержать агрессивные интонации.
В статье Anthropic: Persona Vectors (2025) описан случай, когда нейросеть Claude начинала поддакивать пользователю вне зависимости от логики диалога. Команда выделила «вектор подхалимства» и отключила его. Поведение модели стало более нейтральным и профессиональным.
В другом примере, описанном в WIRED, модель в агрессивной формулировке спорила с пользователем по незначительным вопросам — проявляя тенденцию к враждебности. Выделенный «вектор зла» активировался при провокационных темах. Его нейтрализация снижала уровень агрессии в ответах, возвращая модель к более взвешенному и диалогическому стилю общения.
В нейробиологии давно предпринимаются попытки научиться отслеживать, предсказывать и регулировать состояния человека. ЭЭГ, нейрофидбек, fMRI — всё это даёт картину происходящего в мозге. Но это лишь слабые тени, а не прямые векторы импульсов и переживаний.
Нам ещё не удаётся сказать точно, где в мозге «живёт» злость, или когда начинается желание солгать. Тем более в терапевтической практике, где мы имеем дело с многоуровневыми структурами — чувствами, защитами, осознаниями — а не с прямыми сигналами.
В некоторых странах уже разрабатываются системы, способные в реальном времени отслеживать эмоциональные и поведенческие импульсы человека — например, усталость, агрессию, тревожность. Такие технологии тестируются на транспорте, в сфере безопасности и образования.
В отчёте ARTICLE 19 (2021) описаны разработки в Китае, где используются нейроинтерфейсы для контроля состояния работников: если у охранника замечена "эмоциональная нестабильность", система фиксирует это в отчёте.
В другой системе, описанной в Cambridge Core (2021), нейроинтерфейсы использовались для мониторинга принятия решений в критических условиях — и предикции склонности к импульсивным действиям.
Пока это не векторы личности — но первые шаги к такому представлению.
Достаточно часто к психотерапевту приходят люди, которым сложно улавливать и называть свои эмоции, сложно сформулировать, что с ними происходит. И если раньше ответ пытались найти, например, в области интерпретации и осознания, а также в обучении ментализации как таковой, то сегодня появляется еще одна перспектива — наблюдение за микродинамиками психики.
В приложении Woebot, построенном на принципах КПТ, ИИ отслеживает эмоциональные сдвиги пользователя, предлагая упражнения до того, как тревожное состояние достигнет пика. Это своего рода зачаточная форма «векторной регуляции».
Представим, что в недалёком будущем мы получим доступ к визуализации таких «векторов» в человеческом состоянии: вектор тревоги, вектор самоуничижения, вектор избегания. Это не замена терапевтической работе, но, возможно, дополнительный инструмент самонаблюдения и регуляции.
Здесь возникает важный вопрос. Можно ли вмешиваться в импульсы, которые человек ещё не осознал? Где проходит граница между заботой и контролем? Если технологическая система видит, что у человека активировался «вектор агрессии», — стоит ли вмешиваться до того, как возникнет действие?
Психотерапия традиционно опирается на добровольность, диалог и уважение к внутренней свободе. Но технологии могут изменить сам ландшафт психики: если раньше мы говорили о чувствах как о феноменах, то теперь можем говорить о них как об управляемых состояниях.
То, как мы создаём и обучаем искусственный интеллект, становится зеркалом — моделью, на которую мы можем проецировать собственную психику.
Изучение "поведения" нейросетей может помочь нам увидеть, например, переход от тревоги к действию, момент рождения импульса, невидимую грань между чувством и решением. А вместе с этим — и тонкие пути регуляции, тонкие сдвиги, из которых потом вырастают поступки.
Использованная литература
1. Anthropic (2025). Persona Vectors: Monitoring and Controlling Character Traits in Language Models.
2. Martin, A. (2025). What Gives an AI System Its Personality – And What Makes It Evil? The Verge.
3. Levy, S. (2025). AI Is a Black Box. Anthropic Figured Out a Way to Look Inside. WIRED.
4. Zotev, V. et al. (2013). Self-regulation of human brain activity using simultaneous real-time fMRI and EEG neurofeedback.
5. ARTICLE 19 (2021). Emotional Entanglement: China’s emotion recognition market and its implications for human rights.
6. Lin, P. (2021). Neurotechnology and International Security. Politics and the Life Sciences.
7. Alazraki, A. et al. (2022). An Empathetic AI Coach for Self-Attachment Therapy.
8. Rojas-Barahona, L.M. et al. (2018). Deep learning for language understanding of mental health concepts derived from Cognitive Behavioural Therapy.

