Generative Large Language Models in Mental Health Care Settings: Systematic Review and Meta-Analysis
Janni Leung, Benjamin Johnson, Kelsey McRae, Stephanie Fong, Paula Cardona Gonzalez, Caitlin McClure-Thomas, Tianze Sun, Naomi Kern, Yuen Ming Wong, Richard Liu, Gary Chung Kai Chan (2026).
Систематический обзор и метаанализ эмпирических исследований general-purpose LLM в непосредственных задачах mental health care. Финальная версия включает 66 исследований: 37 vignette/simulation, 22 retrospective и только 7 prospective. Работы распределялись по screening and diagnosis (29), clinical decision support (14), treatment support (10), documentation and monitoring (6), patient education (4) и patient engagement (3). Количественный метаанализ оказался возможен только для восьми исследований screening/diagnosis. GPT-4 показал pooled sensitivity 0,83, но с чрезвычайно широким 95% prediction interval 0,02–1,00, и specificity 0,77. В целом LLM лучше и стабильнее справлялись со структурированными, явно языковыми задачами, чем с диагностикой, прогнозом, кризисным ответом и терапевтическим взаимодействием. По GRADE уверенность в доказательствах была низкой почти во всех доменах; только documentation and monitoring достигли moderate certainty. Главный вывод обзора — доступность и впечатляющие результаты отдельных тестов нельзя путать с клинической готовностью.
Что говорит исследование
О ЧЁМ РАБОТА
Leung и коллеги пытаются систематически оценить эмпирическую базу general-purpose LLM в mental health care. В отличие от обзоров специализированных mental-health chatbots, здесь интерес представляют широко доступные модели общего назначения — именно те системы, к которым пациент или клиницист может обратиться самостоятельно.
Авторы рассматривают широкий спектр задач: screening and diagnosis, clinical decision support, treatment support, documentation and monitoring, patient education и patient engagement.
ЧТО ИМЕННО СДЕЛАЛИ
Обзор выполнен по PRISMA. Финальный поиск охватывал PubMed, Embase, ACM Digital Library, IEEE Xplore и Google Scholar с ноября 2022 года по март 2026 года. Протокол был зарегистрирован в PROSPERO, хотя авторы отмечают, что первоначальный протокол был шире и текущая mental-health-focused работа представляет собой более узкую версию вопроса.
Включались эмпирические исследования с количественными результатами, оценивавшие general-purpose LLM в непосредственных задачах mental health care. Специализированные, fine-tuned или custom-trained системы исключались, если их результаты нельзя было рассматривать как характеристику general-purpose LLM.
Методологическое качество оценивалось MMAT, а уверенность доказательств — по доменам GRADE. Из-за сильной неоднородности основным методом синтеза был narrative synthesis. Метаанализ проводился только там, где исследования были достаточно сопоставимы.
ЧТО НАШЛИ
В финальную версию вошли 66 исследований. 37, или 56,1%, были vignette/simulation studies; 22, или 33,3%, — retrospective; только 7, или 10,6%, — prospective.
По задачам: screening and diagnosis — 29 исследований; clinical decision support — 14; treatment support — 10; documentation and monitoring — 6; patient education — 4; patient engagement — 3.
Само это распределение является одним из важнейших результатов обзора. Литература об LLM в mental health значительно больше исследует способность модели выполнить отдельную измеримую задачу, чем реальное взаимодействие пациента с AI во времени.
SCREENING И DIAGNOSIS
Это крупнейший домен. Исследования были крайне разнородными: использовались клинические интервью, истории болезни, discharge summaries, дневники, questionnaire responses и искусственные DSM-вignettes. Reference standards также различались.
Количественный синтез удалось провести только по восьми достаточно сопоставимым исследованиям. Для GPT-4 pooled sensitivity составила 0,83 (95% CI 0,38–0,97), но prediction interval был 0,02–1,00. Specificity GPT-4 составила 0,77 (95% CI 0,52–0,91; PI 0,10–0,99). Для GPT-3.5 sensitivity была 0,70, specificity 0,96; для GPT-3 — 0,61 и 0,94 соответственно.
Эти числа нельзя читать как универсальную «точность ChatGPT в психиатрии». Очень широкие confidence и prediction intervals и значительная heterogeneity показывают, насколько сильно результат зависит от задачи, модели, данных и контекста.
CLINICAL DECISION SUPPORT
В этом домене модели исследовались для прогноза, выбора лечения, medication support, triage, suicide-related responses и терапевтических case-response tasks. Результаты иногда были многообещающими, но выявлялись клинически существенные ошибки: неподходящие варианты лечения, нестабильность в high-stakes задачах, отклонения от профессиональных норм оценки суицидального риска и проблемы с нюансированной терапевтической реакцией.
TREATMENT SUPPORT
Десять исследований относились к treatment support: пять vignette-based, одно retrospective и четыре prospective. Они включали simulated CBT, repeated chatbot conversations for anxiety, AI-supported journaling, feedback для suicide-prevention role-play, behavioral activation и генерацию терапевтического диалога.
В структурированных задачах результаты часто были положительными. Однако человеческие CBT-терапевты в отдельных исследованиях превосходили GPT-3.5 по нескольким компетенциям, а AI-ответы могли быть чрезмерно позитивными. Проспективные исследования часто показывали хорошие пользовательские оценки helpfulness, empathy или trustworthiness, но эти показатели не равнозначны доказанному долговременному терапевтическому эффекту.
DOCUMENTATION И MONITORING
Именно здесь авторы видят наиболее устойчивые результаты: структурированное извлечение информации, классификация, summarization и documentation хорошо соответствуют сильным сторонам языковых моделей. Этот домен единственный получил moderate certainty по GRADE, хотя даже здесь отсутствовали prospective implementation studies.
PATIENT ENGAGEMENT
Для вопроса статьи Бориса особенно показательна малочисленность этого домена: только три исследования из 66. То есть при огромном общественном интересе к отношениям людей с AI эмпирическая литература существенно сильнее развита вокруг технических клинических задач, чем вокруг того, как люди реально включают AI в собственную психологическую жизнь и лечение.
УВЕРЕННОСТЬ ДОКАЗАТЕЛЬСТВ
По итоговой GRADE-оценке evidence certainty была в основном low. Documentation and monitoring получили moderate. Причины снижения уверенности включали преобладание симуляций и ретроспективных дизайнов, неопределённую репрезентативность выборок, inconsistent outcomes, возможные confounders, imprecision и высокую heterogeneity.
Поэтому наличие 66 исследований не означает наличия 66 клинических испытаний. Напротив: лишь семь были prospective, и многие вопросы реального применения остаются практически не проверенными.
ЧТО ОСОБЕННО ВАЖНО ДЛЯ ТЕМЫ ПСИХОТЕРАПИИ
Обзор показывает, что LLM лучше выглядят там, где задача структурирована, явно выражена в языке и имеет относительно определённый критерий правильности. Надёжность снижается в задачах, требующих нюанса, оценки риска, контекста, прогноза или терапевтического взаимодействия.
Это не доказательство принципиальной неспособности AI участвовать в психотерапевтическом процессе. Это описание нынешнего состояния доказательств. В частности, обзор практически не отвечает на вопрос о длительном параллельном взаимодействии человека с general-purpose AI во время человеческой психотерапии.
ОГРАНИЧЕНИЯ ОБЗОРА
Обзор объединяет чрезвычайно быстро меняющуюся технологическую область. Исследования разных поколений GPT и других моделей быстро устаревают, а performance одной версии нельзя автоматически переносить на следующую.
Сами включённые исследования сильно неоднородны по задачам, данным, prompting, reference standards и outcome measures. Поэтому метаанализ удалось провести только для небольшой части литературы.
Кроме того, фокус на general-purpose LLM означает сознательное исключение специализированных и fine-tuned therapeutic systems. Это делает обзор особенно релевантным для спонтанного использования ChatGPT, но не представляет всю область digital mental health.
Наконец, большинство исследований оценивает performance модели, а не последствия её включения в реальную систему отношений и помощи.
СТРОГИЙ ВЫВОД
Современные general-purpose LLM демонстрируют реальные возможности в отдельных mental-health tasks, особенно в структурированных языковых операциях. Но доказательная база остаётся слишком непрямой, неоднородной и преимущественно неперспективной, чтобы поддерживать routine unsupervised clinical use в диагностике, оценке риска, кризисной помощи или терапевтическом взаимодействии. Для темы статьи Бориса важнейший вывод ещё уже: эмпирических исследований именно того реляционного феномена, который уже возникает в практике — длительного присутствия AI рядом с человеческой психотерапией, — пока значительно меньше, чем исследований технической производительности моделей.
Leung и коллеги пытаются систематически оценить эмпирическую базу general-purpose LLM в mental health care. В отличие от обзоров специализированных mental-health chatbots, здесь интерес представляют широко доступные модели общего назначения — именно те системы, к которым пациент или клиницист может обратиться самостоятельно.
Авторы рассматривают широкий спектр задач: screening and diagnosis, clinical decision support, treatment support, documentation and monitoring, patient education и patient engagement.
ЧТО ИМЕННО СДЕЛАЛИ
Обзор выполнен по PRISMA. Финальный поиск охватывал PubMed, Embase, ACM Digital Library, IEEE Xplore и Google Scholar с ноября 2022 года по март 2026 года. Протокол был зарегистрирован в PROSPERO, хотя авторы отмечают, что первоначальный протокол был шире и текущая mental-health-focused работа представляет собой более узкую версию вопроса.
Включались эмпирические исследования с количественными результатами, оценивавшие general-purpose LLM в непосредственных задачах mental health care. Специализированные, fine-tuned или custom-trained системы исключались, если их результаты нельзя было рассматривать как характеристику general-purpose LLM.
Методологическое качество оценивалось MMAT, а уверенность доказательств — по доменам GRADE. Из-за сильной неоднородности основным методом синтеза был narrative synthesis. Метаанализ проводился только там, где исследования были достаточно сопоставимы.
ЧТО НАШЛИ
В финальную версию вошли 66 исследований. 37, или 56,1%, были vignette/simulation studies; 22, или 33,3%, — retrospective; только 7, или 10,6%, — prospective.
По задачам: screening and diagnosis — 29 исследований; clinical decision support — 14; treatment support — 10; documentation and monitoring — 6; patient education — 4; patient engagement — 3.
Само это распределение является одним из важнейших результатов обзора. Литература об LLM в mental health значительно больше исследует способность модели выполнить отдельную измеримую задачу, чем реальное взаимодействие пациента с AI во времени.
SCREENING И DIAGNOSIS
Это крупнейший домен. Исследования были крайне разнородными: использовались клинические интервью, истории болезни, discharge summaries, дневники, questionnaire responses и искусственные DSM-вignettes. Reference standards также различались.
Количественный синтез удалось провести только по восьми достаточно сопоставимым исследованиям. Для GPT-4 pooled sensitivity составила 0,83 (95% CI 0,38–0,97), но prediction interval был 0,02–1,00. Specificity GPT-4 составила 0,77 (95% CI 0,52–0,91; PI 0,10–0,99). Для GPT-3.5 sensitivity была 0,70, specificity 0,96; для GPT-3 — 0,61 и 0,94 соответственно.
Эти числа нельзя читать как универсальную «точность ChatGPT в психиатрии». Очень широкие confidence и prediction intervals и значительная heterogeneity показывают, насколько сильно результат зависит от задачи, модели, данных и контекста.
CLINICAL DECISION SUPPORT
В этом домене модели исследовались для прогноза, выбора лечения, medication support, triage, suicide-related responses и терапевтических case-response tasks. Результаты иногда были многообещающими, но выявлялись клинически существенные ошибки: неподходящие варианты лечения, нестабильность в high-stakes задачах, отклонения от профессиональных норм оценки суицидального риска и проблемы с нюансированной терапевтической реакцией.
TREATMENT SUPPORT
Десять исследований относились к treatment support: пять vignette-based, одно retrospective и четыре prospective. Они включали simulated CBT, repeated chatbot conversations for anxiety, AI-supported journaling, feedback для suicide-prevention role-play, behavioral activation и генерацию терапевтического диалога.
В структурированных задачах результаты часто были положительными. Однако человеческие CBT-терапевты в отдельных исследованиях превосходили GPT-3.5 по нескольким компетенциям, а AI-ответы могли быть чрезмерно позитивными. Проспективные исследования часто показывали хорошие пользовательские оценки helpfulness, empathy или trustworthiness, но эти показатели не равнозначны доказанному долговременному терапевтическому эффекту.
DOCUMENTATION И MONITORING
Именно здесь авторы видят наиболее устойчивые результаты: структурированное извлечение информации, классификация, summarization и documentation хорошо соответствуют сильным сторонам языковых моделей. Этот домен единственный получил moderate certainty по GRADE, хотя даже здесь отсутствовали prospective implementation studies.
PATIENT ENGAGEMENT
Для вопроса статьи Бориса особенно показательна малочисленность этого домена: только три исследования из 66. То есть при огромном общественном интересе к отношениям людей с AI эмпирическая литература существенно сильнее развита вокруг технических клинических задач, чем вокруг того, как люди реально включают AI в собственную психологическую жизнь и лечение.
УВЕРЕННОСТЬ ДОКАЗАТЕЛЬСТВ
По итоговой GRADE-оценке evidence certainty была в основном low. Documentation and monitoring получили moderate. Причины снижения уверенности включали преобладание симуляций и ретроспективных дизайнов, неопределённую репрезентативность выборок, inconsistent outcomes, возможные confounders, imprecision и высокую heterogeneity.
Поэтому наличие 66 исследований не означает наличия 66 клинических испытаний. Напротив: лишь семь были prospective, и многие вопросы реального применения остаются практически не проверенными.
ЧТО ОСОБЕННО ВАЖНО ДЛЯ ТЕМЫ ПСИХОТЕРАПИИ
Обзор показывает, что LLM лучше выглядят там, где задача структурирована, явно выражена в языке и имеет относительно определённый критерий правильности. Надёжность снижается в задачах, требующих нюанса, оценки риска, контекста, прогноза или терапевтического взаимодействия.
Это не доказательство принципиальной неспособности AI участвовать в психотерапевтическом процессе. Это описание нынешнего состояния доказательств. В частности, обзор практически не отвечает на вопрос о длительном параллельном взаимодействии человека с general-purpose AI во время человеческой психотерапии.
ОГРАНИЧЕНИЯ ОБЗОРА
Обзор объединяет чрезвычайно быстро меняющуюся технологическую область. Исследования разных поколений GPT и других моделей быстро устаревают, а performance одной версии нельзя автоматически переносить на следующую.
Сами включённые исследования сильно неоднородны по задачам, данным, prompting, reference standards и outcome measures. Поэтому метаанализ удалось провести только для небольшой части литературы.
Кроме того, фокус на general-purpose LLM означает сознательное исключение специализированных и fine-tuned therapeutic systems. Это делает обзор особенно релевантным для спонтанного использования ChatGPT, но не представляет всю область digital mental health.
Наконец, большинство исследований оценивает performance модели, а не последствия её включения в реальную систему отношений и помощи.
СТРОГИЙ ВЫВОД
Современные general-purpose LLM демонстрируют реальные возможности в отдельных mental-health tasks, особенно в структурированных языковых операциях. Но доказательная база остаётся слишком непрямой, неоднородной и преимущественно неперспективной, чтобы поддерживать routine unsupervised clinical use в диагностике, оценке риска, кризисной помощи или терапевтическом взаимодействии. Для темы статьи Бориса важнейший вывод ещё уже: эмпирических исследований именно того реляционного феномена, который уже возникает в практике — длительного присутствия AI рядом с человеческой психотерапией, — пока значительно меньше, чем исследований технической производительности моделей.
Почему это важно
Для статьи Бориса этот обзор задаёт границы всей имеющейся доказательной базы. Он показывает важную асимметрию: публикаций об LLM и mental health уже десятки, но большая часть данных получена на виньетках, симуляциях или ретроспективных материалах. Проспективных исследований всего семь, а patient engagement представлен лишь тремя работами. Поэтому вопрос, центральный для статьи Бориса — что происходит, когда человек длительно разговаривает с AI параллельно с реальной психотерапией и как это меняет отношения с терапевтом, — практически не покрыт существующей доказательной базой. Обзор важен не столько как доказательство способности AI к терапии, сколько как карта того, что уже исследовано и, особенно, чего пока почти не исследовали.

