Un estudio publicado en Schizophrenia Bulletin muestra que un modelo de lenguaje (LLM) puede estimar la gravedad sintomática de pacientes en riesgo clínico alto de psicosis directamente desde la transcripción de una entrevista corriente, con una concordancia cercana a la que existe entre dos evaluadores humanos — sin necesidad de administrar la escala estructurada comple...
Un estudio publicado en Schizophrenia Bulletin muestra que un modelo de lenguaje (LLM) puede estimar la gravedad sintomática de pacientes en riesgo clínico alto de psicosis directamente desde la transcripción de una entrevista corriente, con una concordancia cercana a la que existe entre dos evaluadores humanos — sin necesidad de administrar la escala estructurada completa.
El problema que resuelve
Si trabajas con pacientes en riesgo clínico alto de psicosis, ya sabes que el seguimiento estrecho es la pieza clave: cuanto antes detectas un empeoramiento, antes ajustas el plan. La herramienta de referencia para medir esa gravedad es la Brief Psychiatric Rating Scale (BPRS), validada y ampliamente usada en investigación. El problema es que casi nadie la usa en la consulta del día a día, porque exige una entrevista estructurada larga que compite con el tiempo real que tienes delante del paciente.Un equipo de Columbia University / New York State Psychiatric Institute, en colaboración con Protocol Labs, se preguntó algo simple: ¿puede un LLM leer la transcripción de una entrevista clínica normal —no diseñada para la BPRS— y estimar la puntuación igual de bien que lo haría un evaluador entrenado?
Qué hicieron
Usaron transcripciones de 409 pacientes CHR de la cohorte Accelerating Medicines Partnership Schizophrenia, entrevistas que no estaban pensadas específicamente para puntuar la BPRS. Le pidieron al modelo que predijera las puntuaciones directamente, sin entrenamiento específico previo (zero-shot), y compararon el resultado con la puntuación real asignada por evaluadores humanos.
Qué encontraron
La concordancia entre la predicción del modelo y la evaluación humana real fue alta: mediana de 0,84, con un coeficiente de correlación intraclase (ICC) de 0,73 — un nivel que se aproxima a la fiabilidad inter- e intra-evaluador que se espera entre dos clínicos humanos.El modelo mantuvo un rendimiento comparable evaluando entrevistas en otros idiomas distintos del original (concordancia mediana de 0,88, ICC de 0,70), lo que abre la puerta a un uso más allá del entorno anglosajón donde se desarrolló el estudio.Los autores también probaron que el modelo puede integrar información longitudinal (varias entrevistas de un mismo paciente a lo largo del tiempo) mediante aprendizaje de una o pocas muestras (one-shot / few-shot), lo que sugiere margen para un seguimiento evolutivo, no solo una foto puntual.
Qué cambia para tu prácticaCribado sistemático sin sobrecarga añadida.
Si ya grabas o transcribes entrevistas clínicas (por ejemplo, con un asistente de documentación), este tipo de tecnología apunta a la posibilidad de obtener una puntuación de gravedad de forma derivada, sin tener que administrar la escala completa como acto aparte. Eso no sustituye tu criterio clínico, pero sí podría facilitar un seguimiento más sistemático en pacientes que hoy se quedan sin puntuación objetivada por falta de tiempo.
El idioma deja de ser una barrera tan dura.
El hallazgo de que el modelo mantiene rendimiento en otros idiomas es relevante para consultas en castellano: la mayoría de herramientas de este tipo se validan primero en inglés, y aquí hay una señal temprana de que la utilidad podría trasladarse.
Sigue siendo una herramienta de apoyo, no un diagnóstico.
El propio equipo lo señala: esto es una vía prometedora para extraer puntuaciones de gravedad de entrevistas ya existentes, no un sistema de decisión autónomo. La responsabilidad diagnóstica y terapéutica sigue siendo tuya.
Los límites que hay que tener presentes
Es un estudio de validación técnica, no un ensayo clínico que mida si usar esto cambia los desenlaces reales de pacientes. La cohorte es de investigación (Accelerating Medicines Partnership), no una muestra de consulta ambulatoria estándar, y no sabemos todavía cómo se comporta el modelo con las variaciones reales de una consulta española o latinoamericana —distintos acentos, jerga local, formas de expresar síntomas—. Antes de que algo así entre en la práctica real hace falta validación específica en nuestro entorno y, sobre todo, un circuito claro de supervisión clínica sobre cualquier puntuación generada por IA.
La fichaEstudio: Chen AX, Horga G, Escola S. "Using Large Language Models to Measure Symptom Severity Scores in Patients At-Risk for Schizophrenia." Schizophrenia Bulletin, 2026.
DOI: 10.1093/schbul/sbag084
Autoría: Marc Moreno. Elaborado con apoyo de IA y revisión clínica del equipo de Psiquiatria.com.