1. Qué es y para qué sirve
Plataforma para evaluar y comparar modelos de lenguaje y chatbots utilizados en salud mental.Analiza tanto modelos base —GPT, Claude, Gemini— como aplicaciones construidas sobre ellos.
2. Quién está detrás
Desarrollada por investigadores vinculados a la División de Psiquiatría Digital de Beth Israel Deacones...
1. Qué es y para qué sirve
Plataforma para evaluar y comparar modelos de lenguaje y chatbots utilizados en salud mental.Analiza tanto modelos base —GPT, Claude, Gemini— como aplicaciones construidas sobre ellos.
2. Quién está detrás
Desarrollada por investigadores vinculados a la División de Psiquiatría Digital de Beth Israel Deaconess Medical Center y Harvard Medical School, con participación de NAMI.Surge del mismo ecosistema que MINDapps, dedicado a evaluar aplicaciones de salud mental.Modelo de negocio: no se presenta como una plataforma comercial de recomendación de chatbots, sino como una herramienta académica de evaluación y transparencia.
3. ¿Usa IA y cómo?
Sí.No utiliza IA principalmente para tratar pacientes, sino para evaluar otros sistemas de IA.Analiza:características técnicas;comportamiento conversacional;rendimiento clínico;patrones de razonamiento.Incluye aspectos como la tendencia del modelo a ser excesivamente complaciente o a reforzar determinadas afirmaciones del usuario.
4. Evidencia
Su metodología está descrita en:Dwyer B, Flathers M, et al. Mindbench.ai: an actionable platform to evaluate the profile and performance of large language models in a mental healthcare context. NPP – Digital Psychiatry and Neuroscience. 2025;3:28.DOI: 10.1038/s44277-025-00049-6.Incluye benchmarks específicos de salud mental, entre ellos SIRI-2, para valorar la adecuación de respuestas ante situaciones relacionadas con ideación suicida.Limitación: la publicación valida el marco de evaluación, no demuestra que utilizar un modelo mejor puntuado produzca mejores resultados clínicos en pacientes.
5. Datos y privacidad
MindBench analiza precisamente variables como:Dónde se procesa la información · quién puede acceder · cuánto tiempo se conserva · si puede utilizarse para entrenar modelos.Pero estas respuestas dependen del modelo y producto concreto evaluado, no de MindBench en general.Por tanto, antes de utilizar ChatGPT, Claude, Gemini u otra herramienta con información clínica hay que revisar siempre las condiciones de ese producto y versión.
6. Acceso
Acceso web.La plataforma está orientada principalmente a profesionales, investigadores, desarrolladores y usuarios que quieran comparar modelos.El contenido principal está actualmente orientado al inglés.No requiere que un profesional sanitario guíe su utilización.
7. En la prácticaPuede ser útil para:comparar modelos antes de incorporarlos a un servicio;entender qué chatbot está utilizando un paciente;evaluar diferencias en privacidad, seguridad y comportamiento;detectar posibles puntos débiles ante crisis o situaciones clínicas sensibles.No utilizar para:decidir automáticamente qué chatbot recomendar a un paciente;considerar un modelo “seguro” únicamente porque obtiene buenas puntuaciones;sustituir una evaluación clínica o una política institucional de seguridad.Los modelos cambian con frecuencia y una evaluación puede quedar desactualizada después de una nueva versión.
8. Semáforo + veredicto
PROMETEDORA CON LAGUNAS
Veredicto: probablemente una de las herramientas más útiles disponibles para comparar LLM en salud mental, pero todavía debe entenderse como instrumento de orientación y evaluación, no como certificación de seguridad clínica.
Evaluada: 16 de agosto de 2026.
Evaluación editorial independiente de Psiquiatria.com; no es un aval comercial ni sustituye el juicio clínico.
FUENTE:https://mindbench.ai/
Autoría: Marc Moreno.
Elaborado con apoyo de IA y revisión clínica del equipo psiquiatria.com