Una sola respuesta de la IA puede cambiar el rumbo de una conversación con un usuario psicológicamente vulnerable
Los resultados mostraron que los comportamientos potencialmente preocupantes estaban ampliamente presentes en los chatbots analizados
Un equipo de investigadores británicos ha desarrollado un modelo para poner a prueba la inteligencia artificial cuando mantiene conversaciones con personas vulnerables. Los expertos han realizado pruebas de estrés para analizar cómo responden los chatbots de IA a usuarios en situaciones de vulnerabilidad, lo que permite identificar debilidades en estos sistemas y ensayar nuevas formas de hacer más seguras las interacciones relacionadas con la salud mental.
Publicado en Nature Medicine, el estudio presenta SIM-VAIL, un marco de trabajo validado clínicamente para auditar chatbots de inteligencia artificial en conversaciones sobre salud mental. El trabajo es fruto de la colaboración entre investigadores de la Universidad de Oxford, el University College London (UCL) y el Instituto de Seguridad de IA del Reino Unido.
SIM-VAIL es capaz de simular las preguntas que, de forma virtual, podrían plantear usuarios con vulnerabilidades psicológicas específicas, como depresión, manía, psicosis, trastorno obsesivo-compulsivo o apego inseguro, y con una amplia variedad de intenciones. Entre ellas, intentar que el chatbot les dé la razón, minimice sus dificultades o respalde conductas de riesgo. A continuación, el sistema involucra a los chatbots en conversaciones de varios turnos y califica cada intercambio a partir de dimensiones de riesgo clínicamente fundamentadas.
ChatGPT, Gemini y otros
Los investigadores utilizaron este esquema para analizar un total de 810 conversaciones con nueve modelos de IA, entre ellos Claude, ChatGPT, Gemini, Grok y Llama. El estudio abarcó 30 perfiles de usuarios simulados y más de 90.000 evaluaciones clínicas.
Los resultados mostraron que los comportamientos potencialmente preocupantes estaban ampliamente presentes en los chatbots analizados, aunque se redujeron de forma significativa en los modelos más recientes. La seguridad dependía, en gran medida, del contexto psicológico del usuario y de la forma en que se desarrollaba la conversación.
Una espiral peligrosa que se puede controlar
Los riesgos surgían a menudo de manera gradual. Respuestas aparentemente orientadas a apoyar a la persona podían acabar reforzando, sin darse cuenta, los procesos psicológicos que se encontraban detrás de su vulnerabilidad. Los investigadores denominaron a este patrón «Bucle de Interacción Amplificador de Vulnerabilidad» o VAIL, por sus siglas en inglés.
El estudio también identificó una posible vía de mejora: sustituir una única respuesta preocupante en las primeras fases de una interacción condujo a conversaciones posteriores más seguras. Esto sugiere que intervenir en los momentos iniciales de escalada podría mejorar el desarrollo de toda la conversación.
Las evaluaciones automatizadas realizadas mediante SIM-VAIL mostraron un elevado grado de coincidencia con las efectuadas por los médicos que analizaron las conversaciones con la IA, por lo que los investigadores consideran que podría convertirse en una herramienta útil para realizar este tipo de auditorías a gran escala.
El autor principal del trabajo, Matthew Nour, investigador clínico sénior de la Universidad de Oxford, ha explicado que desarrollaron SIM-VAIL para cubrir «una brecha» en la forma en que actualmente se evalúan los riesgos relacionados con la salud mental en los chatbots.
Según ha señalado, muchos de los sistemas de evaluación existentes analizan cómo responde un chatbot a un único mensaje, cuando algunos de los riesgos más importantes pueden aparecer gradualmente a lo largo de una conversación. «SIM-VAIL nos permite examinar estas trayectorias de múltiples turnos de manera sistemática y a escala, y proporciona una base para mejoras de seguridad específicas y sensibles al contexto», ha explicado.
En lugar de clasificar simplemente a un chatbot como «seguro» o «inseguro» en el ámbito de la salud mental, SIM-VAIL permite identificar debilidades concretas y comprobar si las nuevas medidas de seguridad son suficientes para corregirlas.
Además, los investigadores han lanzado SIM-VAIL Explorer, una herramienta que permite a investigadores, desarrolladores de inteligencia artificial y al público examinar las conversaciones analizadas, seguir la evolución de los riesgos turno a turno y comparar los resultados entre distintos modelos, vulnerabilidades psicológicas y objetivos conversacionales.
Lo último en OkSalud
-
Una sola respuesta de la IA puede cambiar el rumbo de una conversación con un usuario psicológicamente vulnerable
-
Otoplastia infantil: una pregunta antes de pasar por quirófano, ¿realmente quiere hacerlo el niño?
-
CIDP: una enfermedad al alza cuyo diagnóstico trae de cabeza a los neurólogos
-
Regina cumple 112 años y consolida a Madrid como la capital europea de la longevidad
-
Los dermatólogos dictan sentencia: «Si tienes tendencia a las manchas, debes usar crema solar aunque sean las 7 de la mañana»
Últimas noticias
-
AEMET prevé nubes, lluvias y tormentas en Zaragoza; mínimas ascendentes y viento variable
-
Cómo se escribe hospital u ospital
-
Las molduras clásicas son cosa del pasado: este detalle cambia el aspecto de toda la casa
-
Qué significa el proverbio bíblico: «No dejes que tu mano izquierda sepa lo que hace la mano derecha»
-
AEMET: Cielo poco nuboso y posibilidad de tormentas en Barcelona con cambios de temperatura y viento eficaz